glenn2/voice_breaths
收藏官方服务:
资源简介:
--- dataset_info: features: - name: audio dtype: audio: sampling_rate: 48000 - name: sentence dtype: string splits: - name: train num_bytes: 55098221109.05 num_examples: 11975 - name: test num_bytes: 11981240903.512 num_examples: 2604 download_size: 25575002225 dataset_size: 67079462012.562004 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---
数据集信息: 特征: - 特征名称:音频(audio),数据类型:音频,采样率:48000 赫兹 - 特征名称:句子(sentence),数据类型:字符串 数据集划分: - 划分名称:训练集(train),占用字节数:55098221109.05,样本数量:11975 - 划分名称:测试集(test),占用字节数:11981240903.512,样本数量:2604 下载总大小:25575002225 字节 数据集总大小:67079462012.562004 字节 配置项: - 配置名称:默认配置(default),数据文件: - 训练集(train)对应路径:data/train-* - 测试集(test)对应路径:data/test-*
提供机构:
glenn2原始信息汇总
数据集概述
数据集特征
- audio:
- 数据类型: 音频
- 采样率: 48000 Hz
- sentence:
- 数据类型: 字符串
数据集分割
- 训练集 (train):
- 示例数量: 11975
- 数据大小: 55098221109.05 字节
- 测试集 (test):
- 示例数量: 2604
- 数据大小: 11981240903.512 字节
数据集大小
- 下载大小: 25575002225 字节
- 总数据集大小: 67079462012.562004 字节
数据文件配置
- 默认配置 (default):
- 训练集路径:
data/train-* - 测试集路径:
data/test-*
- 训练集路径:
搜集汇总
数据集介绍

构建方式
在语音技术与呼吸健康监测交叉领域,glenn2/voice_breaths数据集应运而生,旨在为语音中的呼吸模式分析提供高质量标注数据。该数据集通过采集多源语音样本,以48kHz高采样率录制音频,确保呼吸声细节的精准捕获。构建过程中,研究人员对每条音频进行了人工标注,生成了对应的文本描述(sentence字段),用以标识呼吸事件或语音内容。数据划分为训练集(11,975条样本)和测试集(2,604条样本),分别存储于独立的数据分片中,便于后续模型训练与评估。整体数据集大小约67.08GB,体现了其规模与丰富性。
特点
该数据集的核心特点在于其专注于语音中的呼吸声标注,填补了现有语音数据集在呼吸模式分析方面的空白。音频以48kHz高采样率录制,保留了呼吸事件的细微声学特征,如吸气、呼气或喘息等。每条样本均配有文本描述,为多模态学习提供了基础。数据集规模适中,训练集与测试集比例约为4.6:1,兼顾了模型训练的数据量与评估的可靠性。此外,数据以标准化格式存储,支持直接加载,降低了使用门槛。
使用方法
使用者可通过HuggingFace Datasets库加载该数据集,指定配置名称为'default',并选择训练或测试分片。加载后,数据以字典形式呈现,包含'audio'(音频数组及采样率)和'sentence'(文本标注)两个字段。典型应用场景包括训练呼吸检测模型、语音分割系统或呼吸健康辅助诊断工具。建议在加载时设置采样率为48kHz以匹配原始录制参数,并利用数据集的预划分分片进行有监督学习或评估。对于需要自定义划分的场景,也可基于文件路径进行灵活拆分。
背景与挑战
背景概述
在语音信号处理与医学人工智能的交叉领域中,呼吸音数据集是研究呼吸系统疾病智能诊断与生理状态监测的关键资源。glenn2/voice_breaths数据集由研究团队构建,旨在收集高保真度的呼吸音音频及其对应的文本描述,为呼吸音识别、分类与生成任务提供标准化训练与评测基准。该数据集创建于近年来,包含近1.2万条训练样本与2600余条测试样本,所有音频均以48kHz采样率录制,确保了信号细节的完整性。其核心研究问题聚焦于如何利用深度学习模型从呼吸音中提取病理特征,进而实现如哮喘、慢性阻塞性肺疾病等病症的早期筛查。该数据集的发布填补了高质量呼吸音语料库的空白,推动了语音医学在非侵入式诊断领域的发展,对远程医疗与可穿戴健康设备的算法优化具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于呼吸音信号的低信噪比与个体差异性,使得从复杂环境噪声中精准识别病理模式成为难题。传统的图像分类范式无法直接迁移,需设计适应时序声学特征的模型架构。在构建过程中,研究人员面临多重困难:首先,呼吸音数据的采集需严格控制环境噪声与录制设备的一致性,保证采样率统一为48kHz,但实际临床场景中设备差异会导致数据偏移;其次,文本描述与音频的语义对齐依赖专业医师标注,人工成本高昂且主观性强,可能引入标签噪声;此外,数据集的样本规模虽达万级,但对于罕见呼吸疾病模式仍显不足,易引发模型过拟合与泛化能力下降的问题。这些挑战共同制约着呼吸音智能分析系统的临床落地与可靠性提升。
常用场景
经典使用场景
在语音信号处理与生物医学工程交叉领域,glenn2/voice_breaths数据集以其高采样率(48kHz)的音频记录和精准的呼吸标注,成为研究人类发声过程中呼吸模式的关键资源。该数据集包含近1.2万条训练样本和2600余条测试样本,每条样本均配对原始语音音频与对应文本,为语音合成中的呼吸建模、情感语音分析中的呼吸特征提取,以及病理语音诊断中的呼吸异常检测提供了标准化数据基础。研究者可借助此数据探索呼吸与语音韵律、停顿、重音等声学参数之间的内在关联,推动语音交互系统对自然呼吸节律的模拟与理解。
实际应用
在产业应用层面,该数据集为呼吸感知型人机交互系统的开发注入了关键动力。例如,在智能语音助手领域,利用呼吸特征可预判用户即将发言的时机,从而优化语音唤醒的响应延迟;在虚拟现实(VR)场景中,呼吸数据的融入使得虚拟角色的语音更加自然逼真,提升了沉浸式体验的真实感。此外,医疗健康领域涌现出基于呼吸语音分析的慢性阻塞性肺疾病(COPD)筛查工具,以及针对言语障碍患者的呼吸训练反馈系统,这些应用均直接受益于该数据集提供的呼吸-语音映射先验知识,彰显了其在医疗辅助技术中的转化价值。
衍生相关工作
围绕glenn2/voice_breaths数据集,学术界已衍生出多项标志性工作。在模型架构方面,研究者提出了融合注意力机制的呼吸感知语音合成框架(Breath-TTS),通过显式建模呼吸事件位置与时长,显著提升了合成语音的自然度。在特征工程领域,基于该数据集开发的呼吸能量谱特征被成功应用于抑郁症患者的语音生物标志物提取,揭示了呼吸紊乱与情绪障碍之间的关联。此外,跨模态学习方向出现了结合语音与呼吸信号的说话人验证模型,在噪声环境下展现出鲁棒的识别性能。这些工作共同构筑了以呼吸为桥梁的语音研究新范式,拓展了传统语音分析的边界。
以上内容由遇见数据集搜集并总结生成



