遇见数据集

ccmusic-database/chest_falsetto

收藏
Hugging Face2026-02-27 更新2024-03-04 收录
官方服务:

资源简介:

原始数据集包含1280个单声道唱歌音频文件,格式为.wav,采样率为22,050 Hz,由中央音乐学院声乐专业的学生录制和注释。胸声标记为chest,假声标记为falsetto。此外,数据集还包括每个音频段的Mel频谱图、Mel频率倒谱系数(MFCC)和频谱特征,总共有5,120个CSV文件。原始数据集未区分男女声音,但通过手动审查添加了性别注释。除了原始内容外,还提供了评估期间的预处理版本,详细内容见第IV节。这种方法也应用于尚未评估的两个后续分类数据集:音乐流派数据集、美声唱法与中国民族唱法数据集。

The original dataset contains 1280 mono singing audio files in .wav format, with a sampling rate of 22,050 Hz, recorded and annotated by students majoring in vocal music at the Central Conservatory of Music. Chest voice is labeled as "chest", while falsetto is labeled as "falsetto". Additionally, the dataset includes Mel spectrograms, Mel-frequency cepstral coefficients (MFCCs), and spectral features for each audio segment, totaling 5,120 CSV files. The original dataset did not distinguish between male and female voices, but gender annotations were added via manual review. In addition to the raw content, a preprocessed version used during evaluation is provided, with detailed descriptions available in Section IV. This methodology was also applied to two subsequent classification datasets that have not yet been evaluated: the music genre classification dataset, and the dataset for bel canto versus Chinese folk vocal music.

提供机构:
ccmusic-database
原始信息汇总

数据集概述

名称: Chest voice and Falsetto Dataset 描述: 该数据集包含1,280个单声道歌唱音频文件,格式为.wav,采样率为22,050 Hz,由中央音乐学院声乐专业的学生演唱、录制并标注。音频文件分为胸声和假声两类,分别标记为_chest_和_falsetto_。此外,数据集还包括每个音频片段的Mel频谱图、Mel频率倒谱系数(MFCC)和频谱特性,总计5,120个CSV文件。为了更准确地识别胸声和假声技巧,数据集经过细致的手动审查并添加了性别标注。

数据集内容

  • 音频文件: 1,280个.wav文件,分为胸声和假声。
  • CSV文件: 5,120个,包含Mel频谱图、MFCC和频谱特性。
  • 性别标注: 通过手动审查添加。

数据集版本

  • 原始版本: 包含未处理的音频文件和相关特性。
  • 预处理版本: 音频片段被分割成0.25秒,转换为Mel、CQT和Chroma频谱图,格式为.jpg,总计8,974个文件。每个文件包含胸声/假声标签和性别标签。

数据集结构

  • Eval Subset: 包含Mel、CQT和Chroma频谱图,以及胸声/假声和性别标签。
  • Raw Subset: 包含音频文件、Mel频谱图、胸声/假声和性别标签。

数据集用途

  • 任务: 音频分类、歌唱方法分类、声音分类。
  • 应用: 用于歌唱相关的任务,如歌唱性别分类或胸声和假声声音分类。

数据集维护

  • 许可证: MIT License
  • 维护者: Zijin Li

数据集创建

  • 采集理由: 缺乏胸声和假声的数据集。
  • 源数据: 由中央音乐学院的学生提供。
  • 标注过程: 由中央音乐学院的学生进行音频标注。

使用注意事项

  • 社会影响: 促进音乐行业中AI的发展。
  • 偏见讨论: 仅限于胸声和假声。
  • 已知限制: 录音被切割成过短的片段,CQT频谱列存在频谱泄漏问题。
搜集汇总
数据集介绍
ccmusic-database/chest_falsetto 数据集图片
构建方式
胸声与假声数据集源自中国音乐学院声乐专业学生录制的1,280份单声道歌唱音频文件(.wav格式),原始数据中胸声标记为“chest”,假声标记为“falsetto”,并包含梅尔频谱图、梅尔频率倒谱系数及频谱特征等共计5,120份CSV文件。为弥补原始数据未区分性别的缺陷,研究团队通过人工审校补充了性别标注,进而构建了默认子集。在此基础上,为验证集成数据集的有效性,进一步从默认子集中衍生出评估子集,该子集将音频片段切分为0.25秒的短时窗,并转换为梅尔频谱、常数Q变换频谱和色度频谱的.jpg图像格式,最终生成8,974份数据条目,按8:1:1比例划分为训练集、验证集和测试集。
使用方法
数据集通过HuggingFace的datasets库实现便捷加载,用户可调用load_dataset函数指定子集名称(default或eval)及数据切分(train、validation、test)。默认子集可直接获取音频波形、梅尔频谱图及多级标签;评估子集则提供梅尔频谱、常数Q变换频谱和色度频谱的三通道图像特征,适用于基于视觉特征的分类模型。数据集支持基于PyTorch或TensorFlow框架的音频分类任务开发,尤其适用于歌唱性别分类与胸声/假声识别等场景。用户亦可从ModelScope镜像站点获取数据,或通过Git LFS克隆仓库进行本地化管理。
背景与挑战
背景概述
在歌唱声学与音乐信息检索领域,胸声与假声的精准分类是声乐技术分析、音乐教育智能化及歌唱合成系统构建中的关键瓶颈。胸声与假声作为人类发声机制中两种截然不同的模式,其区分不仅依赖于音高与音色差异,更与性别特征紧密交织,然而现有公开数据集多未系统标注性别信息,导致模型在跨性别场景下泛化能力受限。为弥补这一空白,中国音乐学院声乐专业师生于2021年创建了Chest voice and Falsetto Dataset,由刘兆瑞、周莫南等研究人员主导采集与标注,李梓金负责数据集整合与评估。该数据集包含1,280段单声道歌唱音频,并额外提供了梅尔频谱图、CQT频谱图及色度图等声学特征,旨在为歌唱性别分类与胸-假声识别任务提供标准化基准,推动人工智能在音乐产业中的落地应用。
当前挑战
该数据集的核心挑战可归纳为双重维度。其一,在领域问题层面,胸声与假声的声学边界模糊,尤其在音高过渡区域易产生混淆,且不同性别的声带生理结构差异进一步加剧了分类难度——男性胸声与女性假声在频谱能量分布上可能存在重叠,传统基于单一特征的方法难以鲁棒解耦。其二,在构建过程中,原始数据集未区分性别,需通过人工复核补全标注,这引入了主观偏差风险;同时,音频被切分为0.25秒的极短片段,导致CQT频谱存在泄露问题,且过短的时间窗口难以捕捉发声模式的动态演化特征,可能限制模型对持续发声状态的建模能力。此外,数据规模有限(仅1,280条样本),对深度学习模型的训练与泛化构成显著制约。
常用场景
经典使用场景
在声乐艺术与计算音乐学交叉领域,ccmusic-database/chest_falsetto数据集为胸声与假声的自动辨识提供了基准资源。其经典使用场景聚焦于基于音频信号与频谱特征的歌唱技法分类任务,研究者可借助该数据集训练模型以区分男声与女声在不同发声模式下的声学差异。数据集包含1280条单声道歌唱音频及对应的梅尔频谱图、CQT与色度图等多模态视觉表征,支持四分类标签(男胸声、女胸声、男假声、女假声)及性别与技法二分类标签,从而为构建高鲁棒性的声乐分类器奠定数据基础。
解决学术问题
该数据集直面声乐研究领域中胸声与假声标注数据匮乏的学术困境,系统性地解决了性别因素对发声技法声学特征混淆的关键问题。通过人工复核补充性别标注,它使研究者能够量化分析不同性别在胸声与假声转换中的频谱能量分布、共振峰偏移及谐波结构差异,进而推动歌唱发声机制的客观建模。这一工作不仅为计算音乐学提供了标准化评测基准,更深化了对人声生理学与声学特征耦合关系的理解,在音乐信息检索与语音科学交叉研究中具有里程碑意义。
实际应用
在实际应用层面,该数据集为智能音乐教育系统与虚拟声乐教练的开发注入了核心驱动力。基于该数据训练的模型可实时分析歌唱者的发声类型,提供胸声与假声切换的精准反馈,辅助声乐学习者纠正技法偏差。此外,它还可嵌入数字音频工作站与音乐制作软件,自动标注人声轨道的发声模式,提升混音与后期处理效率。在语音合成领域,该数据助力生成更富表现力的歌唱合成系统,通过控制胸声与假声参数实现自然的情感化演唱效果。
数据集最近研究
最新研究方向
在声乐艺术与人工智能交叉领域,胸声与假声的精准区分一直是音乐信息检索中的前沿挑战。ccmusic-database/chest_falsetto数据集应运而生,它由1280段单声道演唱音频构成,并创新性地引入了性别标注,将传统的二分类任务拓展为包含男声胸声、女声胸声、男声假声、女声假声的四分类体系。该数据集不仅提供了梅尔频谱图、CQT和色度图等多模态声学特征,还通过标准化分割为训练、验证和测试集,为歌唱性别分类与发声技法识别提供了坚实的基准。这一资源的发布,有望推动声乐教学智能化评估、虚拟歌手音色合成等热点应用的发展,在音乐科技领域具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务