遇见数据集

ccmusic-database/pianos

收藏
Hugging Face2025-04-05 更新2024-03-04 收录
官方服务:

资源简介:

Piano Sound Quality Dataset包含12个全范围音频文件和1,320个分割的单声道音频文件,总计1,332个文件。此外,还包括一个包含29位有音乐背景的参与者对钢琴音质进行主观评估的评分表。数据集扩展后包含2,020个音频文件,并通过数据增强生成了18,745个Mel频谱图切片。数据集支持钢琴音质分类和音高检测任务,主要用于开发钢琴音质评分应用。

Piano Sound Quality Dataset contains 12 full-range audio files and 1,320 segmented mono audio files, with a total of 1,332 files. In addition, it includes a rating sheet with subjective evaluations of piano sound quality from 29 participants with musical backgrounds. The expanded dataset contains 2,020 audio files, and 18,745 Mel spectrogram slices generated via data augmentation. This dataset supports piano sound quality classification and pitch detection tasks, and is mainly used for developing piano sound quality scoring applications.

提供机构:
ccmusic-database
原始信息汇总

数据集概述

数据集名称: Piano Sound Quality Dataset 数据集别名: 钢琴音质数据集

数据集详细信息

  • 许可: MIT
  • 任务类别: 音频分类、图像分类
  • 语言: 英语
  • 标签: 音乐、艺术
  • 数据集大小: 10K<n<100K

数据集内容

  • 原始数据集: 包含12个全范围音频文件,格式为.wav/.mp3/.m4a,代表7种钢琴模型。此外,还有1,320个分割的单声道音频文件,总文件数为1,332。还包括一个.xls格式的评分表,包含29名具有音乐背景的参与者提供的主观钢琴音质评估。
  • 扩展数据集: 由于需要增加数据集大小且缺少流行的钢琴品牌Yamaha,数据集通过录制立式Yamaha钢琴进行扩展,共包含2,020个音频文件。数据增强后,原始音频转换为Mel频谱图,并切割成0.18秒的片段,共产生18,745个频谱图切片。

数据集结构

  • 评估子集: 包含Mel频谱图(.jpg格式,0.18秒,48000Hz)、8类标签和88类音高。
  • 原始子集: 包含音频文件(.wav格式,22050Hz)、Mel频谱图(.jpg格式,22050Hz)、8类标签和88类音高。

数据集使用

  • 加载数据集: 使用load_dataset函数加载数据集,支持训练、验证和测试集的访问。

数据集创建

  • 采集和标注: 由CCMUSIC和CCOM的学生录制不同钢琴声音并进行标注,随后进行主观音质评估。
  • 数据来源: 数据由Zhaorui Liu, Shaohua Ji, Monan Zhou收集和标准化。
  • 标注者: CCMUSIC和CCOM的学生。

数据集考虑因素

  • 社会影响: 有助于开发钢琴音质评分应用。
  • 偏见和限制: 仅限于钢琴,存在数据不平衡问题。

附加信息

  • 数据集维护者: Zijin Li
  • 评估研究: 使用数据集进行钢琴音质全面评估的研究。
  • 许可证: MIT许可证,允许自由使用、复制、修改、合并、发布、分发、转授和/或出售软件副本。

贡献

提供了一个用于钢琴音质研究的数据集。

搜集汇总
数据集介绍
ccmusic-database/pianos 数据集图片
构建方式
在音乐声学与乐器音色分析领域,钢琴音质评估长期缺乏大规模标准化数据集。本数据集基于CCMusic数据库构建,初始收录七款钢琴型号(包括珠江、英昌、施坦威T、星海、卡瓦依立式及三角钢琴等)的12段全音域音频及1320段分割单音音频,并附带29位音乐背景受试者的主观评分表。为扩充样本规模并纳入雅马哈这一主流品牌,研究团队对雅马哈立式钢琴进行额外录制,形成8类子集。针对深度学习模型对数据量的需求,进一步将原始音频转化为梅尔频谱图,并依据经验参数切分为0.18秒的短片段,最终生成包含18352个频谱切片的评估子集。数据集划分为default、8_class和eval三个配置,均按80%、10%、10%比例分配训练、验证与测试集。
使用方法
使用者可通过HuggingFace Datasets库便捷加载,指定配置名称(default/8_class/eval)与数据划分(train/validation/test)即可获取数据。每条记录以字典形式返回,包含audio(音频数组及采样率)、mel(PIL图像对象)、label(品牌索引)、pitch(音高索引)、bass_score/mid_score/treble_score/avg_score(音质评分浮点数)等字段。推荐用于训练钢琴音质分类模型、音高识别系统或音质评分回归器。由于数据已通过学术论文验证,特别适合作为乐器音质评估研究的基准数据集,也可结合论文中的评价方法复现实验或进行模型对比。
背景与挑战
背景概述
钢琴作为音乐艺术的核心乐器,其音质评价长期依赖于主观听觉判断,缺乏客观、可量化的标准。为填补这一空白,ccmusic-database/pianos数据集由中央音乐学院(CCOM)及CCMUSIC团队的研究人员于2023年创建,核心研究者包括周默南、吴尚达、纪少华、李紫金和李伟。该数据集聚焦于钢琴音质分类这一核心研究问题,旨在通过机器学习方法实现钢琴品牌与型号的自动识别,进而推动音质评估的自动化进程。数据集收录了珠江、英昌、施坦威、星海、卡瓦依、雅马哈等七个主流品牌及型号的钢琴录音,涵盖全音域单音音频及梅尔频谱图,并附有29名音乐背景参与者提供的主观评分。该数据集的出现,为音频分类与音乐信息检索领域提供了标准化基准,对钢琴制造质量评估、音乐教育及智能乐器识别等应用具有重要推动作用。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:钢琴音质分类任务中,不同品牌钢琴的音色差异微妙,且同一品牌不同型号间可能存在重叠特征,使得基于传统声学特征或简单深度学习模型的分类精度受限。此外,数据集构建过程中遭遇多重困难:原始录音需在控制环境条件下采集,以保证音频一致性,但施坦威等品牌的黑键音频缺失导致数据不完整;数据规模有限,默认子集仅580个样本,需通过数据增强(如将音频切分为0.18秒的梅尔频谱片段)扩充至18,352个样本,但片段时长过短可能丢失时序信息;类别分布不均衡,部分品牌样本量显著少于其他品牌,易导致模型偏向多数类。这些挑战共同制约着模型泛化能力与音质评估的可靠性。
常用场景
经典使用场景
在音乐声学与人工智能交叉领域,ccmusic-database/pianos 数据集为钢琴音色质量分类任务提供了标准化基准。该数据集包含来自珠江、雅马哈、施坦威等七个(或八个)品牌钢琴的录音片段,并提供了对应的梅尔频谱图与主观评分标签。研究者可基于音频特征或视觉特征(如频谱图)构建分类模型,实现对不同钢琴品牌音质差异的自动判别。其经典使用方式涵盖多类别音色分类、音高检测以及音质主观评分的回归预测,是乐器音色分析中兼具规模与标注质量的代表性资源。
解决学术问题
该数据集解决了钢琴音色质量研究中长期缺乏公开、结构化标注数据的关键瓶颈。传统研究多依赖小规模主观听感实验,难以支持机器学习模型的稳健训练。通过提供多品牌、多音高、带主观评分(低音、中音、高音及平均分)的音频与频谱图,该数据集使得音质分类、音高识别以及评分预测等学术问题得以在统一框架下进行量化研究。其贡献在于弥合了主观听觉评价与客观计算分析之间的鸿沟,推动了音色感知建模与乐器声学评估的实证进展。
实际应用
在实际应用中,该数据集为钢琴制造、音乐教育与数字乐器开发提供了技术支撑。基于其训练的自动音质评分模型可用于钢琴出厂质量检测,帮助制造商快速评估产品音色一致性;在音乐教学场景中,系统可辅助学习者辨别不同钢琴的音色差异,提升听觉训练效率。此外,该数据集还可用于开发智能录音设备中的乐器品牌识别功能,或集成至音乐推荐系统,根据用户对音色的偏好匹配合适的钢琴录音,具有显著的产业转化潜力。
数据集最近研究
最新研究方向
钢琴音质评估的多模态与细粒度分类研究正成为音乐信息检索领域的前沿热点。ccmusic-database/pianos数据集通过收录珠江、雅马哈、施坦威等八大主流品牌钢琴的完整音域录音,并结合梅尔频谱图与主观评分表,为音质自动评分系统提供了标准化基准。当前研究聚焦于利用深度学习模型从短时频谱片段中提取声学特征,实现品牌识别与音质等级预测,同时探索音高检测与低音、中音、高音分区评分的联合建模。该数据集的发布填补了钢琴音质量化评估的空白,推动了音乐声学与人工智能的交叉应用,有望为乐器制造、音乐教育及虚拟乐器开发提供客观评测工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务