Broad Sound Dataset (BSD10k)
收藏资源简介:
Broad Sound Dataset (BSD10k) 是由音乐技术组,庞培法布拉大学创建的一个包含10,000个声音样本的数据集。该数据集与Broad Sound Taxonomy (BST)的第二级类别对齐,涵盖了音乐、乐器样本、语音、音效和声景等28个类别。数据集的创建过程包括从Freesound网站获取声音样本,并通过手动注释确保准确性和多样性。BSD10k旨在解决异质声音分类问题,适用于机器听觉、声音分析和检索等多个领域。
Broad Sound Dataset (BSD10k) is a dataset containing 10,000 audio samples, created by the Music Technology Group at Pompeu Fabra University. This dataset is aligned with the second-level categories of the Broad Sound Taxonomy (BST), covering 28 categories including music, musical instrument samples, speech, sound effects and sound scenes. The dataset was constructed by acquiring audio samples from the Freesound website, and ensured accuracy and diversity through manual annotation. BSD10k aims to address the problem of heterogeneous sound classification, and is applicable to multiple fields such as machine hearing, sound analysis and retrieval.
BSD10k 数据集概述
数据集简介
BSD10k 数据集是 Broad Sound Dataset (BSD) 的初始版本,包含约 10,000 个标注声音,与 BST 分类法的第二级类别对齐。
数据集特征
- 音频数量: 10,309 个音频片段
- 总时长: 32.5 小时
- 音频格式: 单标签音频,每个音频最长 30 秒
- 标注方式: 人工手动标注
- 分类类别: 23 个类别,对应 BST 分类法的第二级类别
- 元数据文件: BSD10k_metadata.csv,包含音频的训练和测试集划分、许可证信息、标签和标题
- 类别分布: 类别间音频数量不均等
分类法
Broad Sound Taxonomy (BST) 将声音组织成一个两级层次结构,包含 5 个顶级类别和 23 个第二级类别。分类法旨在广泛、全面地分类各种声音,并易于使用。
音频数据
- 原始文件: 从 Freesound 下载
- 标准化格式: 44.1 kHz 16-bit 单声道音频文件,超过 30 秒的音频被裁剪
- 下载链接: 下载 BSD10k 数据集
许可证
- 整体许可证: CC-BY
- 单个音频许可证: 每个音频文件的许可证由上传者在 Freesound 定义,可能包括 CC0、CC-BY、CC-BY-NC、CC Sampling+ 等
- 许可证分布:
- CC0: 3,187
- CC-BY: 5,534
- CC-BY-NC: 1,192
- CC Sampling+: 396
- 元数据文件: BSD10k_metadata.csv 中包含每个音频的许可证信息




