遇见数据集

esc-benchmark/esc-datasets

收藏
Hugging Face2022-10-14 更新2024-03-04 收录
官方服务:

资源简介:

ESC数据集是一个包含八个子数据集的集合,主要用于自动语音识别(ASR)任务。每个数据点包含音频文件路径、音频数组、采样率和转录文本。数据集通过Hugging Face Datasets库进行加载和使用,音频和转录文件可以直接用于训练和评估脚本。数据集包括LibriSpeech、Common Voice、VoxPopuli、TED-LIUM、GigaSpeech、SPGISpeech、Earnings-22和AMI等子数据集,涵盖了从有声读物、政治演讲、TED演讲到公司财报电话会议等多种语音数据。每个子数据集都有详细的训练、验证和测试划分,并且部分数据集还提供了不同大小的训练子集。

The ESC Dataset is a collection of eight sub-datasets primarily designed for automatic speech recognition (ASR) tasks. Each data point contains the audio file path, audio array, sampling rate, and transcribed text. The dataset can be loaded and utilized via the Hugging Face Datasets library, and its audio and transcript files can be directly used for training and evaluation scripts. The dataset includes sub-datasets such as LibriSpeech, Common Voice, VoxPopuli, TED-LIUM, GigaSpeech, SPGISpeech, Earnings-22 and AMI, covering diverse types of speech data including audiobooks, political speeches, TED talks, corporate earnings conference calls and more. Each sub-dataset has well-defined training, validation and test splits, and some of the sub-datasets also offer training subsets of different sizes.

提供机构:
esc-benchmark
原始信息汇总

数据集概述

名称: ESC-datasets

语言: 英语(en)

语言创建方式: 众包(crowdsourced)和专家生成(expert-generated)

许可证:

  • CC-BY-4.0
  • Apache-2.0
  • CC0-1.0
  • CC-BY-NC-3.0
  • 其他(other)

多语言性: 单语(monolingual)

大小分类:

  • 100K<n<1M
  • 1M<n<10M

源数据集:

  • 原始(original)
  • 扩展自Librispeech_ASR(extended|librispeech_asr)
  • 扩展自Common_Voice(extended|common_voice)

标签:

  • ASR
  • 基准测试(benchmark)
  • 语音(speech)
  • ESC

任务类别: 自动语音识别(automatic-speech-recognition)

数据集内容

数据字段:

  • dataset: 样本来源的ESC数据集名称。
  • audio: 包含音频文件路径、解码后的音频数组及采样率的字典。
  • text: 音频文件的转录文本。
  • id: 数据样本的唯一标识符。

数据准备:

  • 音频: 所有ESC数据集的音频已分割成适合训练ASR系统的样本长度,无需额外准备。
  • 转录文本: 转录文本已进行必要的错误校正,无需额外处理。

访问与使用

访问: 所有八个ESC数据集均可通过Hugging Face Datasets库下载和准备。

特定数据集的使用条款: 使用Common Voice、GigaSpeech和SPGISpeech这三个数据集前,需同意特定的使用条款,并通过各自的数据集页面填写访问表单。

数据集示例

加载数据集: python from datasets import load_dataset

librispeech = load_dataset("esc-benchmark/esc-datasets", "librispeech", split="train")

数据点示例: python { dataset: librispeech, audio: {path: /path/to/audio.flac, array: [...]}, text: Transcription text here, id: unique_id }

搜集汇总
数据集介绍
构建方式
在自动语音识别(ASR)领域,多样化的高质量数据集是推动模型性能提升的基石。esc-benchmark/esc-datasets 数据集集成了八个广泛使用的英文语音语料库,包括 LibriSpeech、Common Voice、VoxPopuli、TED-LIUM、GigaSpeech、SPGISpeech、Earnings-22 和 AMI。这些数据集源自不同的真实场景,如有声读物、众包录音、议会演讲、TED 演讲、播客、财报电话会议及会议记录,覆盖了从专业朗读到自然对话的多样化语音风格。每个子数据集均经过统一的预处理流程:音频被分割为适合 ASR 训练的样本长度,转录文本执行了必要的错误校正(如移除未知标记、转换符号标点),最终通过 Hugging Face Datasets 库以标准化格式封装,用户仅需一行代码即可完成下载与加载。
特点
该数据集集成的核心特色在于其跨领域、跨条件的广泛覆盖与高度标准化。八个子数据集囊括了超过万小时的语音数据,样本规模从十万级到千万级不等,充分满足了从学术研究到工业级 ASR 系统的训练需求。音频数据以 16kHz 采样率存储,并自动解码为 NumPy 数组,转录文本则采用统一的错误校正格式,确保了数据即用性。此外,数据集保留了元信息(如来源数据集名称、唯一样本 ID),便于溯源与分析。特别值得注意的是,测试集故意不提供转录,要求用户通过官方平台提交预测结果进行评分,从而构建了一个公平、可复现的基准评测体系。
使用方法
使用该数据集极为便捷,依托 Hugging Face Datasets 库,用户可通过 load_dataset("esc-benchmark/esc-datasets", "dataset_name", split="split") 直接加载指定子集。例如,加载 LibriSpeech 训练集仅需指定参数为 "librispeech" 与 "train"。对于包含子配置的数据集(如 GigaSpeech),可通过 subconfig 参数选择特定大小的训练子集(如 "xs" 或 "xl")。访问数据样本时,建议优先通过索引定位样本(如 dataset[0]["audio"]),以避免批量解码大量音频文件带来的性能开销。部分数据集(如 Common Voice、GigaSpeech、SPGISpeech)需要用户事先在原始页面注册并同意使用条款,加载时需传入 use_auth_token=True 以通过授权验证。
背景与挑战
背景概述
在自动语音识别(ASR)领域,数据集的多样性与标准化是推动模型性能突破的关键基石。ESC-Benchmark/ESC-Datasets由ESC基准团队于近年创建,旨在整合多个权威开源语音数据集,构建一个统一、高效的评估平台。该集合囊括了LibriSpeech、Common Voice、VoxPopuli、TED-LIUM、GigaSpeech、SPGISpeech、Earnings-22及AMI等八个经典语料库,覆盖了从朗读式音频、会议记录到多语种众包语音的广泛场景。核心研究问题在于如何通过标准化的数据加载与预处理流程,降低研究者在多数据集间迁移的门槛,从而加速ASR系统的迭代与横向对比。该数据集凭借其单行代码即可获取全部资源的便捷性,已成为学术界与工业界评估语音识别模型的重要基准,显著提升了相关实验的可复现性与可比性。
当前挑战
ESC-Datasets所面对的领域挑战在于ASR系统对多样化声学环境、口音及语体的泛化能力,例如LibriSpeech的朗读风格与AMI会议中的自然对话在韵律和噪声上存在显著差异,而Common Voice的众包数据则引入了非标准录音条件。构建过程中的挑战则更为复杂:首先,需协调八个来源各异的数据集,其许可协议涵盖CC-BY-4.0、Apache-2.0乃至需单独授权的Kensho协议,确保合规访问成为工程难点;其次,各数据集原始格式与切分粒度不一,需统一音频采样率、转录文本的纠错格式(如移除<unk>标记),并保留测试集标签以支持在线评分;此外,部分数据集如GigaSpeech和SPGISpeech提供了多级子集(如xs、s、m、l),需在单一接口中灵活支持动态子配置加载,这对数据流水线的设计提出了高要求。
常用场景
经典使用场景
ESC基准数据集(ESC Benchmark Datasets)汇聚了八个经典且广泛使用的英文语音识别语料库,包括LibriSpeech、Common Voice、VoxPopuli、TED-LIUM、GigaSpeech、SPGISpeech、Earnings-22和AMI Meeting Corpus。该数据集最经典的使用场景是作为自动语音识别(ASR)系统的标准化评测平台。研究人员可通过Hugging Face Datasets库以单行代码加载任意子集,直接获取已分段的音频文件与经过错误校正的转录文本,从而在统一的预处理流程下快速开展模型训练与性能评估。这种高度集成的设计极大地简化了多数据集对比实验的复杂性,使得跨语料库的泛化能力分析成为可能。
实际应用
在实际应用中,ESC数据集为智能语音助手、自动字幕生成、会议纪要转录、客服语音分析等产品提供了坚实的训练与测试基础。例如,GigaSpeech和SPGISpeech分别覆盖播客、有声书与企业财报电话会议场景,能够帮助模型适应非正式口语与专业金融术语;Common Voice与VoxPopuli则通过收录不同国籍、口音及录音条件的语音,增强了系统在全球化部署中的包容性。AMI Meeting Corpus的多设备同步录音特性,进一步支撑了多人对话场景下的说话人分离与语义理解技术落地。这些数据集的联合使用,有效提升了语音识别系统在真实世界复杂声学环境中的实用性与可靠性。
衍生相关工作
ESC数据集衍生了一系列具有影响力的经典研究工作。在模型层面,基于该基准的Wav2Vec 2.0、HuBERT等自监督学习框架通过大规模无标注预训练,在LibriSpeech等子集上取得了词错误率的显著突破。在评估方法层面,研究者利用ESC的统一接口提出了更精细的细粒度分析指标,如针对不同口音、信噪比或语速的分层评测。此外,该数据集还催生了多任务联合训练范式,例如将ASR与说话人识别、情感分析相结合,以及面向低资源场景的迁移学习与数据增强策略。这些工作共同推动了语音技术从实验室环境向开放域应用的跨越式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务