MASC-Arabic
收藏资源简介:
MASC是一个包含1000小时、采样率为16 kHz的阿拉伯语音数据集,这些数据是从700多个YouTube频道爬取的。数据集是多地区、多类型、多方言的,旨在推动阿拉伯语音技术的研究和开发,特别是阿拉伯语音识别。数据集包含训练集、验证集和测试集,每个数据点包括视频ID、持续时间、文本、类型(干净或嘈杂)和音频信息。
MASC is a 1,000-hour Arabic speech dataset with a sampling rate of 16 kHz, which was crawled from over 700 YouTube channels. This dataset covers multiple regions, diverse content types and various Arabic dialects, aiming to promote the research and development of Arabic speech technologies, with a particular focus on Arabic speech recognition. The dataset is split into training, validation and test sets, and each data point includes video ID, duration, transcript text, audio type (clean or noisy) and audio information.
MASC Arabic 数据集概述
数据集基本信息
- 数据集名称:MASC Arabic
- 主页:https://ieee-dataport.org/open-access/masc-massive-arabic-speech-corpus
- 论文:https://ieeexplore.ieee.org/document/10022652
- 语言:阿拉伯语 (ar)
- 任务类别:自动语音识别、文本到语音
数据集内容摘要
MASC 是一个包含 1000 小时、采样率为 16 kHz 的语音数据集,数据爬取自超过 700 个 YouTube 频道。该数据集具有多区域、多类型、多方言的特点,旨在推动阿拉伯语语音技术的研究与开发,尤其侧重于阿拉伯语语音识别。
数据集结构
数据字段
- video_id:音频来源视频的标识符。
- duration:音频片段的持续时间(秒)。
- text:音频片段对应的文本。
- type:数据集类型标识,
c表示干净数据,n表示含噪数据。 - audio:音频数据,包含数组和 16000 Hz 的采样率。
数据划分
数据集被划分为训练集、验证集和测试集。各划分均包含干净和含噪数据,可通过 type 字段区分。
- 训练集:875,873 个样本,约 199.91 GB。
- 验证集:19,521 个样本,约 4.80 GB。
- 测试集:18,006 个样本,约 4.48 GB。
整体规模
- 下载大小:约 184.87 GB。
- 数据集总大小:约 209.19 GB。
使用方式
可通过 datasets 库加载数据集,支持本地加载与流式加载模式。数据加载后可直接用于创建 PyTorch DataLoader。
引用信息
如需在研究中引用此数据集,请使用提供的 BibTeX 条目。




