asr-25lang-30k-26-04-v1
收藏资源简介:
该数据集包含多个非洲语言的音频和转录文本数据,支持的语言配置包括bem_Latn、ful_Latn、kln_Latn、lin_Latn_v2、lug_Latn_v3、mas_Latn、nso_Latn_v2、nya_Latn、orm_Latn、orm_Latn_v2、ven_Latn、xho_Latn、zul_Latn_v2和zul_Latn_v3。每个配置包含训练集和测试集,音频采样率为16000Hz,转录文本为字符串格式。数据集规模从数百万到数十亿字节不等,示例数量从数千到数万。适用于自动语音识别(ASR)任务。
This dataset comprises audio and corresponding transcribed text data across multiple African languages. The supported language configurations include bem_Latn, ful_Latn, kln_Latn, lin_Latn_v2, lug_Latn_v3, mas_Latn, nso_Latn_v2, nya_Latn, orm_Latn, orm_Latn_v2, ven_Latn, xho_Latn, zul_Latn_v2 and zul_Latn_v3. Each configuration includes a training set and a test set. The audio samples have a sampling rate of 16000 Hz, and the transcribed texts are in string format. The dataset size ranges from several million to several billion bytes, with the number of samples varying from thousands to tens of thousands. This dataset is tailored for automatic speech recognition (ASR) tasks.
数据集概述
基本信息
- 数据集名称: asr-25lang-30k-26-04-v1
- 数据集地址: https://huggingface.co/datasets/mutisya/asr-25lang-30k-26-04-v1
数据集结构
本数据集包含多个语言配置,每个配置均包含音频和对应的文本转录,并划分为训练集和测试集。
通用特征
所有语言配置均包含以下特征:
- audio: 音频数据,采样率为16000 Hz。
- transcription: 对应的文本转录,数据类型为字符串。
语言配置详情
以下是各语言配置的具体信息:
bem_Latn
- 训练集: 11,174 个样本,大小约 2.19 GB。
- 测试集: 1,241 个样本,大小约 246.60 MB。
- 下载大小: 约 2.39 GB。
- 数据集总大小: 约 2.44 GB。
ful_Latn
- 训练集: 14,255 个样本,大小约 23.47 GB。
- 测试集: 1,540 个样本,大小约 2.46 GB。
- 下载大小: 约 20.46 GB。
- 数据集总大小: 约 25.93 GB。
kln_Latn
- 训练集: 45,000 个样本,大小约 26.45 GB。
- 测试集: 2,409 个样本,大小约 1.39 GB。
- 下载大小: 约 25.35 GB。
- 数据集总大小: 约 27.84 GB。
lin_Latn_v2
- 训练集: 15,912 个样本,大小约 7.59 GB。
- 测试集: 1,033 个样本,大小约 441.25 MB。
- 下载大小: 约 6.68 GB。
- 数据集总大小: 约 8.03 GB。
lug_Latn_v3
- 训练集: 45,000 个样本,大小约 17.02 GB。
- 测试集: 2,828 个样本,大小约 1.15 GB。
- 下载大小: 约 15.34 GB。
- 数据集总大小: 约 18.17 GB。
mas_Latn
- 训练集: 45,000 个样本,大小约 27.43 GB。
- 测试集: 1,435 个样本,大小约 852.91 MB。
- 下载大小: 约 25.87 GB。
- 数据集总大小: 约 28.28 GB。
nso_Latn_v2
- 训练集: 45,000 个样本,大小约 4.93 GB。
- 测试集: 2,829 个样本,大小约 336.67 MB。
- 下载大小: 约 5.05 GB。
- 数据集总大小: 约 5.26 GB。
nya_Latn
- 训练集: 8,075 个样本,大小约 2.49 GB。
- 测试集: 897 个样本,大小约 270.94 MB。
- 下载大小: 约 2.71 GB。
- 数据集总大小: 约 2.76 GB。
orm_Latn
- 训练集: 5,450 个样本,大小约 3.04 GB。
- 测试集: 1,659 个样本,大小约 914.98 MB。
- 下载大小: 约 3.59 GB。
- 数据集总大小: 约 3.96 GB。
orm_Latn_v2
- 训练集: 42,073 个样本,大小约 8.80 GB。
- 测试集: 4,674 个样本,大小约 987.31 MB。
- 下载大小: 约 9.43 GB。
- 数据集总大小: 约 9.79 GB。
ven_Latn
- 训练集: 45,000 个样本,大小约 5.87 GB。
- 测试集: 2,805 个样本,大小约 360.74 MB。
- 下载大小: 约 6.08 GB。
- 数据集总大小: 约 6.23 GB。
xho_Latn
- 训练集: 43,867 个样本,大小约 6.11 GB。
- 测试集: 2,770 个样本,大小约 358.27 MB。
- 下载大小: 约 6.41 GB。
- 数据集总大小: 约 6.47 GB。
zul_Latn_v2
- 训练集: 41,862 个样本,大小约 6.01 GB。
- 测试集: 2,802 个样本,大小约 463.72 MB。
- 下载大小: 约 6.36 GB。
- 数据集总大小: 约 6.48 GB。
zul_Latn_v3
- 训练集: 16,150 个样本,大小约 21.95 GB。
- 测试集: 997 个样本,大小约 1.37 GB。
- 下载大小: 约 20.27 GB。
- 数据集总大小: 约 23.32 GB。
数据文件结构
每个语言配置的数据文件均按以下模式组织:
- 训练集文件路径:
{config_name}/train-* - 测试集文件路径:
{config_name}/test-*
备注
数据集卡片信息待补充。




