Shiry/ATC_combined
收藏资源简介:
UWB-ATCC语料库由西波西米亚大学网络工程系提供,包含空中交通管制员与飞行员之间的通信录音。这些录音经过人工转录,并标注了说话者角色(飞行员/管制员)。语料库目前较小(20小时),但计划在未来扩展。音频数据格式为8kHz、16bit PCM、单声道。数据集支持自动语音识别任务,并且已经有一些预训练模型可用。数据集的语言为英语,主要来源于捷克空域的ATC通信录音。数据集的结构包括id、audio、text、segment_start_time、segment_end_time和duration等字段。
UWB-ATCC语料库由西波西米亚大学网络工程系提供,包含空中交通管制员与飞行员之间的通信录音。这些录音经过人工转录,并标注了说话者角色(飞行员/管制员)。语料库目前较小(20小时),但计划在未来扩展。音频数据格式为8kHz、16bit PCM、单声道。数据集支持自动语音识别任务,并且已经有一些预训练模型可用。数据集的语言为英语,主要来源于捷克空域的ATC通信录音。数据集的结构包括id、audio、text、segment_start_time、segment_end_time和duration等字段。
数据集概述
数据集名称
- UWB-ATCC Corpus
数据集来源
- 提供方:University of West Bohemia, Department of Cybernetics
数据集内容
- 包含空中交通控制员与飞行员之间的通信录音。
- 语音内容已手动转录并标记了说话者信息(飞行员/控制员)。
- 音频数据格式:8kHz, 16bit PCM, mono。
数据集规模
- 当前规模:20小时。
- 计划未来扩充数据。
数据集特征
id (string): 录音标识符,指示说话者角色(如_PI表示只有飞行员语音,_AT表示只有控制员语音,PIAT表示两者都有)。audio (audio): 音频数据,采样率为16000Hz。text (string): 文件的转录文本。segment_start_time (float32): 段落开始时间。segment_end_time (float32): 段落结束时间。duration (float32): 录音时长,计算方式为segment_end_time - segment_start_time。
数据集分割
test: 4723个样本,612270626字节。train: 18929个样本,2543440112字节。
语言和多语言性
- 语言:英语。
- 多语言性:单语种。
许可
任务类别
- 自动语音识别。
支持的任务和模型
- 自动语音识别任务。
- 已适配/微调的模型:XLS-R-300m。
数据集引用信息
@article{vsmidl2019air, title={Air traffic control communication (ATCC) speech corpora and their use for ASR and TTS development}, author={{v{S}}m{\i}dl, Lubo{v{s}} and {v{S}}vec, Jan and Tihelka, Daniel and Matou{v{s}}ek, Jind{v{r}}ich and Romportl, Jan and Ircing, Pavel}, journal={Language Resources and Evaluation}, volume={53}, number={3}, pages={449--464}, year={2019}, publisher={Springer} }




