遇见数据集

ATCSpeech

收藏
arXiv2019-11-26 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

一个来自真实空中交通控制系统,包含带有口音的普通话和英语的多语种语音数据集,旨在促进非商业性空中交通控制领域自动语音识别研究。

A multilingual speech dataset derived from real air traffic control systems, which contains accented Mandarin and English speech, and is designed to advance automatic speech recognition (ASR) research in the non-commercial air traffic control domain.

创建时间:
2019-11-26
搜集汇总
数据集介绍
构建方式
ATCSpeech数据集源自中国真实空中交通管制系统的语音记录设备,采集了带口音的普通话与英语双语管制员-飞行员对话。构建过程中,由40人组成的团队历时多年完成语音采集与人工转写标注,最终释放约58小时语音数据,包含62525条话语。数据按照语言分为中文(约39.83小时)和英文(约18.69小时)两个子集,并随机划分为训练集、开发集和测试集,兼顾区域、说话人性别、角色与语音质量等多样性。
特点
该数据集具有鲜明的空中交通管制领域特性:语音包含真实无线电传输噪声,语速普遍偏快且波动显著,词汇分布极度不均衡,存在代码切换(如数字读法替换)和跨语言混用现象。每条样本附带丰富的元属性,包括说话人性别(男/女)、角色(飞行员/管制员)、语音质量(干净/噪声)、飞行阶段(地面/塔台/进近/区域)及采集区域,为多维度分析提供支撑。
使用方法
数据集适用于非商业学术研究,需签订专门协议申请访问权限。每条样本以单声道8kHz采样、16位量化的WAV文件与对应文本转写配对提供,训练和开发集同时发布MFCC特征。研究者可直接基于释放的语音特征训练端到端ASR模型,如论文中报告的Deep Speech 2、Jasper和Wav2letter++基线系统,采用CTC损失函数和N-best解码策略,以字符错误率(CER)评估性能,尤其适合探索噪声鲁棒性、语速自适应及词汇不平衡等ATC场景下的ASR挑战。
背景与挑战
背景概述
空中交通管制(ATC)领域对自动语音识别(ASR)技术的需求日益迫切,其应用涵盖实时指令翻译、历史语音分析与模拟训练等多个关键场景,对提升运行安全与效率具有深远意义。然而,受限于航空运输安全与知识产权等问题,真实ATC语音数据的获取极为困难,加之领域内标注工作耗时耗力,严重制约了ASR技术在管制场景中的落地。为解决这一困境,四川大学国家空管自动化系统技术重点实验室联合中国民航西南空管局及四川川大智胜软件股份有限公司,于2016年启动ATCSpeech语料库的构建工作。该语料库由40人团队历经多年采集与标注,于2019年正式发布,成为首个面向真实ATC场景的多语言(带口音中文与英文)语音语料库,为相关领域的非商业研究提供了宝贵的数据基础。
当前挑战
ATCSpeech语料库所面临的挑战主要体现在两个方面。其一,针对的领域问题为ATC场景下的ASR任务,其核心挑战包括:多变的背景噪声与无线电传输导致的语音可懂度下降;受实时工况影响而波动剧烈的语速;中英文混杂的代码切换现象;以及词汇分布极度不均引发的样本稀疏问题。其二,在语料库构建过程中,团队需克服从真实管制系统中安全采集原始语音的障碍,同时解决大规模人工标注的高昂成本与时间消耗,最终形成了约58小时的发布版本,其中仅含少量噪声样本,反映了实际环境中高质量语音标注的难度。
常用场景
经典使用场景
在航空交通管理领域,ATCSpeech数据集被广泛应用于构建和评估面向空中交通管制场景的自动语音识别系统。该数据集涵盖了真实管制环境下的多语言语音,包括带口音的普通话和英语,并包含了丰富的元数据属性,如说话人性别、角色、飞行阶段和语音质量。研究者通常利用该数据集训练端到端的深度学习ASR模型,如Deep Speech 2、Jasper和Wav2letter++,以应对管制通信中特有的背景噪声、语速波动、语码转换和词汇不平衡等挑战,从而推动ATC领域ASR技术的实用化发展。
实际应用
在实际应用中,ATCSpeech数据集支撑了多项航空交通管制系统的智能化升级。基于该数据集训练的ASR模型可被集成到实时管制语音翻译系统中,自动提取飞行员与管制员对话中的情境信息,如管制意图和航班号,从而减轻管制员的工作负荷并提升运行安全性。此外,该数据集还被用于构建语音驱动的模拟训练平台,通过结合文本转语音技术实现虚拟飞行员功能,降低管制员培训成本。在历史语音分析场景中,基于ATCSpeech的识别系统能够高效检索和分析大量管制录音,用于运行评估、事故调查和空域优化决策。
衍生相关工作
ATCSpeech数据集催生了一系列重要的衍生研究工作,包括针对管制语音特性的专用ASR模型改进、多语言语码切换识别算法、以及噪声鲁棒性增强技术。例如,研究者基于该数据集提出了结合语言模型和N-best解码策略的优化方案,显著降低了字符错误率。此外,该数据集被用于评估不同深度学习架构在ATC场景下的表现,推动了卷积神经网络和循环神经网络在管制语音处理中的融合创新。后续工作还拓展了该数据集在管制意图检测、说话人识别和飞行阶段分类等任务中的应用,形成了以ATCSpeech为核心的航空语音研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务