遇见数据集

NICT-JLE Corpus

收藏
arXiv2023-08-05 更新2024-06-21 收录
官方服务:

资源简介:

NICT-JLE Corpus是由日本信息通信技术国家研究所创建的一个包含约300小时英语学习者口语能力测试的数据集。该数据集包含1,281名日本英语学习者的录音,涵盖开放对话、角色扮演和图片描述等任务。数据集中的每条记录都包含HTML风格的标签,用于标记编辑词和言语不流畅性,以及学习者的熟练程度、性别和国籍等元数据。NICT-JLE Corpus主要用于研究学习者言语中的不流畅性检测,旨在通过标准化训练和评估集,促进模型的发展和比较。

The NICT-JLE Corpus is a dataset containing approximately 300 hours of spoken English proficiency test recordings, created by the National Institute of Information and Communications Technology (NICT) of Japan. It consists of audio recordings from 1,281 Japanese English learners, covering tasks such as open dialogues, role-plays and image descriptions. Each record in the corpus includes HTML-style tags for marking edited words and speech disfluencies, as well as metadata including learners' proficiency levels, genders and nationalities. The NICT-JLE Corpus is primarily used for research on disfluency detection in learner speech, aiming to facilitate model development and comparison via standardized training and evaluation sets.

提供机构:
谢菲尔德大学
创建时间:
2023-08-05
搜集汇总
数据集介绍
NICT-JLE Corpus 数据集图片
构建方式
NICT-JLE语料库源自日本国立信息与通信技术研究所收集的约300小时英语学习者口语水平测试录音,涵盖1281名日语母语者的语音数据。原始语料包含HTML风格的编辑术语与不流利标签,以及学习者性别、国籍、熟练度等元信息。为适配不流利检测任务,研究团队对语料进行了系统改造:剔除考官话语、含日语或部分截断的语句,保留原始文件编号与话语切分;采用NLTK进行分词,并用Stanford MaxentTagger标注词性,对缩写词进行合并处理;将原始不流利标签转换为增量式标签与BIOES标签两种标准格式,同时移除修复短语标注以匹配学界惯例。最终按80%、10%、10%比例划分为训练集、保留集与测试集,各子集在英语熟练度分布上保持均衡。
使用方法
该语料库专为不流利检测模型的训练与评估而设计,支持增量式与非增量式两种检测范式。研究者可直接使用提供的训练集、保留集与测试集进行模型微调与性能对比,所有数据均包含词性标签、话语类型(对话、图片描述、角色扮演)及学习者性别、熟练度等元特征。每个单词附有四个二元特征,标记前导短停顿、长停顿、笑声及单词本身是否被笑,测试集额外包含学习者错误标签。语料库以标准化格式开源发布,便于复现与扩展,未来可结合BERT等语言模型进行微调,或用于多模态模型开发及语言学习应用中的模型分析。
背景与挑战
背景概述
在口语处理研究中,不流利现象的检测(如犹豫、重复和错误起始)对于提升语音理解系统的鲁棒性至关重要。然而,现有研究多集中于母语语音,如广泛采用的Switchboard语料库,而针对学习者语音的不流利检测研究则因数据集的访问限制而进展缓慢。为填补这一空白,国立信息与通信技术研究所(NICT)联合研究者于2004年创建了NICT-JLE语料库,收录了约300小时、来自1281名日语英语学习者的口语水平测试录音。该语料库由Lucy Skidmore和Roger K. Moore等学者进行适配改造,旨在为学习者语音的不流利检测提供标准化训练与评估资源。其核心研究问题聚焦于学习者语音中不流利现象的独特特征及其与母语者的差异,为第二语言习得与自然语言处理交叉领域提供了关键数据支撑,推动了相关模型的公平比较与性能提升。
当前挑战
NICT-JLE语料库面临多重挑战。首先,学习者语音的不流利行为更为复杂,其每百词不流利频率(7.54)是母语者(3.56)的两倍以上,且嵌套式不流利与编辑术语比例显著偏高,这增加了检测模型区分重复、修正与语法错误的难度。其次,语料库构建中遭遇标注难题:仅部分文件包含学习者错误标签,且修复短语未被标注,导致模型难以全面捕捉不流利与错误的共现模式。此外,原始标注方案与Switchboard语料库不兼容,适配过程需重新设计标签集(如增量标签与BIOES标签)并整合韵律特征(如停顿、笑声)及说话人属性(如熟练度、活动类型),以保证跨研究可比性。最后,语料库仅涵盖日语英语学习者,其母语背景的单一性限制了模型对不同语言群体的泛化能力,亟需更多元化的数据收集以应对这一局限。
常用场景
经典使用场景
NICT-JLE语料库在口语非流利检测领域扮演着举足轻重的角色,尤其适用于学习者语音的深入研究。该数据集收录了约300小时日本英语学习者的口语水平测试录音及转写文本,内含丰富的非流利现象标注,如犹豫、重复、虚假启动及修正等。研究者可基于此语料库训练和评估非流利检测模型,探索非母语者口语中特有的语言特征与规律。其标准化的训练集、验证集与测试集划分,为不同模型间的公平比较提供了坚实平台,成为学习者口语非流利研究领域不可或缺的基准资源。
解决学术问题
该数据集有效解决了学习者口语非流利检测研究中长期存在的两大核心学术难题:一是数据获取受限导致模型性能难以横向比较,二是基于母语者数据训练的模型对低水平学习者存在性能偏差。通过提供公开、标准化的标注语料,NICT-JLE语料库使得研究者能够系统性地分析学习者的非流利行为与语言水平之间的关联,揭示重复、编辑词、嵌套结构等非流利类型随熟练度变化的动态模式。这一工作不仅推动了非流利检测模型在二语习得领域的应用,也为理解学习者口语产出机制提供了实证基础,具有重要的方法论意义。
实际应用
在实际应用层面,NICT-JLE语料库为构建智能化语言学习辅助系统提供了关键支撑。基于该数据集训练的非流利检测模型可集成至口语评估工具中,实时识别学习者语音中的犹豫、重复等非流利现象,进而生成精准的反馈与改进建议。此外,该语料库还可用于改进自动语音识别系统对非流利语音的鲁棒性,提升人机对话系统的自然交互体验。在语言教学领域,教师可利用分析结果洞察学生口语表达的典型困难,设计更具针对性的教学策略,从而促进学习者口语流利度的有效提升。
数据集最近研究
最新研究方向
在口语流利度与二语习得的交叉领域,NICT-JLE语料库的最新研究方向聚焦于学习者言语中的不流利现象检测,这一方向与当前人工智能驱动的语言教育工具开发紧密相连。随着对话式AI和智能辅导系统的普及,精准识别并处理非母语者语音中的犹豫、重复、修正等不流利特征,成为提升系统鲁棒性和用户体验的关键挑战。该语料库通过对约300小时日本英语学习者口语测试数据的深度标注与标准化改造,不仅为不流利检测模型提供了可比对训练与评估基准,更揭示了学习者语言行为中嵌套型不流利、编辑词以及语法错误共现的复杂模式。这一工作填补了非母语语音语料库在开放获取与标准评估框架上的空白,推动了从单一母语研究向多语言能力水平泛化的重要转型,其成果有望为个性化语言学习系统的自适应反馈机制、口语自动评分以及人机交互中的真实对话理解提供坚实的数据基础与理论支撑。
相关研究论文
  • 1
    Adapting the NICT-JLE Corpus for Disfluency Detection Models谢菲尔德大学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务