遇见数据集

kidsNARRATE

收藏
arXiv2024-01-08 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

kidsNARRATE是一个专为研究中国-英语双语学龄前儿童第二语言叙事能力而设计的非母语语音语料库。该数据集包含6小时的儿童叙事测试音频记录,以及人工转录、评分和词级语法及发音错误标注。数据集还提供了视频辅助转录,以提高准确性。此外,数据集处理了音频信号,以满足机器学习应用的需求。kidsNARRATE不仅适用于儿童第二语言习得研究,也支持自动语音识别技术的发展,旨在解决双语儿童叙事能力评估的挑战。

kidsNARRATE is a non-native speech corpus specifically designed for researching the second language narrative abilities of Chinese-English bilingual preschool children. This dataset contains 6 hours of audio recordings from children's narrative tests, along with manual transcriptions, scoring, and word-level grammatical and pronunciation error annotations. It also provides video-assisted transcriptions to enhance transcription accuracy. Additionally, the audio signals within the dataset have been preprocessed to meet the requirements of machine learning applications. kidsNARRATE is applicable not only to research on children’s second language acquisition but also supports the development of automatic speech recognition technologies, aiming to address the challenges in evaluating the narrative abilities of bilingual children.

提供机构:
FAU
创建时间:
2023-04-30
搜集汇总
数据集介绍
kidsNARRATE 数据集图片
构建方式
kidsNARRATE语料库的构建始于疫情期间的远程数据采集,研究者与泉州一所中英双语幼儿园合作,采用ZOOM与OBS等易获取工具进行录制。每名儿童在单次会话中依次完成英语与中文的MAIN叙事测试,同时以两台电脑分别记录教师与儿童的视角,形成双通道音视频数据。音频以48 kHz采样率录制,随后通过自适应噪声门控算法消除串扰,并分割为英语与中文独立文件。转录环节结合AWS语音识别服务与人工校对,最终将机器生成的JSON格式转换为CHAT标准格式,辅以视频回看确保歧义消解。所有录音均经过词级别的语法与发音错误手动标注,并由资深教师双重审核,确保标注的准确性与一致性。
使用方法
kidsNARRATE语料库适用于多领域研究。在自动语音识别方面,其丰富的声学细节(包括韵律、句法特征)可用于开发面向儿童的L2学习工具,尤其是基于叙事场景的互动式游戏化应用。在教学法研究中,语料库对教师与儿童双方错误的标注,便于探究教师语言输入对儿童长期语音感知与产出的影响。在语言能力自动评估领域,人工评分可作为基准,推动L2叙事理解的自动化评测系统发展,减轻教师负担。视频数据还可用于面部情绪识别研究,通过分析师生互动中的表情与手势,揭示情感维度对儿童L2表现的影响。
背景与挑战
背景概述
叙事能力在儿童语言发展中占据核心地位,不仅是读写能力和学业表现的重要预测指标,更是儿童认知世界、建立社会联系的关键工具。然而,双语儿童叙事语料资源的匮乏长期制约着该领域的研究进展,尤其在语言教学与语言资源建设方面形成了显著瓶颈。为弥补这一空白,kidsNARRATE语料库由德国埃尔朗根-纽伦堡大学(FAU)的Hung、Maier、Pérez-Toro等研究人员于2022年创建,聚焦于5至7岁中英双语儿童的二语英语叙事理解能力。该语料库包含6小时的音频录音、人工转录、评分及词级语法与发音错误标注,并创新性地开发了基于ZOOM和OBS的远程数据采集方法,为疫情期间的语言数据收集提供了可复用的模板。kidsNARRATE的发布不仅推动了早期儿童二语习得研究,也为自动语音识别(ASR)技术在儿童语音领域的应用奠定了坚实基础。
当前挑战
kidsNARRATE所应对的核心挑战体现在两个层面。首先,在领域问题层面,双语儿童叙事研究长期面临资源稀缺的困境:全球范围内可公开获取的儿童语音数据库仅约20个,且多数缺乏针对双语群体的精细化标注,难以支撑对二语叙事能力的系统性评估与自动评测系统的开发。其次,在语料库构建过程中,研究团队遭遇了多重技术性困难。疫情期间的远程数据采集要求儿童在无监督环境下完成标准化叙事测试,但学龄前儿童注意力短暂、不习惯佩戴耳机,且其语音常包含不完整句子、语法错误及模糊发音,增加了转录与标注的复杂性。此外,远程录音依赖于参与者的个人设备与环境,导致音频质量参差不齐,需通过自适应噪声门控算法消除串扰并保持语音信号的完整性。这些挑战共同构成了kidsNARRATE在数据采集、处理与标注环节的关键技术瓶颈。
常用场景
经典使用场景
kidsNARRATE语料库的核心应用场景在于探索中英双语儿童在第二语言(英语)叙事理解能力的发展轨迹。该数据集通过标准化叙事测试(MAIN)收集了5至7岁儿童的语音样本,并辅以人工转录、评分及词汇层面的语法与发音错误标注,为研究者提供了精细化的语言产出数据。其经典用途集中于分析双语儿童在叙事结构、语法复杂度及语音准确性上的表现,尤其适用于对比母语(汉语)与二语(英语)叙事能力的差异,揭示语言迁移与不对称发展的规律。此外,语料库的窄年龄跨度设计有助于提取与年龄相关的语音特征,从而提升儿童语音识别系统的性能。
解决学术问题
kidsNARRATE有效缓解了双语儿童叙事语料稀缺的学术困境,填补了针对学龄前中英双语者L2英语叙事理解的资源空白。该数据集解决了三大核心问题:其一,提供了标准化、可量化的叙事能力评估基准,克服了传统人工评分耗时且主观性强的局限;其二,通过词汇级错误标注(如语法与发音错误)支持对二语习得中典型偏误模式的系统分析,为语言习得理论(如迁移假说与输入质量假说)提供了实证依据;其三,其远程采集方法与音频信号处理流程为疫情期间的数据收集树立了可复现的范本,推动了语音语料库建设方法论的革新。这些贡献显著促进了儿童二语习得、自动语音识别及语言教育评估领域的交叉研究。
实际应用
在实际应用中,kidsNARRATE展现出多元价值。在教育领域,其标注数据可直接用于开发面向双语儿童的自动化语言能力评估工具,例如基于语音识别的叙事理解评分系统,从而减轻教师人工评阅负担。在技术研发层面,该语料库的降噪处理与时间戳对齐特性使其适用于训练儿童语音识别模型,尤其针对非母语口音与低龄发音的声学建模。此外,同步录制的视频资料为情感计算研究提供了契机,可通过分析儿童在叙事过程中的面部表情与肢体语言,探究情绪与语言表现的交互关系。这些应用场景共同指向一个目标:将语言学研究成果转化为可落地的教育科技解决方案。
数据集最近研究
最新研究方向
kidsNARRATE语料库聚焦于中英双语学龄前儿童第二语言叙事能力的多维度研究,其前沿方向涵盖基于自动语音识别(ASR)的儿童语音识别优化、远程数据采集方法的创新应用,以及教师语言输入对儿童二语习得影响的实证分析。该语料库结合标准化叙事测试(MAIN)与精细化的语法及发音错误标注,为机器学习驱动的语言能力自动评估提供了高质量基准数据。在远程教育日益普及的背景下,kidsNARRATE所提出的ZOOM与OBS结合的远程录音方案,为疫情期间及后疫情时代的语言数据收集提供了可复用的技术模板。此外,其附带的视频资源为面部情感识别与师生互动分析开辟了新路径,推动了语言与情感交叉领域的研究。这一资源不仅弥补了双语儿童叙事语料稀缺的短板,更对二语教学政策制定与教育技术发展具有深远意义。
相关研究论文
  • 1
    Building a Non-native Speech Corpus Featuring Chinese-English Bilingual Children: Compilation and RationaleFAU · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务