Nexdata/Mixed_Speech_with_Chinese_and_English_Data
收藏资源简介:
该数据集由1113名中国母语者录制,涵盖了七大主要方言区域。录制的文本是中英文混合的句子,包括一般场景和人机交互场景,内容丰富且转录准确。该数据集可用于提高语音识别系统对中英文混合阅读语音的识别效果。数据集支持自动语音识别和音频说话人识别任务,语言包括中文和英文。
This dataset was recorded by 1,113 native Chinese speakers, covering seven major dialect regions across China. The recorded texts are mixed Chinese-English sentences covering both general scenarios and human-computer interaction scenarios, with rich content and highly accurate transcriptions. This dataset can be used to improve the recognition performance of speech recognition systems for mixed Chinese-English read speech. It supports tasks including Automatic Speech Recognition (ASR) and Audio Speaker Recognition, with the languages involved being Chinese and English.
数据集概述
数据集名称
Nexdata/Mixed_Speech_with_Chinese_and_English_Data_by_Mobile_Phone
数据集描述
数据集摘要
该数据集由1113名中国母语者录制,涵盖七大方言区口音。录制文本为中英文混合句子,覆盖日常场景及人机交互场景。内容丰富,转录准确,适用于提升语音识别系统对中英文混合朗读语音的识别效果。
支持的任务和排行榜
- 自动语音识别 (ASR)
- 音频说话人识别
语言
- 中文
- 英文
数据集结构
数据实例
[信息待补充]
数据字段
[信息待补充]
数据分割
[信息待补充]
数据集创建
数据收集理由
[信息待补充]
源数据
初始数据收集和标准化
[信息待补充]
源语言生产者
[信息待补充]
注释
注释过程
[信息待补充]
注释者
[信息待补充]
个人和敏感信息
[信息待补充]
使用数据的考虑
数据集的社会影响
[信息待补充]
偏见讨论
[信息待补充]
其他已知限制
[信息待补充]
附加信息
数据集管理者
[信息待补充]
许可信息
商业许可:链接
引用信息
[信息待补充]
贡献
[信息待补充]




