DNASpeech
收藏资源简介:
DNASpeech是一个新颖的文本到语音数据集,包含高质量的演讲和DNA提示注释(对话上下文、叙事和动作状态)。该数据集包含2,395个不同角色、4,4529个场景和22,975个对话话语,以及超过18小时的高质量语音录音,为文本到语音任务提供了更详细的描述。
DNASpeech is a novel text-to-speech dataset containing high-quality speech content and DNA prompt annotations (dialogue context, narration and action states). This dataset includes 2,395 distinct characters, 44,529 scenarios, 22,975 conversational utterances, and over 18 hours of high-quality speech recordings, providing more detailed contextual descriptions for text-to-speech tasks.
DNASpeech 数据集概述
DNASpeech 是一个新颖的文本到语音数据集,包含高质量的语音,带有 DNA 提示注释(D对话上下文、N叙述和A动作状态)。该数据集包含 2,395 个不同的角色、4,4529 个场景和 22,975 个对话话语,以及超过 18 小时的高质量语音录音。
数据集文件
数据集可通过以下链接下载,包含三个文件:
- DNASpeech_meta.json:584MB,包含语音的元数据。
- DNASpeech_wav.zip:2.9GB,去噪后的语音数据。
- DNASpeech_raw.zip:6.9GB,原始语音数据。
元数据文件
DNASpeech_meta.json 是 JSON 行格式,包含 22,975 行。每行代表一个样本,包含以下字段:
- index:样本的唯一键,格式为 SpeakerID-MovieID-LineID,也作为相应语音片段的文件名。
- scene:包含场景标题和完整内容。
- character:说话者名称。
- timestamp:语音片段在电影中的开始和结束时间戳。
- narrative:语音的环境描述。
- dialogue:语音的对话上下文。
- action_state:说话者的动作、表情或额外信息。
- text:语音的内容文本。
- ASR_text:使用 ASR 技术转录的文本。
- score:数据质量的手动评估,从 1 到 3。
音频文件
DNASpeech_wav 包含去噪后的音频文件,对应每个样本,共有 22,975 个文件,每个文件包含一个语音片段。所有文件为 wav 格式,采样率为 16K HZ。文件名格式为 SpeakerID-MovieID-LineID,对应元数据中的 index 字段。
许可证
所有数据根据 CC BY-NC-SA 4.0 许可证 分发。




