SynDataLab/tts-pretrain-clones-3m
收藏资源简介:
TTS预训练克隆数据集(3M)包含2,967,779个克隆语音样本,涵盖2971个英语说话者。采样率为44.1 kHz,音频以WAV格式存储在Parquet文件中。这些样本是通过echo-tts合成英语文本,基于从Qwen3-TTS VoiceDesign基础说话者中提取的潜在特征生成的。每个说话者有10个语音克隆潜在特征,每个潜在特征对应100个文本样本。每个说话者的第一个语音样本(第0行)在配套的参考数据集中单独发布。数据集覆盖了说话者1-60、61(部分,749行)和91-3000。由于迁移过程中的存储事故,30个说话者(61的尾部+62-90)的数据缺失,但他们的参考样本仍保留在配套数据集中。配套数据集(参考):Aynursusuz/tts-pretrain-refs-3k。
TTS Pretrain Clones (3M) contains 2,967,779 clone utterances across 2971 English speakers. Sample rate: 44.1 kHz, WAV in Parquet. Generated by echo-tts synthesizing English text on speaker latents derived from Qwen3-TTS VoiceDesign base speakers. Per speaker: 10 voice-clone latents × 100 texts. The first utterance of each speaker (row 0) is published separately in the companion refs set. Coverage: speakers 1-60 + 61 (partial, 749 rows) + 91-3000. Thirty speakers (61s tail + 62-90) are absent due to a storage incident during migration; refs for them remain in the companion dataset. Companion dataset (references): Aynursusuz/tts-pretrain-refs-3k.




