Hi-Fi Multi-Speaker English TTS Dataset
收藏资源简介:
Hi-Fi Multi-Speaker English TTS Dataset是由英伟达公司创建的高质量多演讲者英语语音数据集,旨在训练文本到语音模型。该数据集包含来自10位演讲者的约292小时语音数据,每位演讲者至少有17小时的数据,采样率为44.1 kHz。数据集基于LibriVox有声书和Project Gutenberg文本,通过严格的音频质量分析和文本-音频匹配验证确保数据质量。此数据集特别适用于研究高质量、多变声音的文本到语音合成技术,以解决现有数据集在音频质量和多样性方面的不足。
The Hi-Fi Multi-Speaker English TTS Dataset is a high-quality multi-speaker English speech dataset created by NVIDIA Corporation for training text-to-speech models. It contains approximately 292 hours of speech data from 10 distinct speakers, with each speaker contributing a minimum of 17 hours of audio, and the sampling rate is set to 44.1 kHz. The dataset is built upon audiobooks from LibriVox and texts from Project Gutenberg, with data quality guaranteed through rigorous audio quality analysis and text-audio alignment verification. This dataset is particularly suitable for researching high-quality, diverse-voice text-to-speech synthesis technologies to address the shortcomings of existing datasets in terms of audio quality and diversity.

- 1Hi-Fi Multi-Speaker English TTS Dataset英伟达 · 2021年



