搜集汇总
数据集介绍

以上内容由遇见数据集搜集并总结生成
相关数据集
TTS-CProsC: A Chinese Prosody Corpus
This dataset consists of 330,000 pieces of Chinese sentence annotated with prosody.
MagicHub开源社区2021-10-25 更新400
filipinospeechcorpus
菲律宾语音语料库(Filipino Speech Corpus, FSC)是一个用于自动语音识别(ASR)和文本转语音(TTS)任务的句子级语音数据集。该数据集以Hugging Face Parquet格式存储,包含16kHz单声道音频片段。数据集总大小约为6GB,由139个分片组成。每个样本包含音频文件、对应的文本转录、音频时长、单词数量、说话者ID、性别、年龄组、语音类型(朗读/自发/机器生成
Hugging Face2026-03-22 更新240
TTS-SCShhiDiaSC: A Scripted Chinese Shanghai Dialect Speech Corpus
This dataset consists of 10.17 hours of annotated male voices in Shanghai dialect that is applicable for Text-to-Speech Synthesis, where 8,499 utterances collected from a 21-year-old man were containe
MagicHub开源社区2021-10-14 更新110
145小时西班牙西班牙语儿童语音数据_口语化【数据堂】
西班牙西班牙语儿童语音数据_口语化,内容覆盖自媒体、对话、直播、讲座、综艺等通用领域,反映了真实世界的互动情境。此数据集标注了文本内容、说话人身份性别、口音等多种属性,由多名12岁及以下、来自不同地域和文化背景的西班牙儿童录制,准确性高,易用性强,为语音识别相关研究及应用提供了丰富的资源,有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过
OpenDataLab2024-05-30 更新400
D037_Chinese_Multi_emotional_Modal_particle_and_Natural_Conversa
中文多情感语气词及自由对话合成库,由多位中文母语声优录制。既包括含有丰富语气词的句子,贴合日常表达习惯;又包含给定话题下的自由对话数据,且每段对话中,各说话人的音频独立存储于各自音轨。专业语音学家已对文字内容等信息进行标注,充分满足语音合成研发的精准需求。
Opencsg2026-03-04 更新150



