登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
xtts_14_11
xtts_14_11
收藏
kaggle
2024-11-14 更新
2025-01-04 收录
语音合成
语音转文本
数据链接:
https://www.kaggle.com/datasets/kaushikjasoliya25/xtts-model
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
test to speech model built on 14/11/2024 Yash & Dhruveel
基于2024年11月14日构建的语音模型测试,由Yash和Dhruveel共同完成。
应用场景:
创建时间:
2024-11-14
相关数据集
NVSpeech170k
语音识别
语音合成
NVSpeech170k是一个大规模、开源的数据集,包含174,179个自动标注的语音片段,总计约573小时。数据集涵盖了18种细粒度的副语言类别,如笑声、呼吸、哭泣等,这些在传统的ASR和TTS系统中常被忽略。该数据集支持副语言感知的ASR和可控的语音合成,具有普通话优先设计,并展示了跨语言(如英语)的适用性。
github
2025-08-07 更新
96
0
GGarri/PoCcustomdata
语音识别
语音转文本
该数据集包含音频和对应的转录文本,音频的采样率为16000Hz。数据集分为训练集、测试集和验证集,分别包含1460、418和209个样本。训练集的大小约为1.2GB,测试集约为349MB,验证集约为181MB。总下载大小约为1.11GB,数据集总大小约为1.73GB。
Hugging Face
2024-07-02 更新
11
0
4人广粤平均音色合成库
语音合成
粤语方言
4人广粤平均音色合成库,由广东本土人参与录制。录音文本包含教育、游戏、通用口语化内容。语料音素覆盖均衡,专业语音学家参与标注,精准匹配语音合成的研发需求。
数据堂
9
0
GrigoriiA/libretta-tts-merged-dataset-tags-L10k
语音合成
机器学习
--- dataset_info: features: - name: file_name dtype: string - name: text dtype: string - name: transcription_normalised dtype: string - name: utterance_pitch_mean dtype: floa
Hugging Face
2024-05-19 更新
13
0
whucedar/datasets_stt_1
语音识别
语音转文本
该数据集包含音频和句子两个主要特征。音频特征的采样率为16000Hz,句子特征为字符串类型。数据集分为训练集和测试集,训练集包含1007个样本,测试集包含431个样本。数据集的下载大小为572702091字节,总大小为580331887.528字节。数据文件路径分别为训练集的data/train-*和测试集的data/test-*。
Hugging Face
2024-07-10 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广