SynParaSpeech
收藏资源简介:
SynParaSpeech是首个自动化合成框架,用于构建大规模副语言数据集,支持更真实的语音合成和语音理解。它通过生成高质量、与语音、文本和时间戳完全对齐的副语言声音(如笑声、叹息、清嗓声),解决了现有资源中的关键问题。数据集包含118.75小时的数据,涵盖6个细粒度副语言类别(叹息、清嗓、笑声、停顿、tsk、喘息),并具有毫秒级时间戳注释,适用于副语言文本到语音(TTS)和事件检测任务。
SynParaSpeech is the first automated synthesis framework for building large-scale paralinguistic datasets, enabling more realistic speech synthesis and speech understanding. It addresses critical issues in existing resources by generating high-quality paralinguistic sounds such as laughter, sighs, throat clearings that are fully aligned with speech, text and timestamps. The dataset contains 118.75 hours of data, covering 6 fine-grained paralinguistic categories including sighs, throat clearings, laughter, pauses, tsks and gasps, and is equipped with millisecond-level timestamp annotations, which is suitable for paralinguistic text-to-speech (TTS) and event detection tasks.
SynParaSpeech 数据集概述
基本信息
- 名称:SynParaSpeech
- 语言:中文
- 数据总量:118.75小时
- 片段数量:79,986个
- 采样率:24 kHz
- 许可证:CC BY-NC-ND 4.0
核心特点
- 首创自动化合成框架:用于构建大规模副语言数据集,支持语音生成与理解。
- 副语言类别:覆盖6种细粒度类别(叹息、清嗓、笑声、停顿、啧声、喘气),分布均衡(9.36%–23.76%)。
- 标注信息:提供毫秒级时间戳,与语音和文本完全对齐。
- 合成方法:基于Whisper Large V3(语义编码)、CAM++(说话人嵌入)和SeedVC(零样本语音转换)的自动化集成。
应用能力
副语言文本到语音(TTS)
- 优化方法:支持监督微调(SFT)和直接偏好优化(DPO)。
- 性能提升:
- CosyVoice2:PMOS从1.88(基线)提升至3.46(DPO-Joint)。
- F5-TTS:PMOS从1.16(基线)提升至3.10(SFT),NMOS保持在4.16。
副语言事件检测
- 优化方法:通过提示调优增强多模态大语言模型(MLLM)的检测能力。
- 性能提升:
- Qwen 2.5 Omni:准确率从21.5%(无上下文)提升至47.3%(5样本上下文),宏观F1从18.9%提升至47.1%。
- Kimi Audio:准确率达到38.2%(5样本上下文),字符错误率(CER)降至11.11%。
数据构建流程
- 标注文本合成:通过3种ASR模型(Whisper Large V3、SenseVoice、Paraformer)多数投票生成时间戳文本,并使用Deepseek Chat V3插入副语言标签。
- 音频合成:通过SeedVC语音转换集成副语言音频与语音音频,保持音色一致性。
- 人工辅助验证:从自然度、副语言匹配度、音频质量和时间对齐度4个维度评估,保留高质量片段。
引用信息
bibtex @article{bai2025synparaspeech, title = {SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding}, author = {Bingsong Bai and Qihang Lu and Wenbing Yang and Zihan Sun and Yueran Hou and Peilei Jia and Songbai Pu and Ruibo Fu and Yingming Gao and Ya Li and Jun Gao}, journal = {arXiv preprint arXiv:2509.14946}, year = {2025} }




