遇见数据集

QualiSpeech

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集名为QualiSpeech,是一个全面的低级别语音质量评估数据集,涵盖了11个关键方面,并附有详细的自然语言评论,这比传统的数值评分能提供更丰富的洞察。此外,该数据集在七个维度上进行了标注,并为四个方面提供了简洁的描述,开创性地在语音质量评估中使用了自然语言描述。该数据集规模宏大,包含了多样化的场景和方面,并配有详尽的注释,其任务是进行语音质量评估。

This dataset is named QualiSpeech, a comprehensive low-level speech quality assessment dataset covering 11 key aspects and accompanied by detailed natural language reviews, which provides richer insights than traditional numerical scores. Additionally, the dataset is annotated across seven dimensions, with concise descriptions provided for four aspects, pioneering the application of natural language descriptions in speech quality assessment. Boasting a large scale, it encompasses diverse scenarios and aspects with exhaustive annotations, and its targeted task is speech quality assessment.

提供机构:
Tsinghua University
搜集汇总
数据集介绍
QualiSpeech 数据集图片
构建方式
在语音质量评估领域,传统方法多依赖平均意见分(MOS)等数值评分,难以揭示评分背后的深层原因。为突破这一局限,QualiSpeech数据集应运而生,其构建过程精心设计,融合多元数据源与精细标注流程。数据来源涵盖合成语音(如BVCC数据集及10种最新开源TTS模型生成的样本)与真实语音(如NISQA、GigaSpeech等),并引入噪声混合以模拟真实场景。标注流程分三步:首先,听者针对7个维度(如噪声、失真)进行五级评分,并描述4个特定方面(如噪声类型及时刻);其次,利用GPT依据元信息生成链式思考(CoT)格式的自然语言描述;最后,人工审核修正描述中的幻觉与遗漏,确保注释质量。
使用方法
QualiSpeech数据集的使用方法灵活多样,旨在推动语音质量评估研究。研究者可基于其数值评分与描述性注释,微调听觉大语言模型(如SALMONN-7B)以生成多维度自然语言评估报告,通过GPT提取评分与描述后,计算皮尔逊相关系数(PCC)评估数值准确性,并利用GPT生成的相关性评分及交并比(IoU)衡量描述精确度。同时,数据集配套的QualiSpeech基准测试通过多项选择任务,系统性评估听觉LLM在7个低层次语音感知方面的能力,揭示现有模型在质量评估上的不足,为模型改进提供明确方向。
背景与挑战
背景概述
QualiSpeech数据集由清华大学、字节跳动、中央研究院及国立信息学研究所于2025年联合创建,旨在突破传统语音质量评估依赖平均意见得分的局限。该数据集首次引入自然语言描述与推理机制,涵盖噪声、失真、语速、连续性、听辨努力度、自然度及总体质量等七个维度的评分,并针对噪声、失真、非自然停顿及嗓音特征提供具体描述。通过整合合成语音(如Blizzard Challenge样本及10种现代TTS系统输出)与真实语音(如NISQA、GigaSpeech语料),QualiSpeech构建了包含10,558条训练样本的均衡语料库,为听觉大语言模型在低层语音感知任务上的训练与评测奠定了重要基础。
当前挑战
QualiSpeech面临的挑战主要体现在两方面。领域层面,现有听觉大语言模型在低层语音质量评估任务中表现欠佳,如SALMONN-7B在基准测试中多项指标相关系数低于0.1,且存在数值偏好偏差;自然语言生成式评估需同时保证描述准确性、时间戳精度及推理逻辑性,而当前模型在检测噪声/失真存在性(召回率约0.5-0.8)与识别非自然停顿(IoU约0.4)方面仍有显著不足。构建层面,多维度人工标注复杂度高,每个样本仅由单一听者标注,导致主观性偏差难以完全消除;合成数据需额外混入噪声以模拟真实场景,且需平衡不同数据源(如BVCC与最新TTS模型)的质量分布差异,确保评估模型的泛化能力。
常用场景
经典使用场景
在语音质量评估领域,传统的平均意见得分(MOS)虽能提供整体数值评分,却难以揭示评分背后的具体原因。QualiSpeech数据集凭借其涵盖噪声、失真、语速、连续性、聆听努力、自然度及总体质量等七个维度的细粒度评分,以及针对噪声类型与时间、失真类型与时间、异常停顿和声音感受等四个方面的自然语言描述,开创性地实现了对语音质量的深层剖析。该数据集最经典的使用场景是作为听觉大语言模型(LLM)的低层语音感知能力基准测试,通过多选题形式评估模型对语音低层特征的精准理解,从而推动从单一数值向富含推理的文本化评估范式的转变。
解决学术问题
QualiSpeech数据集精准填补了现有学术研究中自然语言驱动语音质量评估的空白。此前,合成语音与真实语音因特性迥异而常被分开评估,且多数方法局限于MOS预测,无法解释质量缺陷的根源。该数据集通过提供跨域(涵盖BVCC、近期TTS、GigaSpeech、NISQA等来源)且标注丰富的样本,使得研究者能够训练出同时适用于合成与真实场景的通用评估模型。其意义在于首次将低层语音感知任务系统性地纳入听觉LLM的评测范畴,揭示了当前开源模型在语音质量感知上的显著短板,为构建更可靠、可解释的自动评估体系奠定了数据基础。
实际应用
在实际应用中,QualiSpeech数据集赋能语音合成系统与通信网络的精细化诊断与优化。例如,通过微调后的SALMONN-7B模型,能够生成类似“从1.5秒到2.5秒存在间歇性电流声失真”的详细描述,为TTS开发者提供比单一失真分数更具操作性的改进指引。在通信领域,该数据集支持对真实录音中的噪声类型、失真时段及异常停顿进行精准定位,助力网络质量监控与降噪算法的迭代。此外,其自然语言推理能力还可用于智能语音助手、在线教育平台等场景,自动生成带理由的语音质量反馈,提升用户体验的透明度与交互的自然性。
数据集最近研究
最新研究方向
QualiSpeech数据集的出现标志着语音质量评估领域从传统的数值评分范式向自然语言描述与推理的深刻转型。该数据集首次系统性地整合了11个低层语音感知维度,并提供了包含因果推理的细粒度自然语言注释,为听觉大语言模型(LLM)在低层语音理解任务上的能力评估与微调开辟了新路径。当前的前沿研究聚焦于利用该数据集构建能够生成多维度、可解释性语音质量描述的听觉LLM,探索通过链式推理(CoT)增强评估的准确性与可靠性。这一方向与语音合成系统优化、通信网络失真诊断等热点应用紧密关联,其意义在于推动语音质量评估从“黑盒打分”迈向“透明化诊断”,为构建通用、鲁棒的语音感知模型奠定了数据与基准基础,有望重塑人机语音交互的质量评价标准。
相关研究论文
  • 1
    QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions清华大学, 北京大学, Academia Sinica, 国立信息学研究所 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务