MDAR
收藏资源简介:
MDAR是一个大规模的数据集,旨在评估音频语言模型在复杂和多场景动态音频推理任务中的推理能力。该数据集包含3000个精心策划的问题-答案对,与各种音频剪辑相关联,涵盖了五个复杂推理类别,涉及三种问题类型。MDAR通过三个主要步骤构建,包括信息准备、提示输入和人工筛选,以确保数据质量。该数据集对模型在感知、理解和高级推理能力方面的要求极高,是音频推理研究领域的一个有价值的基准。
MDAR is a large-scale dataset designed to evaluate the reasoning capabilities of audio language models on complex and multi-scenario dynamic audio reasoning tasks. This dataset contains 3,000 carefully curated question-answer pairs associated with various audio clips, covering five complex reasoning categories and involving three types of questions. MDAR is constructed through three main steps, including information preparation, prompt crafting, and manual filtering, to ensure data quality. This dataset imposes extremely high demands on models' perception, comprehension, and advanced reasoning capabilities, making it a valuable benchmark in the field of audio reasoning research.
MDAR: A Multi-scene Dynamic Audio Reasoning Benchmark
基本信息
- 标题: MDAR: A Multi-scene Dynamic Audio Reasoning Benchmark
- arXiv ID: arXiv:2509.22461
- 提交日期: 2025年9月26日
- 学科分类: Sound (cs.SD); Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Audio and Speech Processing (eess.AS)
- 作者: Hui Li, Changhao Jiang, Hongyu Wang, Ming Zhang, Jiajun Sun, Zhixiong Yang, Yifei Cao, Shihan Dou, Xiaoran Fan, Baoyu Fan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang
数据集概述
MDAR是一个用于评估复杂、多场景和动态演化音频推理任务的基准测试。该基准测试包含3,000个精心策划的问题-答案对,这些对与多样化的音频片段相关联,涵盖五类复杂推理任务和三种问题类型。
核心特征
- 音频类型: 包括语音、副语言线索、环境声音和音乐
- 场景特点: 多场景动态音频环境,涉及多个说话者、展开事件和异构音频源的交互
- 问题类型: 三种问题类型(单选、多选和开放式问题)
- 规模: 3,000个问题-答案对
评估结果
在26个最先进的音频语言模型上的基准测试显示:
- 单选问题: Qwen2.5-Omni(开源)达到76.67%准确率,GPT-4o Audio(闭源)达到68.47%
- 多选和开放式问题: GPT-4o Audio显著优于Qwen2.5-Omni
- 整体表现: 在所有三种问题类型中,没有模型达到80%的性能
技术细节
- 论文页数: 25页
- 图表数量: 7个图表
- 资源链接: https://doi.org/10.48550/arXiv.2509.22461




