MT-Video-Bench
收藏资源简介:
MT-Video-Bench是一个全面的视频理解基准数据集,用于评估多模态大语言模型在多轮对话中的表现。它包含来自5个主要类别和23个子类别的135个视频,987个对话(每个对话5-8轮)和5,805个问答对,用于评估六项核心能力:对象引用、记忆回忆、内容总结、答案拒绝、主题转换和主动交互。该数据集支持长达20分钟的长视频评估,具有挑战性,目前最佳模型仅达到68.45%的整体准确率。
MT-Video-Bench is a comprehensive video understanding benchmark dataset for evaluating the performance of multimodal large language models in multi-turn conversational scenarios. It includes 135 videos covering 5 main categories and 23 subcategories, 987 conversations (each containing 5 to 8 turns), and 5,805 question-answer pairs, which are designed to assess six core capabilities: object reference, memory recall, content summarization, answer refusal, topic transition, and active interaction. This dataset supports evaluation of long videos up to 20 minutes in duration, and it presents substantial challenges—currently, the state-of-the-art model only attains an overall accuracy of 68.45%.
MT-Video-Bench 数据集概述
数据集简介
MT-Video-Bench 是一个用于评估多模态大语言模型在多轮对话中视频理解能力的综合性基准测试。该基准填补了现有评估基准仅限于单轮问答的空白,强调跨场景推理、长距离依赖和交互适应性,更贴近实际应用需求。
数据集规模
- 视频数量:135个视频
- 视频分类:涵盖5个主要类别和23个子类别
- 对话数量:987个对话
- 问答对数量:5,805个问答对
- 对话轮次:每个对话包含5-8轮
- 视频时长:最长可达20分钟
核心评估能力
数据集评估六个核心能力:
- 对象引用
- 记忆回忆
- 内容总结
- 答案拒绝
- 主题转换
- 主动交互
数据构建流程
- 视频收集与单场景分割:手动收集视频→使用PySceneDetect分割成短片段→为每个片段生成描述→基于描述合并相关片段形成连贯的单场景视频
- 跨场景视频合并:提取关键帧→执行对象检测→构建动态对象记忆库→检索并合并共享共同对象或主题的片段
- 多轮对话生成:使用Gemini 2.5自动生成单场景和跨场景多轮对话→为每个场景选择最合适的任务→采用以对象为中心的方法设计跨场景问题
- 人工质量控制:移除信息泄露案例→手动验证问答对齐、事实正确性和难度→确保高质量、上下文连贯的多轮对话
评估结果
- 模型挑战性:极具挑战性,表现最佳的模型仅达到68.45%的整体准确率
- 评估模型:涵盖闭源和开源多模态大语言模型,包括Gemini 2.5 Pro、Gemini 2.5 Flash、Doubao-Seed-1.6-vision以及18个代表性开源模型
许可证信息
- 许可证类型:CC-BY-NC-SA-4.0
- 使用限制:仅限研究用途,禁止商业使用
- 版权声明:不拥有任何原始视频文件的版权
引用信息
如需在研究中使用本数据集,请引用相关论文。




