MMDocRAG
收藏资源简介:
MMDocRAG是一个全面的基准测试数据集,用于评估文档视觉问答中的多模态生成。数据集包括4,055个专家标注的问答对,每个问答对都伴随有跨页、跨模态的证据链。MMDocRAG引入了创新的评估指标,用于评估多模态引言选择,并支持文本与相关视觉元素交织的答案。数据集基于MMDocIR数据集,经过文档解析、证据选择、多模态答案生成和负引言选择等多个阶段构建而成。MMDocRAG旨在解决多模态文档问答中的证据检索、选择和整合等挑战,为开发更健壮的多模态文档问答系统提供测试平台和有价值的见解。
MMDocRAG is a comprehensive benchmark dataset for evaluating multimodal generation in document visual question answering. The dataset contains 4,055 expert-annotated question-answer pairs, each accompanied by cross-page and cross-modal evidence chains. MMDocRAG introduces innovative evaluation metrics for assessing multimodal evidence selection, and supports answers that interweave textual content and relevant visual elements. The dataset is constructed based on the MMDocIR dataset through multiple stages including document parsing, evidence selection, multimodal answer generation, and negative evidence selection. MMDocRAG aims to address the challenges of evidence retrieval, selection, and integration in multimodal document question answering, providing a testbed and valuable insights for developing more robust multimodal document question answering systems.
MMDocRAG数据集概述
基本信息
核心特点
- 多模态支持: 支持文本、表格、图表和图像在回答中交织生成
- 评估创新: 引入细粒度引用选择评估和整体多模态生成质量评估
- 规模: 包含4,055个专家标注的QA对,基于222份长文档
- 领域覆盖: 涵盖10个不同领域
数据集构成
- 文档特征:
- 平均每份文档67页
- 约33,000单词
- 包含文本、表格、图表和图像
- 标注内容:
- 48,618个文本引用
- 32,071个图像引用
- 包含正样本和困难负样本
构建流程
- 文档解析与证据选择:
- 使用MinerU处理313份长文档
- 基于布局检测分割成语义连贯的引用
- 多模态答案生成:
- 精炼1,658个现有QA对
- 通过VLM标注生成新QA对
- 黄金引用标注:
- 自动插入黄金文本引用
- 专家验证引用准确性和连贯性
- 负样本增强:
- 添加困难负样本
- 构建15或20个引用的候选集
评估结果
- 评估规模: 60个最先进模型(LLMs和VLMs)
- 关键发现:
- GPT-4.1表现最佳(F1=70.2,答案质量得分4.14)
- 专有VLM在多模态输入下表现优于开源替代品
- VLM生成的文本比OCR提取的文本包含更丰富的多模态线索
- 引用选择准确度受位置影响显著
重要结论
- 当前最先进的VLM和LLM在多模态整合方面仍存在困难
- 针对性的微调对提升多模态文档理解能力至关重要
- 视觉检索器更擅长检索图像内容,文本检索器更擅长检索文本内容




