遇见数据集

ibm-research/REAL-MM-RAG_FinSlides

收藏
Hugging Face2025-03-16 更新2025-04-12 收录
官方服务:

资源简介:

REAL-MM-RAG-Bench是一个面向现实世界的多模态检索基准,旨在在可靠、具有挑战性和现实的环境中对检索模型进行评估。该数据集包含多种模态的文档,如文本、表格和图形,以测试模型根据自然语言查询检索相关信息的能力。

REAL-MM-RAG-Bench is a real-world multi-modal retrieval benchmark designed to evaluate retrieval models in reliable, challenging, and realistic settings. The dataset includes multi-modal documents such as text, tables, and figures to test the models ability to retrieve relevant information based on natural language queries.

提供机构:
ibm-research
搜集汇总
数据集介绍
ibm-research/REAL-MM-RAG_FinSlides 数据集图片
构建方式
在金融信息检索领域,结构化数据的准确获取至关重要。REAL-MM-RAG_FinSlides数据集源自2008至2024年间65份季度财务演示文稿,涵盖2280页内容,其构建遵循一套自动化流水线:首先由视觉语言模型(VLM)基于页面内容生成多样化查询,随后经大语言模型(LLM)进行质量筛选与语义优化,确保查询贴近真实用户行为。为模拟检索中的语义变异挑战,数据集引入三级查询改写机制,从措辞微调至句式重构,逐步增加查询与原始信息的语义距离,从而评估模型超越关键词匹配的深层理解能力。
特点
该数据集以表格密集的财务演示文稿为核心,图像页面中蕴含关键财务洞察,构成视觉与结构化信息交织的复杂检索场景。其独特之处在于多级查询改写:一级保留核心语义仅调整措辞,二级改变句式结构,三级则进行实质性语义重组,迫使检索模型依赖真实语义理解而非表面词汇匹配。此外,每个图像页面可能关联多个不同改写级别的查询,而部分页面无对应查询,这种非对称设计真实反映了实际检索中信息分布的不均衡性。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载测试集,并利用查询与图像文件名的索引关系进行检索评估。典型应用包括:根据自然语言查询定位对应图像页面,例如询问“IBM在2016年3月与2017年3月的总资产对比”;或反向检索特定图像所关联的所有查询,以分析页面内容的多角度覆盖。数据集支持构建查询到图像及图像到查询的双向映射,便于实现检索模型的精确评估与错误分析,尤其适用于验证模型在表格数据检索中的鲁棒性。
背景与挑战
背景概述
在检索增强生成(RAG)技术快速演进的背景下,如何评估多模态检索模型在真实复杂环境中的鲁棒性与语义理解能力,成为该领域亟待解决的核心问题。由IBM研究院Navve Wasserman、Roi Pony等研究人员于2025年提出的REAL-MM-RAG-Bench基准,正是为填补这一空白而诞生。其中,REAL-MM-RAG_FinSlides子集聚焦于金融领域,收录了2008年至2024年间65份季度财务演示文稿,共计2280页,内容以表格为主,承载关键财务洞察。该数据集旨在检验模型在高度结构化的视觉文档中进行跨模态信息检索的能力,其构建过程采用自动化流水线:由视觉语言模型(VLM)生成查询,经大语言模型(LLM)筛选与多层级改写,确保检索任务不止于关键词匹配,而是对深层语义理解的真正考验。该基准的发布为多模态检索领域提供了更具现实挑战性的评测标准,推动了RAG系统在金融等专业场景中的可信应用。
当前挑战
REAL-MM-RAG_FinSlides所面临的挑战可从两个维度剖析。其一,在领域问题层面,金融演示文稿中的表格数据往往布局复杂、数值密集,且视觉呈现方式多样(如堆叠柱状图、嵌套表格),传统的基于文本的检索方法难以精准定位跨模态信息;同时,查询的多层级改写(从措辞微调到结构重组)要求模型具备超越字面匹配的语义泛化能力,这对现有检索模型的鲁棒性构成了严峻考验。其二,在数据集构建过程中,挑战同样显著:如何确保VLM生成的查询既覆盖财务分析的真实场景(如趋势对比、比率计算),又避免低质量或歧义性问题;如何对大量页面进行精确标注,确保所有相关文档均被正确关联,以消除假阴性样本;此外,演示文稿中图文混合的布局使得自动提取查询-图像对应关系时容易引入噪声,需要细致的过滤与验证机制来保证数据集的可靠性与评测的公平性。
常用场景
经典使用场景
REAL-MM-RAG_FinSlides 数据集为多模态检索领域提供了一方独特的试验田,其核心用途在于评估检索模型在面对视觉结构复杂、表格密集的金融演示文稿时的表现。该数据集囊括了2008年至2024年间65份季度财务演示文稿,共计2280页,内容以承载关键财务洞见的表格为主。研究者可借助该数据集,测试模型能否在包含丰富视觉元素(如图表、表格布局)的文档中,精准定位并返回与自然语言查询相关的信息。这一场景尤为贴近实际工作中分析师从大量幻灯片中快速提取财务指标的典型需求,从而成为衡量模型在真实世界多模态检索能力的重要标杆。
实际应用
在实际应用层面,REAL-MM-RAG_FinSlides 数据集所模拟的场景与金融、咨询及企业信息管理领域的核心需求高度契合。例如,投资分析师常需从浩如烟海的季度演示文稿中快速检索特定财务指标(如总资产、营收增长率)的历年变化趋势,该数据集可验证检索增强生成(RAG)系统在此类工作流中的效能。企业知识管理系统亦可借助基于该数据集训练的模型,实现从内部幻灯片库中自动提取关键数据以辅助决策。此外,该数据集还为构建面向金融文档的智能问答助手提供了可靠的评测基础,有助于提升信息检索工具在专业领域的实用性与准确性。
衍生相关工作
围绕 REAL-MM-RAG_FinSlides 数据集,学术界已衍生出若干具有启发性的经典工作。其基础论文《REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark》提出了一个自动化查询生成与多级改写流水线,为后续多模态基准的构建提供了方法论参考。该数据集也催生了对检索模型在表格理解与视觉布局感知方面的专项研究,例如探索如何将视觉语言模型与表格解析技术相结合以提升检索精度。此外,基于该数据集的挑战性,研究者开始关注跨模态语义对齐与细粒度检索排序的改进算法,这些工作共同推动了多模态检索领域从简单匹配向真实场景认知的深刻转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务