ViDoRe V3
收藏资源简介:
ViDoRe V3是由Illuin Technology等机构推出的多模态检索增强生成基准测试数据集,涵盖10个专业领域的26,000页文档,包含3,099条人工验证的多语言查询。数据集通过12,000小时人工标注,提供了检索相关性、边界框定位和参考答案的高质量标注,支持视觉与文本混合检索任务。其文档来源于政府、教育和工业领域的开放许可资源,采用三阶段人工协同流程构建,重点解决复杂跨文档视觉元素检索、多语言查询及细粒度视觉定位等现实场景挑战,适用于金融、医药、工业维护等领域的知识密集型NLP任务评估。
ViDoRe V3 is a multimodal retrieval-augmented generation benchmark dataset developed by Illuin Technology and other institutions. It covers 26,000 pages of documents across 10 professional domains, and includes 3,099 manually verified multilingual queries. With 12,000 man-hours of manual annotation, the dataset provides high-quality annotations covering retrieval relevance, bounding box localization and reference answers, supporting hybrid visual-textual retrieval tasks. Constructed via a three-stage collaborative manual workflow, the dataset sources its documents from open-licensed resources in government, education and industrial sectors. It focuses on addressing real-world challenges such as complex cross-document visual element retrieval, multilingual queries and fine-grained visual localization, and is suitable for evaluating knowledge-intensive NLP tasks in fields including finance, medicine and industrial maintenance.
ViDoRe 数据集概述
数据集项目简介
ViDoRe(Visual Document Retrieval)是一个专注于视觉文档检索的项目,由 ILLUIN Technology 开发,并获得了 NVIDIA 的贡献。该项目包含模型、数据集、基准测试和代码,旨在解决企业级应用中从复杂、视觉丰富的文档中检索准确信息的挑战。
核心基准测试:ViDoRe V3
ViDoRe V3 是最新发布的基准测试,旨在为多模态企业文档检索评估设定新的行业黄金标准。
- 设计目标:评估生产环境中的检索增强生成(RAG)系统。
- 数据特点:
- 包含 10个 具有挑战性的真实世界数据集,涵盖多个工业领域。
- 包含 26,000多页 文档和 3,000多个 查询。
- 查询被翻译成 6种 语言。
- 数据基于真实、人工创建和人工验证的标注,而非合成数据。
- 标注信息包括相关页面、关键元素的精确边界框以及全面的参考答案。
- 数据构成:10个数据集中,8个已公开,2个保持私有。
相关模型
项目发布了多个用于视觉文档检索的模型,包括:
- ColPali(最新版本:v1.3)
- ColQwen2(最新版本:v1.0)
- ColQwen2.5(最新版本:v0.2)
- ColSmol(256M & 500M)
- ModernVBERT(最新版本:v1.0)
数据集示例
在数据集中,可以找到以下示例(部分):
vidore/vidore_v3_hrvidore/vidore_v3_finance_envidore/vidore_v3_industrialvidore/vidore_v3_pharmaceuticalsvidore/vidore_v3_finance_frvidore/vidore_v3_physicsvidore/vidore_v3_energyvidore/vidore_v3_computer_science
引用信息
如果研究中使用此组织的任何数据集或模型,请引用以下论文:
- ColPali: Efficient Document Retrieval with Vision Language Models (2024)
- ViDoRe Benchmark V2: Raising the Bar for Visual Retrieval (2025)
- ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios (2026)
联系方式
- Quentin Macé:
quentin.mace@illuin.tech
致谢
此项工作得到了 ILLUIN Technology 的部分支持。

- 1ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World ScenariosIlluin Technology; NVIDIA; 巴黎萨克雷大学·CentraleSupélec · 2026年



