遇见数据集

inclusionAI/FinixDocBench

收藏
Hugging Face2026-06-16 更新2026-06-14 收录
官方服务:

资源简介:

FinixDocBench是一个金融领域文档解析基准数据集,专注于金融工作流程中常见但现有基准中代表性不足的文档解析条件。它包含742个页面样本,分为四个子集:FinixDigital(242个数字原生保险条款页面)、FinixPhoto(300个移动设备拍摄的医疗收据页面)、FinixHuge-Long(100个超长金融或保险页面)和FinixHuge-Table(100个大型密集表格页面)。数据集支持全页面Markdown解析、结构化布局解析(适用于FinixDigital和FinixPhoto)和超大页面可处理性评估。每个样本包括图像、Markdown文件和结构化JSON注释(部分子集)。数据集旨在评估OCR和文档解析系统在金融领域文档上的性能,特别是针对噪声文档、超大页面和复杂表格的鲁棒性。

FinixDocBench is a financial-domain document parsing benchmark that focuses on document parsing conditions common in real financial workflows but underrepresented in saturated clean-document benchmarks. It contains 742 page samples across four subsets: FinixDigital (242 digitally native insurance terms pages), FinixPhoto (300 mobile-captured medical receipt pages), FinixHuge-Long (100 ultra-long financial or insurance pages), and FinixHuge-Table (100 large dense table pages). The dataset supports full-page Markdown parsing, structured layout parsing (available for FinixDigital and FinixPhoto), and ultra-large page processability evaluation. Each sample includes an image, a Markdown file, and structured JSON annotations (for some subsets). It is intended for evaluating OCR and document parsing systems on financial documents, particularly for robustness on noisy documents, oversized pages, and complex tables.

提供机构:
inclusionAI
搜集汇总
数据集介绍
inclusionAI/FinixDocBench 数据集图片
构建方式
FinixDocBench是一个专为金融领域文档解析设计的评估基准,其构建源于对真实金融工作流中常见但常被忽视的文档解析挑战的深入反思。该基准精心挑选了742页样本,覆盖四大核心场景:数字化原生保险条款(FinixDigital)、移动拍摄的医疗收据(FinixPhoto)、超长文档(FinixHuge-Long)以及大型密集表格(FinixHuge-Table)。每个样本均配备原始图像、页面级Markdown标注及可选的JSON结构化布局标注,标注采用统一的10类页面元素架构,包括标题、表格、页眉等,并通过像素空间边界框和阅读顺序索引精确描述元素位置与逻辑关系。
特点
FinixDocBench的特点在于其聚焦于现有饱和基准中代表性不足的真实金融文档解析难点。它涵盖了数字原生与移动拍摄的混合场景,显著挑战了模型在噪声、形变、模糊条件下的鲁棒性。超长页面与大型密集表格子集进一步考验了模型处理极高分辨率图像(最高达3.86亿像素)和复杂阅读顺序的能力。该基准提供了统一的评估指标,包括文本块编辑距离、阅读顺序编辑距离和表格树编辑距离,并引入了成功率指标以衡量系统在极端条件下的整体可处理性,从而全面刻画模型的实用性能。
使用方法
FinixDocBench的使用方法灵活多样,支持三大互补任务:全页面Markdown解析、结构化布局解析及超大型页面可处理性评估。用户可通过Hugging Face的datasets库加载清单文件,或直接克隆仓库读取本地样本,轻松获取图像、Markdown及JSON标注。基准内置轻量级Markdown评估器,通过简单的命令行即可运行评估,报告文本、阅读顺序和表格的详细得分。对于结构化布局,用户需自行实现匹配规则与坐标约定。该基准严禁用于训练或优化,仅作为评估工具,确保结果的公正性与可比性。
背景与挑战
背景概述
随着深度学习在文档理解领域的迅猛发展,现有基准测试多聚焦于清晰、规整的数字文档,而金融场景下广泛存在的复杂文档,如噪声拍摄的医疗收据、超长页面及稠密表格,仍未得到充分评估。为此,蚂蚁集团研究团队于2026年提出了FinixDocBench,该基准测试由Hang Wang等学者合作构建,旨在突破饱和基准的局限,系统评估模型在真实金融工作流中的文档解析能力。FinixDocBench涵盖原生数字保单、移动端拍摄收据、超长页面及大表格四大子集,共742页样本,并提供Markdown重建与结构化布局解析两类任务。其发布为金融文档解析领域提供了更具挑战性的评估平台,推动了相关研究从实验室环境向实际应用的转变。
当前挑战
FinixDocBench的核心挑战首先在于领域问题的复杂化:传统图像分类、OCR基准难以应对金融文档中常见的拍照模糊、光照不均、页面超长及表格密度过高等因素,模型须在保持高精度解析的同时,兼顾噪声鲁棒性和内容完整性。其次,数据构建过程面临严苛挑战,包括隐私合规审查导致的内部评估集FinixInner无法公开,以及超长页面和大表格图像高达数亿像素的处理难题,例如加载、解码与模型输入窗口的限制。此外,不同子集对阅读顺序恢复、表格结构重建等细粒度能力提出差异化要求,在有限公开样本下实现公平且可复现的评估亦构成技术难点。
常用场景
经典使用场景
在金融文档解析研究领域,FinixDocBench作为首个聚焦真实金融场景的细粒度基准,其经典使用场景涵盖三大维度:一是对数字原生保险合同条款进行全页Markdown重建与结构化布局解析;二是面向移动拍摄的医疗票据,评估模型在噪声、畸变、光照不均等复杂成像条件下的鲁棒解析能力;三是对超长文档页面和超大稠密表格进行端到端可处理性测试。该基准通过统一的多类别标注体系(10类页面元素)与阅读顺序索引,为模型提供了从文本转录、表格还原到版式重构的完整评价框架,尤其强调在传统干净文档基准上表现饱和的模型,在真实金融工作流中可能遭遇的性能瓶颈。
衍生相关工作
围绕FinixDocBench数据集的构建理念与评测发现,一系列相关研究工作应运而生。其技术报告首次提出超越饱和基准的文档解析评估框架,催生了面向金融领域的专用视觉语言模型FinixDoc-VL,该模型在保险条款与医疗票据的总体得分上分别达到93.19和67.03,显著优于通用大模型。此外,该基准推动了多款主流文档解析系统(如MinerU、GLM-OCR、DeepSeek-OCR-2)在金融场景下的针对性优化,并促成了对超大文档处理策略——如图像分块、动态分辨率调整及层次化阅读顺序预测——的系统性探索。这些衍生工作共同构建了一个从基准构建到算法改进的完整研究闭环,标志着金融文档解析领域正从通用竞赛迈向场景深耕的新阶段。
数据集最近研究
最新研究方向
FinixDocBench作为金融领域文档解析的前沿基准,聚焦于真实业务场景中未被传统静态基准充分覆盖的挑战性任务,如数字原生保险条款、手机拍摄的医疗收据、超长页面与密集大表格的解析。该数据集通过提供细粒度的页面级Markdown重建与结构化布局标注,推动了OCR、版面分析、表格识别及阅读顺序恢复等技术的评估边界。其引入的FinixHuge轨道更关注系统对超大文档的处理能力,揭示了当前多模态大模型在极端尺寸与复杂表格场景下的性能瓶颈。这一基准的发布,不仅为金融文档智能处理设立了更具实用价值的评测标准,也催化了多模态基础模型在复杂排版、噪声环境与长文本理解方面的研究突破,对提升保险、医疗等行业的自动化文档处理水平具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务