adopd2024
收藏资源简介:
ADOPD是一个用于文档页面分解的大规模数据集,其特点是通过一种新颖的数据驱动文档分类发现方法进行数据收集。该方法结合了大规模预训练模型和人在回路过程,以确保数据的多样性和平衡。ADOPD包括密集标注的文档图像标签,涵盖四个任务:Doc2Mask、Doc2Box、Doc2Tag和Doc2Seq。每个图像的标注包括人工标记的实体掩码、文本边界框以及自动生成的标签和说明。详细的实验分析验证了数据驱动的文档分类方法,并使用不同的模型评估了四个任务。ADOPD旨在支持未来在文档图像理解方面的研究。
数据集概述
ADOPD 是一个用于文档页面分解的大型数据集,其特点是通过一种新颖的数据驱动文档分类发现方法进行数据收集。该方法结合了大规模预训练模型和人工参与过程,以确保数据的多样性和平衡性。ADOPD 包含了密集标注的文档图像标签,涵盖四个任务:Doc2Mask、Doc2Box、Doc2Tag 和 Doc2Seq。每个图像的标注包括人工标记的实体掩码、文本边界框以及自动生成的标签和描述。详细的实验分析验证了数据驱动文档分类方法,并使用不同模型评估了四个任务。ADOPD 旨在支持未来在文档图像理解方面的研究。
数据集信息
ADOPD 数据集总共包含 120,000 张图像,语言分布如下:
- 英语:60,000 张
- 中文:20,000 张
- 日语:20,000 张
- 其他:20,000 张
标注
待补充,即将到来。
引用
@inproceedings{ gu2024adopd, title={{ADOPD}: A Large-Scale Document Page Decomposition Dataset}, author={Jiuxiang Gu and Xiangxi Shi and Jason Kuen and Lu Qi and Ruiyi Zhang and Ani Nenkova and Tong Sun}, booktitle={The Twelfth International Conference on Learning Representations}, year={2024}, url={https://openreview.net/forum?id=x1ptaXpOYa} }
许可证
cc-by-nc-nd-4.0




