相关数据集
BID
该存储库引入了名为巴西身份证件数据集(BID 数据集)的数据集:巴西身份证件的第一个公共数据集。 BID 数据集在工作中提出:“BID 数据集:文档处理任务的挑战数据集”,旨在解决计算机视觉领域的三个关键挑战:(i)文档图像分类; (ii) 文本区域分割和 (iii) 光学字符识别 (OCR)。 BID Dataset 由巴西身份证件的图像组成,分为八类:国家驾驶执照(CNH)的正面和背面、CN
OpenDataLab2026-07-12 更新3290
【快瞳AI】 印刷文字识别_免费试用-通用文字OCR识别_支持私有化部署
快瞳科技-文字OCR识别,通用文字识别专用识别模型,精准识别各类文档文字信息,结构化提取、输出可编辑文本。提供标准的、安全的接口服务,应对不同前端系统的接入请求,进行转换适配。
腾讯云市场150
doc_split
DocSplit Benchmark 是一个专注于文档处理领域的综合基准数据集,主要用于文档包识别与分割任务的研究与评估。该数据集由亚马逊于2026年2月发布,包含100万至1000万量级的样本数据,支持英语、阿拉伯语和印地语三种语言。数据集适用于文档理解、文档包分割、文档分类、文档识别和文档分割等多种文档处理任务。根据标签信息显示,该数据集特别适合开发和研究文档包自动识别与分割技术。数据集采用c
Hugging Face2026-02-05 更新210
dgambettaphd/D_gen6_run2_llama2-7b_wiki_doc1000_real96_synt32_vuw
该数据集包含1000个训练示例,每个示例包含一个唯一的id和一个doc字段,doc字段存储文档内容。数据集总大小为547339字节,下载大小为349061字节。数据集仅包含一个名为train的分割。
Hugging Face2024-12-17 更新140



