jgov_v1.4_full_ann
收藏资源简介:
该数据集包含两个部分:1) Silviase/jgov:将日本政府(e-Gov)开放数据门户中的政策评估PDF转换为页面图像的数据集,包含图像和PDF嵌入文本(有时可能为空);2) Silviase/jgov_v1.4_full_ann:在前者基础上使用PaddleOCR-VL添加Markdown格式OCR文本的增强数据集。数据集专门针对包含表格和表单的日文PDF文档的布局识别和OCR评估需求设计。原始PDF来自e-Gov开放数据门户(CC-BY-4.0许可),派生数据(渲染图像和OCR文本)也遵循相同许可。数据集包含约896,725个页面,采用200 DPI RGB图像格式,使用MuPDF渲染和pdfplumber提取文本。
This dataset comprises two components: 1) Silviase/jgov: A dataset that converts policy assessment PDFs from the Japanese government (e-Gov) Open Data Portal into page-level images, including both the rendered images and PDF-embedded text (which may occasionally be empty). 2) Silviase/jgov_v1.4_full_ann: An enhanced dataset built upon the aforementioned one, which adds Markdown-formatted OCR text using PaddleOCR-VL. This dataset is specifically designed for layout recognition and OCR evaluation tasks targeting Japanese PDF documents containing tables and forms. Original PDFs are sourced from the e-Gov Open Data Portal under the CC-BY-4.0 license, and the derived data (rendered images and OCR text) also adheres to the same license. The dataset contains approximately 896,725 pages, stored in 200 DPI RGB image format, with text rendered using MuPDF and extracted via pdfplumber.
数据集概述
数据集名称
- Silviase/jgov_v1.4_full_ann
数据集概要
- 本数据集基于日本电子政务开放数据门户(e-Gov Open Data Portal)的政策评估PDF文件生成,包含页面图像及通过PaddleOCR-VL模型识别的Markdown格式OCR文本。
- 主要面向包含表单和表格的日语PDF的版面识别与OCR评估用途。
数据来源与许可
- 原始数据来源:e-Gov Open Data Portal (https://data.e-gov.go.jp/)
- 原始数据使用条款:https://data.e-gov.go.jp/info/terms
- 许可证:
- 原始PDF文件遵循CC-BY-4.0许可(需注明出处)。
- 本数据集衍生物(渲染图像、OCR文本)继承CC-BY-4.0许可,并保留出处信息。
- 使用的PaddleOCR-VL工具遵循Apache-2.0许可(https://github.com/PaddlePaddle/PaddleOCR/blob/release/2.7/LICENSE),但其生成的OCR产物在CC-BY-4.0许可范围内可再分发。
数据内容与结构
- 数据集列(Columns):
fname:文件名。image:页面图像(datasets.Image格式)。ocr_text_paddleocrvl:PaddleOCR-VL识别的Markdown格式文本。source:固定为"jgov"。conversations:列表格式,其中assistant字段包含OCR输出文本。
- 数据规模:共896,725个页面(已排除1个损坏页面)。
- 基础数据集(Silviase/jgov)内容:
image:页面图像(datasets.Image格式),200 DPI,RGB色彩,使用MuPDF渲染。text:PDF内嵌文本(可能为空)。source:原始PDF文件路径。page:页码(从1开始)。
数据生成流程
- 基础数据集(Silviase/jgov)生成:
- 通过e-Gov CKAN API收集PDF文件URL并下载。
- 使用MuPDF(
pymupdf)以200 DPI、RGB格式将PDF页面渲染为图像。 - 使用
pdfplumber提取PDF内嵌文本层(非OCR,可能为空)。
- OCR标注数据集(Silviase/jgov_v1.4_full_ann)生成:
- 输入:Silviase/jgov数据集中的图像序列。
- OCR处理:使用PaddleOCR-VL模型进行Markdown格式的OCR识别。
- 后处理:仅从Markdown输出中移除内联
style属性(保留HTML标签)。 - 排除1个损坏的图像页面后,将结果写入JSONL文件并推送至Hugging Face Hub。
数据质量与注意事项
- Silviase/jgov:文本内容依赖PDF内嵌文本,可能存在为空或乱码的情况。
- Silviase/jgov_v1.4_full_ann:OCR文本为PaddleOCR-VL模型的原始输出(仅移除style属性)。表格或版面的识别错误取决于模型性能。
使用方法
- 加载基础数据集:
datasets.load_dataset("Silviase/jgov", split="train") - 加载OCR标注数据集:
datasets.load_dataset("Silviase/jgov_v1.4_full_ann", split="train")- 访问图像:
example["image"]返回PIL.Image对象。 - 访问OCR文本:
example["ocr_text_paddleocrvl"]或example["conversations"][0]["assistant"]返回Markdown格式文本。
- 访问图像:
引用信息
- 数据集:
Silviase/jgov_v1.4_full_ann(Hugging Face Datasets) - 数据来源:e-Gov Open Data Portal (遵循CC-BY-4.0许可,需注明出处)




