ICDAR 2017 Competition SmartDoc - Final Test dataset
收藏官方服务:
资源简介:
该数据集是ICDAR 2017 SmartDoc竞赛的最终测试数据集,参与者需要处理整个数据集才能提交结果。数据集不包含地面实况,地面实况将在稍后发布。
This dataset serves as the final test dataset for the ICDAR 2017 SmartDoc competition. Participants are required to process the entire dataset in order to submit their results. The dataset does not include ground truth, which will be released at a later date.
创建时间:
2017-05-29
原始信息汇总
ICDAR 2017 Competition SmartDoc - Final Test dataset 概述
数据集描述
数据集目的
- 用于ICDAR 2017 Competition SmartDoc的最终测试。
- 目标是通过视频模式扫描文档,并重建高质量图像,模拟使用完美扫描仪的效果。
数据集内容
- 包含多个样本,每个样本包括:
- 一个MP4格式的视频序列,时长2至58秒,约25 FPS,无声音,低压缩。
- 一个PNG格式的参考帧图像,包含文档的大致可见和清晰部分。
- 一个JSON文件,包含目标图像的分辨率和形状,以及输入视频的形状和文档的坐标。
数据集结构
-
数据集组织为以下文件结构:
icdar_smartdoc17_reconstruction/ ├── sample01/ │ ├── input.mp4 │ ├── reference_frame_NN_dewarped.png │ ├── reference_frame_NN_extracted.png │ ├── reference_frame_NN_extracted_viz.png │ └── task_data.json ├── sample02/ │ └── … ├── … └── sampleMM/ └── …
文件格式和描述
- input.mp4: 视频流,需处理以生成接近ground_truth.png的图像。
- reference_frame_NN_dewarped.png: 与ground truth图像相同形状的图像,用于确定生成图像的精确形状。
- reference_frame_NN_extracted.png: 从视频中提取的同一帧图像。
- reference_frame_NN_extracted_viz.png: 与提取图像相同,但增加了跟踪对象的轮廓可视化。
- task_data.json: 包含重要坐标和形状的JSON文件,用于指导图像生成。
预期输出
- 生成的高分辨率、无缺陷的文档图像,应与原始文档的数字栅格版本尽可能相似。
- 图像应使用PNG无损格式,颜色编码为sRGB。
数据集使用
- 参与者需处理整个数据集并提交结果,数据集不包含ground truth,将在后期发布。
搜集汇总
数据集介绍

构建方式
ICDAR 2017 Competition SmartDoc - Final Test dataset的构建,旨在模拟现实场景中,用户利用移动设备捕捉文档视频,并通过算法重构出高质量图像的过程。该数据集由多个视频样本组成,每个样本包含了文档的部分或全部内容。构建过程中,特别考虑了文档尺寸、反光表面、图文内容等多种挑战因素,以及模糊帧、室内外拍摄、光照条件变化和运动多样等捕捉条件。此外,数据集还提供了用于辅助图像重构的参考帧及其坐标信息。
特点
该数据集的特点在于其现实性、多样性和挑战性。它包含了不同用户、不同设备捕捉的文档视频,涵盖了从模糊到清晰、从室内到室外、从低光照到高光照的各种复杂情况。数据集不提供真实标签,而是通过提供参考帧和坐标信息来辅助参赛者完成文档重构任务。此外,该数据集的构建遵循Creative Commons Attribution-ShareAlike 4.0国际许可,保证了数据的合法使用和共享。
使用方法
使用该数据集时,参赛者需根据提供的视频样本,通过算法处理生成高质量的文档图像。具体步骤包括:解析视频样本中的关键帧和坐标信息,利用这些信息进行图像重构,最终输出符合指定分辨率和尺寸的无缺陷高分辨率图像。数据集的评估将侧重于图像的可读性改善,参赛者需确保生成的图像在保持原始文档内容的同时,达到高清晰度和无缺陷的标准。
背景与挑战
背景概述
ICDAR 2017 Competition SmartDoc - Final Test dataset是2017年国际文档分析与识别会议(ICDAR)举办的SmartDoc竞赛的最终测试数据集。该数据集由西班牙巴塞罗那自治大学(CVC - UAB)和法国勒阿弗尔大学(L3i - ULR)共同提供,旨在推动移动设备文档视频捕捉与重建技术的发展。竞赛要求参与者开发出一种方法,能够将手机捕捉的文档视频转化为高质量图像,效果如同使用完美扫描仪扫描一般。该数据集自发布以来,对文档图像处理领域产生了显著影响,推动了相关技术的进步。
当前挑战
该数据集在研究领域中提出了多重挑战。首先,它要求处理的手持视频数据具有多样性,包括不同的用户、设备以及文档尺寸。其次,文档表面反光、图文内容复杂,且捕捉条件多变,如模糊帧、室内外拍摄环境、多种照明条件以及不同的移动轨迹。此外,竞赛还要求解决拼接和图像恢复问题。为了确保问题的可处理性和结果的可评估性,数据集中提供了额外的信息,如目标分辨率、图像形状以及感兴趣区域的坐标。这些挑战使得该数据集成为检验文档图像处理算法性能的一个重要基准。
常用场景
经典使用场景
在文档视频捕捉与重建领域,ICDAR 2017 Competition SmartDoc - Final Test dataset承担着至关重要的角色。该数据集被广泛用于评估参与者创建的方法,这些方法旨在将手动的文档视频捕捉转化为高质量的静态图像,仿佛是通过完美扫描仪捕获的一般。经典的使用场景包括对输入视频流进行处理,以生成与地面真实图像尽可能接近的图像。
实际应用
在实际应用中,该数据集的应用场景广泛,包括但不限于移动设备上的文档扫描、数字化存档和OCR(光学字符识别)。它使得研究人员和开发人员能够设计出更加精确的算法,以应对现实世界中的文档捕捉和重建挑战,从而提升用户体验和文档处理效率。
衍生相关工作
基于该数据集,衍生出了众多相关工作,包括但不限于视频帧的稳定化、图像去畸变、光照校正以及超分辨率重建等。这些工作进一步推动了文档捕捉与重建技术的发展,并在学术界和工业界产生了深远的影响。
以上内容由遇见数据集搜集并总结生成



