SCUT-EPT Dataset
收藏资源简介:
SCUT-EPT数据集包含50,000个文本行图像,用于离线手写中文文本识别(HCTR)研究,特别针对教育文档。数据集面临多种挑战,如字符擦除、文本行补充、字符/短语切换、噪声背景、非均匀字大小和不平衡文本长度。
The SCUT-EPT dataset comprises 50,000 line images of text, specifically designed for research in offline handwritten Chinese text recognition (HCTR), with a focus on educational documents. The dataset presents various challenges, including character erasures, text line supplementation, character/phrase switching, noisy backgrounds, non-uniform character sizes, and imbalanced text lengths.
SCUT-EPT数据集概述
数据集基本信息
- 名称: SCUT-EPT Dataset
- 用途: 用于离线手写中文文本识别(HCTR)研究,特别是在教育文档中的应用。
- 数据量: 包含50,000个文本行图像,其中40,000个用于训练,10,000个用于测试。
- 来源: 选自2,986名志愿者的考试试卷。
数据集特点
- 挑战性: 数据集面临多种挑战,包括字符擦除、文本行补充、字符/短语切换、噪声背景、非均匀字号和不平衡文本长度。
- 字符类别: 总计4,250类,包括4,033个常用中文字符、104个符号和113个异常中文字符。
- 样本分布: 字符样本总数为1,267,161,平均每行文本约含25个字符。
数据集使用限制
- 使用目的: 仅限于非商业研究用途。
- 申请使用: 需填写申请表并通过电子邮件发送至指定邮箱,同时需提供近6年内的1-2篇相关研究领域的出版物。
数据集下载
- 下载链接:
- Baidu Cloud (密码: bk3x, 大小: 1.08GB)
- OneDrive
数据集样本分布
- 不平衡性: 41%的类别样本数少于10个,3%的类别样本数超过2000个。
- 典型样本: 展示了各级别的典型样本,符合日常使用频率。
图像特征
- 文本行图像宽度: 大部分样本(约70%)宽度在1,200至1,400像素之间。
- 文本行图像高度与宽度: 多数样本的高度范围为30至100像素,宽度主要分布在1,200至1,400像素。
实验结果
- 识别方法: 使用基于深度学习的seq-to-seq方法,取得了当前最先进的结果。
引用与联系
-
引用文献:
@article{zhu2018scut, title={SCUT-EPT: a New Dataset and Benchmark for Offline Chinese Text Recognition in Examination Paper}, author={Zhu, Yuanzhi and Xie, Zecheng and Jin, Lianwen and Chen, Xiaoxue and Huang, Yaoxiong and Zhang, Ming}, journal={IEEE Access}, year={2018}, publisher={IEEE} }
-
联系方式: 如有疑问,请联系Prof. Jin (eelwjin@scut.edu.cn)。




