入门级验证码数据集
收藏资源简介:
本数据集从河南部分高校网站登录页面中采集取得。数据集中单张四字图像共计9453张,单张单字图像共计2000张,字符均为0~9数字。数据在自动标注后进行了人工审核,可以保证误差在极小范围。
This dataset was collected from the login pages of several universities in Henan Province. It comprises a total of 9,453 images of four-digit numbers and 2,000 images of single-digit numbers, all ranging from 0 to 9. The data underwent automatic annotation followed by manual verification to ensure minimal error margins.
入门级验证码数据集概述
数据集简介
本数据集包含两部分:单张四字图像共计9453张和单张单字图像共计2000张。所有字符均为0~9数字。数据经过自动标注后进行了人工审核,确保误差极小。
数据集结构
目录结构
- Classify_Dataset: 单张单字数据集
- Classify_Module: 单张单字深度学习训练+推理模型Demo
- OCR_Dataset: 单张四字数据集
- OCR_Module: 单张四字深度学习训练+推理模型Demo
- LICENSE: 许可文件
Classify_Dataset文件结构
- 图像文件: 15x30 JPEG-24Bit结构
- 标签文件:
label_dict.txt,格式为{str(文件名):int(label)}
OCR_Dataset文件结构
- 图像文件: 70x30 JPEG-24Bit结构
- 标签文件: 标签为
str(xxxx)格式
标签文件结构
- Classify_Dataset:
{str(文件名):int(label)} - OCR_Dataset:
{str(文件名):str(xxxx)}
数据集使用示例
python import os import PIL.Image as Image
DATA_PATH = "数据集所在的路径"
读取label字典
with open(os.path.join(DATA_PATH, "label_dict.txt"), "r", encoding="utf-8") as f: info = eval(f.read())
遍历读取到的字典
for file_name in info: label = info[file_name] img = Image.open(os.path.join(DATA_PATH, file_name)) print(file_name, "图片读取成功,Label为", label) img.show()




