ACCID
收藏数据链接:
官方服务:
资源简介:
一个包含部首级和字级标注的古代汉字图像数据集,用于满足上述方法的需求,其中部首级标注包括部首类别、部首位置和结构关系。
An ancient Chinese character image dataset with radical-level and character-level annotations, developed to meet the requirements of the aforementioned methods, where the radical-level annotations include radical category, radical position, and structural relationship.
创建时间:
2023-08-02
搜集汇总
数据集介绍

构建方式
ACCID数据集的构建始于从古代文字资源中采集甲骨文拓片图像,利用字符识别工具自动定位与裁剪独立字符,并提取其类别标签。为确保标注准确性,十位古文字专家对字符级标注进行了多轮校对。在偏旁级标注方面,研究团队基于大型甲骨文知识图谱ZiNet获取了包含595个偏旁类别与14种结构关系的分解字典,并设计了一套结合自动检测与人工标注的流水线:对于单偏旁字符,直接采用字符类别作为偏旁标签并利用目标检测方法定位;对于多偏旁字符,由八位考古专家手动标注偏旁类别、坐标及结构关系,随后由两位资深专家进行复核仲裁,从而保证了标注的黄金标准质量。此外,为扩充训练样本,论文提出了一种基于拼接的合成字符算法,通过从现有字符中裁剪偏旁图像,随机进行缩放、旋转等数据增强后,依据预定义结构重新拼接生成新的合成字符图像,最终生成了46,800张合成样本。
使用方法
ACCID数据集的使用方法灵活多样,可服务于多项研究任务。对于传统的字符识别任务,用户可直接利用字符级标签(类别)进行多分类模型训练与评估。对于偏旁识别任务,偏旁类别标签与坐标信息可用于训练目标检测模型(如Faster R-CNN、YOLO)以定位和识别图像中的偏旁。结构分类任务则可利用14种结构标签训练分类网络。更为重要的是,ACCID专为零样本字符识别设计:用户可按照论文提出的基线方法,首先训练一个偏旁与结构提取器(RSE),从输入图像中检测偏旁类别、位置及结构关系;随后通过基于置信度的偏旁-字符匹配策略(CRCM),利用预定义的字符分解字典将提取的偏旁与结构信息推理出字符类别,从而实现对未见字符类别的识别。数据集中80%的样本可作为训练集,剩余20%作为测试集,而仅含单个样本的类别则专门用于零样本评估。此外,拼接合成算法生成的扩充样本可直接加入训练集,进一步提升模型泛化能力。
背景与挑战
背景概述
光学字符识别(OCR)技术已广泛应用于街景文字识别与文档分析等领域,然而现实场景中字符使用频率的不均衡分布导致传统深度学习方法在少样本或未见字符类别上表现欠佳。针对这一瓶颈,吉林大学与特伦托大学的研究人员于2023年联合构建了ACCID数据集,旨在为零样本字符识别提供基准。该数据集聚焦于甲骨文这一古老文字系统,包含2,892个字符类别与595个部首类别,并提供了字符级与部首级双重标注,包括部首类别、位置坐标及结构关系。ACCID的提出不仅填补了零样本OCR评估基准的空白,也为古文字数字化保护与智能化研究提供了关键资源,对推动文化遗产计算领域的发展具有深远意义。
当前挑战
ACCID面临的挑战主要体现在两个方面。首先,在领域问题层面,零样本字符识别需应对极端不均衡的数据分布,部分字符类别仅有单一样本,而传统OCR方法依赖大量均衡训练数据,难以泛化至未见类别;同时,甲骨文图像普遍存在腐蚀噪声与摩擦痕迹,进一步加剧了识别难度。其次,在数据集构建过程中,部首级标注涉及精细的语义分解与空间定位,需兼顾语言学先验与图像特征,人工标注成本高昂且易产生歧义;此外,为缓解样本稀缺问题而提出的拼接式合成字符算法虽能扩充数据,但合成图像与真实图像之间存在分布差异,如何保证合成数据的质量与有效性仍是关键挑战。
常用场景
经典使用场景
ACCID数据集的核心应用场景在于零样本字符识别任务,尤其针对甲骨文等古代汉字图像。该数据集通过提供字符级与部首级双重标注,使得模型能够基于分解的部首和结构信息,对训练中未曾出现的字符类别进行推理与识别。这一设计有效应对了古代字符数据分布极度不均衡、部分字符样本稀缺甚至缺失的现实困境。研究者可利用ACCID训练端到端的部首-结构提取网络,再结合知识图谱中的字符分解字典,实现从图像到字符的零样本分类,从而突破传统OCR方法对大量标注样本的依赖。
解决学术问题
ACCID解决了两个关键学术问题:其一,缺乏同时包含部首级和字符级标注的高质量基准数据集,导致零样本OCR方法难以训练与公平评估;其二,古代字符因使用频率不均和出土数量有限,面临严重的长尾分布与样本稀缺问题。通过引入部首分解与重组策略,ACCID将字符识别转化为对更均衡、更丰富的部首类别的检测与推理,显著缓解了少样本和未见类别的识别瓶颈。该数据集为计算机视觉与文化遗产交叉领域提供了标准化评测平台,推动了零样本学习在OCR中的理论探索与实践验证。
实际应用
在实际应用中,ACCID为甲骨文等古代文字的数字化保护与智能解读提供了关键技术支撑。考古学家与文化遗产机构可利用基于该数据集训练的模型,自动识别出土文献中的残缺或罕见字符,大幅提升文物整理与研究的效率。此外,该数据集的拼接式合成字符算法为数据增强提供了可行范式,可迁移至其他东亚文字(如汉字、韩文、日文)的识别系统。在古籍数字化、在线教育、博物馆智能导览等场景中,ACCID驱动的零样本识别技术能够处理大规模、多样化的字符图像,降低人工标注成本,加速文化资源的传播与利用。
数据集最近研究
最新研究方向
在光学字符识别领域,数据分布不均衡与罕见字符识别始终是制约模型泛化能力的核心瓶颈。ACCID数据集以甲骨文为载体,通过引入部首级别的精细标注(包括类别、坐标与结构关系),为零样本字符识别开辟了全新路径。该数据集不仅揭示了部首共享性在缓解长尾分布问题中的关键作用,还通过拼接式合成算法扩充训练样本,显著提升了模型对未见字符的推理能力。当前前沿研究正聚焦于基于部首分解与重构的零样本识别框架,ACCID为这一方向提供了黄金标准基准,推动了文化遗产数字化与低资源语言OCR技术的实质性突破,其影响力已延伸至东亚文字识别与跨语言字符理解等热点议题。
相关研究论文
- 1Toward Zero-shot Character Recognition: A Gold Standard Dataset with Radical-level Annotations · 2023年
以上内容由遇见数据集搜集并总结生成



