遇见数据集

tarteel-ai/quranqa

收藏
Hugging Face2024-09-11 更新2024-03-04 收录
官方服务:

资源简介:

QRCD(古兰经阅读理解数据集)由1,093个问题-段落对组成,这些对与提取的答案结合形成了1,337个问题-段落-答案三元组。数据集支持的任务是问答系统,使用部分互逆排名(pRR)作为评估指标。数据集的语言是古兰经阿拉伯语,数据集的创建和注释过程由专家生成。数据集的结构包括数据实例、数据字段和数据分割。数据集的许可证是CC-BY-ND 4.0。

QRCD (Quranic Reading Comprehension Dataset) comprises 1,093 question-passage pairs, which are paired with extracted answers to generate 1,337 question-passage-answer triplets. The task supported by this dataset is question answering, with partial reciprocal rank (pRR) adopted as the evaluation metric. The dataset is in Quranic Arabic. Its creation and annotation processes were conducted by domain experts. The dataset structure encompasses data instances, data fields and data splits. The dataset is licensed under CC-BY-ND 4.0.

提供机构:
tarteel-ai
原始信息汇总

数据集概述

数据集名称

  • 名称: Quranic Reading Comprehension Dataset (QRCD)

数据集基本信息

  • 语言: 古兰经阿拉伯语
  • 许可证: CC-BY-ND 4.0
  • 多语言性: 单语种
  • 数据集大小: 小于1K至10K之间
  • 数据来源: 原始数据
  • 标签: 古兰经, 问答
  • 任务类别: 问答
  • 任务ID: 抽取式问答

数据集内容

  • 组成: 包含1,093个问题-段落对,共构成1,337个问题-段落-答案三元组。
  • 数据实例结构: 每个实例包含一个段落、一个问题及一个可能包含一个或多个答案的列表。

数据集结构

  • 数据字段:
    • pq_id: 样本ID
    • passage: 上下文文本
    • surah: 章节号
    • verses: 诗句范围
    • question: 问题文本
    • answers: 答案列表及其起始字符位置
  • 数据分割:
    • 训练集: 65%, 710对
    • 开发集: 10%, 109对
    • 测试集: 25%, 274对
    • 总计: 100%, 1,093对

评估指标

  • 官方评估指标: 部分逆秩(pRR)
  • 其他评估指标: 精确匹配(EM)和F1@1

数据集创建

  • 许可证: CC-BY-ND 4.0

  • 引用信息:

    @article{malhas2020ayatec, author = {Malhas, Rana and Elsayed, Tamer}, title = {AyaTEC: Building a Reusable Verse-Based Test Collection for Arabic Question Answering on the Holy Qur’an}, year = {2020}, publisher = {Association for Computing Machinery}, address = {New York, NY, USA}, volume = {19}, number = {6}, issn = {2375-4699}, url = {https://doi.org/10.1145/3400396}, doi = {10.1145/3400396}, journal = {ACM Trans. Asian Low-Resour. Lang. Inf. Process.}, month = {oct}, articleno = {78}, numpages = {21}, keywords = {evaluation, Classical Arabic} }

贡献者

搜集汇总
数据集介绍
构建方式
《古兰经》阅读理解数据集(QRCD)由tarteel-ai团队精心构建,旨在推动阿拉伯语典籍的机器阅读理解研究。该数据集以《古兰经》经文为基础,从Tanzil项目1.0.2版本的简单纯净文本样式中提取语料,通过专家标注的方式,将经文片段与人工设计的问答对进行匹配。每个样本包含一个经文段落、一个相关问题以及至少一个精准提取的答案,最终形成了1,093组问题-段落对与1,337组问题-段落-答案三元组。数据集按照65%、10%、25%的比例划分为训练集、开发集和测试集,确保模型评估的严谨性。
特点
QRCD数据集的核心特点在于其专为《古兰经》经文设计的抽取式问答任务,所有文本均采用古兰经阿拉伯语,保持了典籍语言的纯正性。每个问题可能对应多个答案,且同一段落或问题可出现在不同样本中,增加了数据多样性。评估体系采用部分倒数排名(pRR)作为官方指标,兼顾答案的部分匹配与排序性能,同时辅以精确匹配(EM)和F1@1指标,全面衡量系统的答案抽取能力。该数据集在规模上虽属中小型,但其领域专精性与专家级标注质量,使其成为阿拉伯语宗教文本问答研究的重要基准。
使用方法
使用QRCD数据集时,研究者可直接从HuggingFace加载tarteel-ai/quranqa,数据以JSON格式存储,包含pq_id、passage、surah、verses、question及answers字段。适用于构建抽取式问答模型,模型需从给定经文章节中定位答案的起始字符位置。评估时,官方推荐采用pRR指标,允许部分匹配以奖励接近正确答案的预测。开发者可参照ACL论文中的基线方法,利用预训练语言模型进行微调,并依据数据划分进行训练与测试,以推动古兰经问答系统的性能提升。
背景与挑战
背景概述
《古兰经》作为伊斯兰教的核心经典,其深邃的语义与复杂的阿拉伯语表达为自然语言处理领域带来了独特而艰巨的挑战。由Rana Malhas与Tamer Elsayed等研究者主导,于2020年创建的Qur'anic Reading Comprehension Dataset(QRCD),旨在攻克基于古兰经文本的机器阅读理解难题。该数据集包含1,093个问题-经文段落对,并扩展为1,337个问题-段落-答案三元组,专注于抽取式问答任务。其问世填补了古典阿拉伯语宗教文本在机器阅读理解领域的资源空白,为研究者提供了标准化评测平台,推动了低资源语言与宗教典籍的智能理解研究。QRCD的发布不仅促进了阿拉伯语信息检索技术的演进,更在跨学科领域引发了对经典文本数字化解读的深刻思考。
当前挑战
QRCD所面临的核心挑战首先根植于古兰经文本本身的特殊性:古典阿拉伯语的语法复杂性、隐喻性表达以及多义性,使得机器难以精准定位答案。此外,数据集规模较小(不足千对问答对),限制了深度学习模型的泛化能力。在构建过程中,研究者需应对经文段落与问题之间的非一一对应关系——同一段落可对应多个问题,反之亦然,这增加了标注的歧义性与一致性维护的难度。同时,原始经文来源(Tanzil项目)的文本归一化处理需兼顾宗教文本的严谨性,而答案的起始字符标注则要求领域专家具备深厚的伊斯兰学识,以确保注释的权威性与精确性。这些因素共同构成了QRCD在技术实现与人文考据之间的复杂平衡挑战。
常用场景
经典使用场景
在宗教文本分析与自然语言处理的交叉领域,Qur'anic Reading Comprehension Dataset(QRCD)专为《古兰经》的抽取式阅读理解任务而设计。该数据集包含1,093对问答-篇章组合,并进一步扩展为1,337个三元组,每个样本由古兰经经文片段、基于经文内容提出的问题以及从经文中提取的答案构成。研究者利用这一资源,可训练模型在古典阿拉伯语语境下精准定位答案的起始字符位置,从而推动低资源语言与宗教典籍的机器阅读理解研究。其经典应用场景在于评估模型对神学文本中细粒度语义的捕捉能力,特别是在答案可能分布于多节经文或存在多个正确答案的复杂情况下,通过部分倒数排名(pRR)等指标衡量系统的检索与匹配性能。
解决学术问题
QRCD的构建有效回应了古典阿拉伯语与宗教典籍领域长期缺乏标准化阅读理解基准的学术困境。此前,针对《古兰经》的问答研究多依赖人工编纂的小规模测试集,缺乏统一的评估框架与可复现性。该数据集通过提供经过专家标注的、包含多答案结构的高质量三元组,解决了三个核心问题:其一,为低资源语言中的抽取式问答任务建立了规范的训练与评测范式;其二,通过引入部分匹配评价指标(如pRR与F1@1),弥补了传统精确匹配指标在神学文本多义性语境下的局限性;其三,为跨语言迁移学习与古典文本的语义表征研究提供了可量化的基准,显著推动了伊斯兰知识数字化与计算语言学在宗教领域的交叉发展。
衍生相关工作
QRCD的发布催生了多项具有影响力的后续研究。首先,其依托的AyaTEC测试集合(Malhas & Elsayed, 2020)为古典阿拉伯语问答系统的评估奠定了方法论基础,提出的部分倒数排名(pRR)指标被后续多篇低资源语言阅读理解论文采纳。其次,该数据集被用于2022年古兰经问答共享任务(Quran QA 2022),吸引多个团队开发基于预训练语言模型的抽取式系统,其中部分工作探索了跨语言微调策略以缓解训练数据稀疏性。此外,研究者基于QRCD衍生出经文级语义角色标注任务,推动了古典阿拉伯语依存句法分析与语义理解模型的迭代。这些工作共同构成了围绕宗教典籍的机器阅读理解研究生态,凸显了领域特定数据集对学术社区的长期催化作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务