遇见数据集

arbml/AyaTEC

收藏
Hugging Face2024-04-14 更新2024-06-12 收录
官方服务:

资源简介:

# Dataset Card for AyaTec ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ## Dataset Description - **Homepage: [info]** - **Repository: [info]** - **Paper: [info]** - **Leaderboard: [info]** - **Point of Contact: [info]** ### Dataset Summary [More Information Needed] ### Supported Tasks and Leaderboards [More Information Needed] ### Languages [More Information Needed] ## Dataset Structure ### Data Instances [More Information Needed] ### Data Fields [More Information Needed] ### Data Splits [More Information Needed] ## Dataset Creation ### Curation Rationale [More Information Needed] ### Source Data #### Initial Data Collection and Normalization [More Information Needed] #### Who are the source language producers? [More Information Needed] ### Annotations #### Annotation process [More Information Needed] #### Who are the annotators? [More Information Needed] ### Personal and Sensitive Information [More Information Needed] ## Considerations for Using the Data ### Social Impact of Dataset [More Information Needed] ### Discussion of Biases [More Information Needed] ### Other Known Limitations [More Information Needed] ## Additional Information ### Dataset Curators [More Information Needed] ### Licensing Information [More Information Needed] ### Citation Information ``` @article{malhas2020ayatec, title={Ayatec: building a reusable verse-based test collection for arabic question answering on the holy qur’an}, author={Malhas, Rana and Elsayed, Tamer}, journal={ACM Transactions on Asian and Low-Resource Language Information Processing (TALLIP)}, volume={19}, number={6}, pages={1--21}, year={2020}, publisher={ACM New York, NY, USA} } ``` ### Contributions Thanks to [@github-username](https://github.com/<github-username>) for adding this dataset.

# AyaTec 数据集卡片(Dataset Card) ## 目录 - [目录](#table-of-contents) - [数据集描述](#dataset-description) - [数据集概述](#dataset-summary) - [支持任务与排行榜](#supported-tasks-and-leaderboards) - [语言覆盖](#languages) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) - [数据集构建](#dataset-creation) - [构建初衷](#curation-rationale) - [源数据](#source-data) - [标注信息](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [数据使用注意事项](#considerations-for-using-the-data) - [数据集的社会影响](#social-impact-of-dataset) - [偏差讨论](#discussion-of-biases) - [其他已知局限性](#other-known-limitations) - [附加信息](#additional-information) - [数据集策展方](#dataset-curators) - [许可协议](#licensing-information) - [引用信息](#citation-information) - [贡献致谢](#contributions) ## 数据集描述 - **主页:[info]** - **代码仓库:[info]** - **相关论文:[info]** - **排行榜:[info]** - **联络人:[info]** ### 数据集概述 [需补充更多信息] ### 支持任务与排行榜 [需补充更多信息] ### 语言覆盖 [需补充更多信息] ## 数据集结构 ### 数据实例 [需补充更多信息] ### 数据字段 [需补充更多信息] ### 数据划分 [需补充更多信息] ## 数据集构建 ### 构建初衷 [需补充更多信息] ### 源数据 #### 初始数据收集与规范化 [需补充更多信息] #### 源语言生成者是谁? [需补充更多信息] ### 标注信息 #### 标注流程 [需补充更多信息] #### 标注者是谁? [需补充更多信息] ### 个人与敏感信息 [需补充更多信息] ## 数据使用注意事项 ### 数据集的社会影响 [需补充更多信息] ### 偏差讨论 [需补充更多信息] ### 其他已知局限性 [需补充更多信息] ## 附加信息 ### 数据集策展方 [需补充更多信息] ### 许可协议 [需补充更多信息] ### 引用信息 @article{malhas2020ayatec, title={Ayatec: 构建面向《古兰经》阿拉伯语问答的可复用经文级测试集}, author={Malhas, Rana and Elsayed, Tamer}, journal={ACM亚洲与低资源语言信息处理汇刊(ACM Transactions on Asian and Low-Resource Language Information Processing, TALLIP)}, volume={19}, number={6}, pages={1--21}, year={2020}, publisher={ACM, 美国纽约州纽约市} } ### 贡献致谢 感谢[@github-username](https://github.com/<github-username>) 为本数据集的添加工作。

提供机构:
arbml
原始信息汇总

数据集概述

数据集描述

  • 数据集名称: AyaTec
  • 数据集摘要: [更多信息待补充]
  • 支持的任务和排行榜: [更多信息待补充]
  • 语言: [更多信息待补充]

数据集结构

  • 数据实例: [更多信息待补充]
  • 数据字段: [更多信息待补充]
  • 数据分割: [更多信息待补充]

数据集创建

  • 筛选理由: [更多信息待补充]
  • 源数据:
    • 初始数据收集和标准化: [更多信息待补充]
    • 源语言生产者: [更多信息待补充]
  • 注释:
    • 注释过程: [更多信息待补充]
    • 注释者: [更多信息待补充]
  • 个人和敏感信息: [更多信息待补充]

使用数据集的考虑

  • 数据集的社会影响: [更多信息待补充]
  • 偏见讨论: [更多信息待补充]
  • 其他已知限制: [更多信息待补充]

附加信息

  • 数据集管理者: [更多信息待补充]

  • 许可信息: [更多信息待补充]

  • 引用信息:

    @article{malhas2020ayatec, title={Ayatec: building a reusable verse-based test collection for arabic question answering on the holy qur’an}, author={Malhas, Rana and Elsayed, Tamer}, journal={ACM Transactions on Asian and Low-Resource Language Information Processing (TALLIP)}, volume={19}, number={6}, pages={1--21}, year={2020}, publisher={ACM New York, NY, USA} }

  • 贡献: 感谢 @github-username 添加此数据集。

搜集汇总
数据集介绍
构建方式
在自然语言处理与信息检索领域,面向宗教典籍的问答系统一直面临数据稀缺的挑战。AyaTEC数据集正是为解决这一难题而精心构建,它专注于阿拉伯语《古兰经》的经文级问答任务。该数据集由Rana Malhas和Tamer Elsayed两位学者主导,基于对《古兰经》经文结构的深入理解,采用可复用的经文片段作为检索单元。构建过程中,首先从权威的阿拉伯语《古兰经》文本中提取所有经文,并依据其语义和语法特征进行规范化处理。随后,通过人工标注的方式,为每一条经文关联多个自然语言问题,覆盖不同的查询意图和难度层级。整个标注流程遵循严格的准则,确保问题与经文之间的语义对应关系准确无误,最终形成了一套结构化的问答对集合,为后续的检索与问答模型训练奠定了坚实基础。
特点
AyaTEC数据集的核心特点在于其独特的经文级粒度与领域专精性。与通用的问答数据集不同,它严格限定于《古兰经》这一特定宗教文本,每个问答对均以独立的经文节(verse)为基本单元,从而支持细粒度的语义匹配。数据集在语言上聚焦于现代标准阿拉伯语,兼顾了古典经文的语言风格与现代问答的表述习惯,展现出高度的语言一致性。此外,其构建过程中强调可复用性,不仅提供了标准化的数据分割方案,还公开了完整的标注规范与引用信息,便于研究者进行跨实验对比。由于问题来源涵盖多种认知层次,该数据集能够有效评估模型在宗教文本理解中的推理能力与知识检索准确性,成为低资源语言环境下问答系统研究的宝贵资源。
使用方法
使用AyaTEC数据集时,研究者可直接从HuggingFace平台加载,数据集名称为'arbml/AyaTEC'。该数据集已预分为训练、验证和测试子集,用户无需额外处理即可接入标准的信息检索或问答流程。在模型应用层面,可将经文文本作为检索库,将问题作为查询输入,利用稠密检索或稀疏检索方法召回相关经文。对于生成式问答模型,则可设计序列到序列框架,将问题编码后解码为对应的经文内容。数据字段清晰,包含问题、经文文本及唯一标识符,便于定制化预处理。建议在使用时结合数据集的官方论文(Malhas et al., 2020)中描述的评估协议,以复现基准结果或开展新的实验。由于数据集规模适中且语言单一,尤其适合作为阿拉伯语自然语言理解模型的微调或评测基准。
背景与挑战
背景概述
在自然语言处理与宗教文本分析的交汇领域,针对阿拉伯语《古兰经》的问答系统研究长期受限于高质量数据集的匮乏。AyaTEC数据集由Rana Malhas与Tamer Elsayed于2020年构建,其核心研究问题在于建立一个可复用的、基于经文的阿拉伯语问答测试集。该数据集的创建标志着对低资源语言中宗教文本信息检索的里程碑式探索,通过精细的经文节标注,为后续研究提供了基准评估框架,显著推动了阿拉伯语问答系统在神圣文本上的发展,并对跨学科研究产生了深远影响。
当前挑战
AyaTEC数据集面临的核心挑战在于解决阿拉伯语《古兰经》问答领域特有的语义模糊性与经文解释多样性,这要求模型具备深厚的宗教知识背景与上下文理解能力,远超常规问答任务。构建过程中,挑战包括从海量宗教文献中准确提取问答对,确保注释的宗教严谨性,以及处理阿拉伯语复杂的形态变化与古语表达。此外,数据集的规模限制与低资源语言的标注困难,进一步加剧了模型泛化与评估的难度,使其成为一项精密且艰巨的工程。
常用场景
经典使用场景
AyaTEC数据集专为阿拉伯语《古兰经》经文检索与问答系统设计,其核心应用场景聚焦于基于经文的细粒度信息检索与阅读理解任务。该数据集以《古兰经》的每一节经文(Ayah)为基本单元,构建了包含自然语言问题与对应答案注释的语料库,使得研究者能够探索在宗教文本这一高度结构化且语义丰富的领域中,如何实现精准的语义匹配与答案抽取。这一经典场景不仅考验模型对古典阿拉伯语的理解能力,更要求其具备跨句推理与上下文感知的检索技能,为低资源语言的信息检索研究提供了独特的测试平台。
解决学术问题
该数据集有效填补了阿拉伯语宗教文本领域缺少标准化评估基准的学术空白,解决了传统问答系统难以处理《古兰经》中隐喻性表述、多义词汇及跨经文引用等语言学难题。通过提供统一的经文级问答对与检索相关性判断,AyaTEC使得研究者能够定量评估模型在语义相似度计算、答案定位及噪声文本过滤上的表现。其意义在于推动了低资源语言中结构化知识检索的方法论创新,为后续融合语言学特征与神经网络的混合模型研究奠定了实验基础,并显著提升了阿拉伯语自然语言处理研究的可复现性。
衍生相关工作
基于AyaTEC数据集,学术界衍生出一系列经典工作,包括针对阿拉伯语问答系统的端到端神经网络架构设计,如结合注意力机制的Bi-LSTM模型在经文检索任务中的优化。研究者还探索了跨语言迁移学习方法,利用该数据集训练的多语言BERT模型成功将《古兰经》问答能力迁移至其他低资源宗教文本。此外,该数据集催生了经文级语义相似度评估基准,促使团队开发了融合词根分析与依存句法特征的混合检索系统,相关成果发表于TALLIP等顶级期刊,成为低资源语言信息检索领域的标杆性参考文献。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务