遇见数据集

CALM/arwiki

收藏
Hugging Face2022-08-01 更新2024-03-04 收录
官方服务:

资源简介:

--- pretty_name: Wikipedia Arabic dumps dataset. language: - ar license: - unknown multilinguality: - monolingual --- # Arabic Wiki Dataset ## Dataset Summary This dataset is extracted using [`wikiextractor`](https://github.com/attardi/wikiextractor) tool, from [Wikipedia Arabic pages](https://dumps.wikimedia.org/arwiki/). ## Supported Tasks and Leaderboards Intended to train **Arabic** language models on MSA (Modern Standard Arabic). ## Dataset Structure The dataset is structured into 2 folders: - `arwiki_20211213_txt`: dataset is divided into subfolders each of which contains no more than 100 documents. - `arwiki_20211213_txt_single`: all documents merged together in a single txt file. ## Dataset Statistics #### Extracts from **December 13, 2021**: | documents | vocabulary | words | | --- | --- | --- | | 1,136,455 | 5,446,560 | 175,566,016 | ## Usage Load all dataset from the single txt file: ```python load_dataset('CALM/arwiki', data_files='arwiki_2021_txt_single/arwiki_20211213.txt') # OR with stream load_dataset('CALM/arwiki', data_files='arwiki_2021_txt_single/arwiki_20211213.txt', streaming=True) ``` Load a smaller subset from the individual txt files: ```python load_dataset('CALM/arwiki', data_files='arwiki_2021_txt/AA/arwiki_20211213_1208.txt') # OR with stream load_dataset('CALM/arwiki', data_files='arwiki_2021_txt/AA/arwiki_20211213_1208.txt', streaming=True) ```

--- 数据集名称:维基百科阿拉伯语转储数据集。 语言: - 阿拉伯语(ar) 许可协议: - 未知 多语言属性: - 单语 --- # 阿拉伯语维基百科数据集 ## 数据集概述 本数据集通过[`wikiextractor`](https://github.com/attardi/wikiextractor)工具,从[维基百科阿拉伯语页面转储](https://dumps.wikimedia.org/arwiki/)提取得到。 ## 支持任务与排行榜 本数据集旨在针对现代标准阿拉伯语(MSA,Modern Standard Arabic)训练阿拉伯语语言模型。 ## 数据集结构 本数据集分为两个文件夹: - `arwiki_20211213_txt`:数据集被划分为若干子文件夹,每个子文件夹包含不超过100份文档。 - `arwiki_20211213_txt_single`:所有文档合并为一个纯文本文件。 ## 数据集统计信息 #### 2021年12月13日提取的统计数据: | 文档数 | 词汇量 | 总词数 | | ---- | ---- | ---- | | 1,136,455 | 5,446,560 | 175,566,016 | ## 使用方法 从单个纯文本文件加载完整数据集: python load_dataset('CALM/arwiki', data_files='arwiki_2021_txt_single/arwiki_20211213.txt') # 或采用流式加载方式 load_dataset('CALM/arwiki', data_files='arwiki_2021_txt_single/arwiki_20211213.txt', streaming=True) 从分块文本文件加载较小子集: python load_dataset('CALM/arwiki', data_files='arwiki_2021_txt/AA/arwiki_20211213_1208.txt') # 或采用流式加载方式 load_dataset('CALM/arwiki', data_files='arwiki_2021_txt/AA/arwiki_20211213_1208.txt', streaming=True)

提供机构:
CALM
原始信息汇总

数据集概述

数据集名称

  • 名称:Wikipedia Arabic dumps dataset
  • 语言:阿拉伯语(ar)
  • 许可证:未知
  • 多语言性:单语种

数据集摘要

支持的任务和排行榜

  • 目的:训练现代标准阿拉伯语(MSA)语言模型

数据集结构

  • arwiki_20211213_txt: 分为多个子文件夹,每个子文件夹包含不超过100个文档。
  • arwiki_20211213_txt_single: 所有文档合并为一个txt文件。

数据集统计

  • 提取日期:2021年12月13日
  • 文档数量:1,136,455
  • 词汇量:5,446,560
  • 单词总数:175,566,016

使用方法

  • 加载整个数据集: python load_dataset(CALM/arwiki, data_files=arwiki_2021_txt_single/arwiki_20211213.txt)

    或使用流式加载: python load_dataset(CALM/arwiki, data_files=arwiki_2021_txt_single/arwiki_20211213.txt, streaming=True)

  • 加载小部分数据集: python load_dataset(CALM/arwiki, data_files=arwiki_2021_txt/AA/arwiki_20211213_1208.txt)

    或使用流式加载: python load_dataset(CALM/arwiki, data_files=arwiki_2021_txt/AA/arwiki_20211213_1208.txt, streaming=True)

搜集汇总
数据集介绍
CALM/arwiki 数据集图片
构建方式
CALM/arwiki数据集源自维基百科阿拉伯语页面的定期数据转储,具体提取自2021年12月13日的快照。构建过程依托于wikiextractor工具,将原始页面内容解析为结构化的文本形式。数据集以两种组织形式呈现:其一为按子文件夹划分的多个文本文件,每个子文件夹内包含不超过100个文档;其二为将所有文档合并至单一文本文件中,便于整体加载与处理。这一设计兼顾了细粒度访问与批量使用的灵活性。
特点
该数据集专为现代标准阿拉伯语(MSA)语言模型的训练而设计,语料规模宏大,涵盖超过113万个文档、约544万个独立词汇以及1.75亿个单词,为阿拉伯语自然语言处理提供了丰富的语言资源。数据来源于维基百科这一高质量、多领域的百科全书式平台,确保了内容的多样性与规范性。单语种的聚焦特性使得数据集在阿拉伯语建模任务中具有高度针对性。
使用方法
用户可通过HuggingFace的load_dataset函数便捷地加载该数据集。若需加载完整语料,可直接指定单一文本文件路径;若希望以流式方式处理大规模数据,可启用streaming参数以节省内存。此外,通过选择子文件夹中的特定文本文件,研究人员能够灵活地获取数据子集,适用于小规模实验或快速原型开发。这种多样化的加载策略满足了从探索性分析到生产级训练的不同需求。
背景与挑战
背景概述
在自然语言处理领域,大规模语料库的构建是推动语言模型发展的基石。CALM/arwiki数据集由CALM研究团队于2021年12月13日从阿拉伯语维基百科页面提取而来,旨在为现代标准阿拉伯语(MSA)语言模型的训练提供高质量的单语资源。该数据集通过wikiextractor工具处理,包含超过113万篇文档、544万词汇量和1.75亿单词,其规模与结构化设计为阿拉伯语自然语言处理研究奠定了重要基础。作为阿拉伯语领域少有的开源大规模语料库,CALM/arwiki显著提升了低资源语言模型的可获得性,促进了阿拉伯语文本生成、语义理解等任务的发展,对中东及北非地区的语言技术研究产生了深远影响。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:阿拉伯语形态复杂、方言众多,数据集仅涵盖现代标准阿拉伯语,难以覆盖方言变体及口语化表达,限制了模型在多样化场景下的泛化能力。此外,维基百科内容偏向知识性文本,缺乏对话、社交媒体等非正式语境,可能导致训练出的语言模型在处理现实世界多风格文本时表现不佳。在构建过程中,挑战主要源于数据清洗与标准化:阿拉伯语存在多种编码格式与拼写变体(如不带音符的简化写法),wikiextractor工具虽能提取正文,但难以完全消除噪声(如HTML残留、引用标记),且缺乏对文本中阿拉伯语特有标点与数字格式的统一处理,增加了后续预处理的复杂度。
常用场景
经典使用场景
在阿拉伯语自然语言处理领域,CALM/arwiki数据集作为大规模现代标准阿拉伯语(MSA)语料库,其经典使用场景集中于预训练语言模型的构建。研究者常利用该数据集所蕴含的逾百万篇文档与近两亿词汇,通过自监督学习范式(如掩码语言建模)训练阿拉伯语BERT、GPT等深层Transformer架构,从而捕获阿拉伯语独特的形态句法特征与语义表示。该数据集以维基百科高质量文本为基础,经wikiextractor工具清洗后保留了结构化知识,为阿拉伯语神经语言模型的领域适应与零样本迁移提供了坚实的数据基石。
解决学术问题
该数据集的核心学术贡献在于缓解了阿拉伯语自然语言处理中大规模、高质量语料匮乏的长期困境。此前,阿拉伯语研究多依赖小规模新闻或社交媒体语料,导致模型在语法严谨性、词汇多样性及长文本理解上表现欠佳。CALM/arwiki凭借其百科全书式的知识覆盖与标准阿拉伯语规范,使得研究者能够系统性地探索阿拉伯语词嵌入的语义泛化能力、跨语言知识蒸馏的有效性,以及低资源方言(如埃及、黎凡特阿拉伯语)的迁移学习策略。其发布推动了阿拉伯语语言模型在命名实体识别、句法分析等经典任务上的性能突破。
衍生相关工作
CALM/arwiki数据集催生了多项具有影响力的衍生工作。其中,阿拉伯语BERT(AraBERT)系列模型直接采用该数据集作为预训练语料,在阿拉伯语情感分类、问答系统等基准测试中取得了当时最优结果。此外,跨语言模型(如XLM-R)在阿拉伯语子任务上的微调实验也常以此数据集为评估基础。研究者还基于该数据集构建了阿拉伯语篇章关系解析基准(Arabic-PDTB),并开发了面向阿拉伯语维基百科的实体链接与知识图谱补全工具。这些衍生工作不仅验证了数据集在学术研究中的复用价值,更推动了阿拉伯语自然语言处理从资源稀缺走向资源丰富的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务