community-datasets/tashkeela
收藏资源简介:
Tashkeela数据集是一个包含7500万完全带注音的阿拉伯语单词的语料库,主要来源于97本古典和现代阿拉伯语书籍。该数据集支持文本生成和填充掩码等自然语言处理任务,特别关注阿拉伯语的注音预测。数据集包括book(书籍文件名)和text(书籍文本内容)两个主要字段,所有数据用于训练。数据集的创建涉及从互联网上爬取现代标准阿拉伯语文本,并由网站作为源语言生产者。该数据集遵循GNU General Public License, version 2 (GPLv2),并已在相关学术论文中被引用。
Tashkeela数据集是一个包含7500万完全带注音的阿拉伯语单词的语料库,主要来源于97本古典和现代阿拉伯语书籍。该数据集支持文本生成和填充掩码等自然语言处理任务,特别关注阿拉伯语的注音预测。数据集包括book(书籍文件名)和text(书籍文本内容)两个主要字段,所有数据用于训练。数据集的创建涉及从互联网上爬取现代标准阿拉伯语文本,并由网站作为源语言生产者。该数据集遵循GNU General Public License, version 2 (GPLv2),并已在相关学术论文中被引用。
数据集概述
数据集摘要
Tashkeela数据集包含7500万个完全标注的阿拉伯语单词,主要来自97本古典和现代阿拉伯语书籍。
支持的任务和排行榜
- 文本生成
- 填充掩码
语言
数据集基于阿拉伯语。
数据集结构
数据实例
数据实例包括书籍文件名和文本内容。
数据字段
book(字符串): 书籍文件名。text(字符串): 书籍文本内容。
数据分割
数据集未进行分割。
数据集创建
数据收集和规范化
现代标准阿拉伯语文本从互联网上爬取。
源语言生产者
网站。
标注
数据集不包含任何额外标注。
许可证信息
数据集遵循GNU General Public License, version 2 (GPLv2)。
引用信息
数据集相关论文:
@article{zerrouki2017tashkeela, title={Tashkeela: Novel corpus of Arabic vocalized texts, data for auto-diacritization systems}, author={Zerrouki, Taha and Balla, Amar}, journal={Data in brief}, volume={11}, pages={147}, year={2017}, publisher={Elsevier} }




