allenai/wmt22_african
收藏资源简介:
该数据集基于Meta AI发布的非洲语言双语文本元数据创建,包含了248对非洲语言的双语文本。这些数据是为2022年WMT共享任务中的大规模机器翻译评估准备的。数据集的结构包括每个语言对的压缩文本文件,每个文件包含平行句子。数据集未进行训练、开发和测试的划分。数据集的创建过程涉及从Common Crawl和ParaCrawl中通过LASER编码器自动识别平行句子。数据集的使用对社会有积极影响,因为它为许多低资源语言的NLP系统提供了训练数据。
This dataset is built upon the bilingual text metadata for African languages released by Meta AI, and includes 248 bilingual text pairs between African languages. It was curated for large-scale machine translation evaluation in the 2022 WMT Shared Task. The dataset is structured as compressed text files for each language pair, with each file containing parallel sentence pairs. No train-dev-test split has been applied to this dataset. The dataset was created by automatically identifying parallel sentences from Common Crawl and ParaCrawl using the LASER encoder. The utilization of this dataset brings positive societal impacts, as it provides training data for NLP systems targeting numerous low-resource languages.
数据集概述
数据集描述
- 数据集名称: allenai/wmt22_african
- 数据集概要: 该数据集基于Meta AI发布的元数据,包含248对非洲语言的并行文本,用于2022 WMT非洲语言大规模机器翻译评估共享任务。
- 支持的任务: 该数据集是2022 WMT非洲语言大规模机器翻译评估共享任务中受限赛道允许的资源之一。
- 语言: 包含25种非洲语言及英语和法语。
数据集结构
- 数据实例: 包含248种语言对。
- 数据字段: 每个语言对实例包含translation(句子对)、laser_score、source_sentence_lid、target_sentence_lid。
- 数据分割: 数据未分割为训练集、验证集和测试集。
数据集创建
- 采集理由: 使用Language-Agnostic Sentence Representation (LASER)编码器从Common Crawl和ParaCrawl的单语数据中识别并行句子。
- 源数据: 单语数据来自Common Crawl和ParaCrawl。
- 注释: 数据未经人工注释,使用LASER自动识别并行文本。
使用数据注意事项
- 社会影响: 该数据集为多种低资源语言的自然语言处理提供了训练数据。
- 偏见讨论: 数据中的偏见尚未被研究。
附加信息
- 许可证: 数据集根据ODC-BY许可发布。
- 引用信息: 引用时请参考NLLB Team et al, No Language Left Behind: Scaling Human-Centered Machine Translation, Arxiv, 2022。




