Kurdish Parallel Corpus
收藏资源简介:
该仓库包含Sorani (`ckb`) 和 Kurmanji (`kmr`) 两种库尔德语方言以及英语 (`eng`) 的平行语料库。语料库通过从多语言网站检索可能对齐的新闻文章,基于词汇相似性和脚本音译半自动对齐句子,并手动标注正确的翻译对来开发。语料库包含三种手动对齐的语料:Sorani-Kurmanji、Sorani-English 和 Kurmanji-English,格式包括Translation Memory eXchange文件格式 (`.tmx`)、适用于ParaConc的平行注释文本和原始平行文本 (`.txt`)。
This repository contains parallel corpora for two Kurdish dialects, Sorani (`ckb`) and Kurmanji (`kmr`), as well as English (`eng`). The corpora were developed by retrieving potentially aligned news articles from multilingual websites, semi-automatically aligning sentences based on lexical similarity and script transliteration, and manually annotating correct translation pairs. The corpora include three manually aligned datasets: Sorani-Kurmanji, Sorani-English, and Kurmanji-English, available in formats such as Translation Memory eXchange (`.tmx`), parallel annotated text for ParaConc, and raw parallel text (`.txt`).
Kurdish Parallel Corpus 概述
数据集描述
- 语言组合:包含Sorani (
ckb)、Kurmanji (kmr) 和 English (eng) 三种语言。 - 数据内容:提供Sorani-Kurmanji、Sorani-English和Kurmanji-English三种组合的手动对齐语料。
- 数据格式:包括Translation Memory eXchange (
.tmx)、ParaConc兼容的并行注释文本和原始并行文本 (.txt)。
数据集规模
- Sorani-Kurmanji:12,327对翻译。
- Sorani-English:1,797对翻译。
- Kurmanji-English:650对翻译。
数据集下载
引用信息
-
论文标题:Leveraging Multilingual News Websites for Building a Kurdish Parallel Corpus
-
作者:Sina Ahmadi, Hossein Hassani, Daban Q. Jaff
-
年份:2020
-
引用格式:
@misc{ahmadi2020leveraging, title={Leveraging Multilingual News Websites for Building a Kurdish Parallel Corpus}, author={Sina Ahmadi and Hossein Hassani and Daban Q. Jaff}, year={2020}, eprint={2010.01554}, archivePrefix={arXiv}, primaryClass={cs.CL} }
许可证
- 类型:Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)
- 详情:链接




