C4_200M Synthetic Dataset for Grammatical Error Correction
收藏资源简介:
该数据集包含用于语法错误修正的合成训练数据。语料库通过使用标记的腐败模型对C4中的干净句子进行腐败生成。详细的方法和数据集描述在Stahlberg和Kumar (2021)的BEA 2021论文中有所阐述。
This dataset contains synthetic training data for grammatical error correction. The corpus is generated by corrupting clean sentences from the C4 corpus using a tagged corruption model. Detailed methodologies and dataset descriptions are elaborated in the BEA 2021 paper by Stahlberg and Kumar (2021).
数据集概述
数据集名称
C4_200M Synthetic Dataset for Grammatical Error Correction
数据集描述
该数据集包含用于语法错误修正的合成训练数据,详细描述见BEA 2021论文。生成平行训练数据需先获取C4 corpus,并按照提供的编辑指令进行操作。
数据集生成步骤
-
安装依赖
- 安装Abseil Python包:
pip install absl-py
- 安装Abseil Python包:
-
下载C4_200M corruptions
- 从Kaggle Datasets下载C4_200M corruptions,数据以tab-separated values格式存储,分为10个shard。
-
提取C4_200M目标句子
- 使用TensorFlow Datasets或allenai提供的C4版本获取目标句子。
- TensorFlow Datasets方法:安装
tensorflow-datasets,获取C4 corpus版本2.2.1,使用c4200m_get_target_sentences.py脚本提取句子。 - C4 Dataset in .json.gz格式方法:从allenai提供的.json.gz文件中提取句子。
- TensorFlow Datasets方法:安装
- 使用TensorFlow Datasets或allenai提供的C4版本获取目标句子。
-
应用corruption edits
- 使用
c4200m_make_sentence_pairs.py脚本将edit.tsv*中的编辑应用于target_sentences.tsv*中的句子,生成最终的平行数据集。
- 使用
数据集许可证
- 数据集中的corruption edits遵循CC BY 4.0许可证。
引用信息
-
如需引用,请使用以下BibTeX条目:
@inproceedings{stahlberg-kumar-2021-synthetic, title = "Synthetic Data Generation for Grammatical Error Correction with Tagged Corruption Models", author = "Stahlberg, Felix and Kumar, Shankar", booktitle = "Proceedings of the 16th Workshop on Innovative Use of NLP for Building Educational Applications", month = apr, year = "2021", address = "Online", publisher = "Association for Computational Linguistics", url = "https://www.aclweb.org/anthology/2021.bea-1.4", pages = "37--47", }




