wmt/wmt20_mlqe_task2
收藏资源简介:
WMT20 - 多语言质量估计(MLQE)任务2数据集主要用于机器翻译质量估计任务。该数据集包含两种语言对:英语-德语(en-de)和英语-中文(en-zh)。数据集的结构包括翻译文本、源语言和目标语言的词级标签、后编辑版本、人类翻译错误率(HTER)以及词对齐信息。数据集分为训练集、验证集和测试集,分别包含7000、1000和1000个样本。数据集的创建基于Wikipedia文章,并通过TER工具进行词级标签的标注。
WMT20 - Multilingual Quality Estimation (MLQE) Task 2 dataset is primarily used for machine translation quality estimation tasks. It contains two language pairs: English-German (en-de) and English-Chinese (en-zh). The dataset structure includes translated texts, word-level labels for source and target languages, post-edited versions, Human Translation Error Rate (HTER), and word alignment information. The dataset is split into training, validation and test sets, which contain 7000, 1000 and 1000 samples respectively. The dataset is constructed based on Wikipedia articles, and the word-level labels are annotated using the TER tool.
数据集概述
- 名称: WMT20 - MultiLingual Quality Estimation (MLQE) Task2
- 语言: 德语 (
de), 英语 (en), 中文 (zh) - 许可证: 未知
- 多语言性: 翻译
- 大小: 1K<n<10K
- 来源数据集: 扩展自维基百科
- 任务类别: 翻译, 文本分类
- 配置名称: en-de, en-zh
- 标签: 翻译质量估计
数据集结构
配置 en-de
- 特征:
- translation: 语言对 (en, de)
- src_tags: 源标签 (
0: BAD,1: OK) - mt_tags: 目标标签 (
0: BAD,1: OK) - pe: 字符串
- hter: 浮点数32位
- alignments: 整数序列
- 分割:
- train: 7000个样本, 6463902字节
- test: 1000个样本, 425042字节
- validation: 1000个样本, 927588字节
- 下载大小: 2284213字节
- 数据集大小: 7816532字节
配置 en-zh
- 特征:
- translation: 语言对 (en, zh)
- src_tags: 源标签 (
0: BAD,1: OK) - mt_tags: 目标标签 (
0: BAD,1: OK) - pe: 字符串
- hter: 浮点数32位
- alignments: 整数序列
- 分割:
- train: 7000个样本, 6786870字节
- test: 1000个样本, 443200字节
- validation: 1000个样本, 954682字节
- 下载大小: 2436542字节
- 数据集大小: 8184752字节
数据集创建
- 注释创建者: 专家生成, 机器生成
- 语言创建者: 发现
- 来源: 维基百科
- 注释: 使用TER工具获取词级标签, HTER值从词级标签确定性获取
- 许可证: 未知
- 贡献者: @VictorSanh




