WYWEB
收藏资源简介:
WYWEB是一个用于评估古典中文NLP模型的基准,包含九个任务,如句子分类、序列标注、阅读理解和机器翻译。
WYWEB is a benchmark for evaluating classical Chinese NLP models, which comprises nine tasks including sentence classification, sequence labeling, reading comprehension, and machine translation.
WYWEB 数据集概述
数据集介绍
WYWEB 是一个用于评估古文处理的自然语言处理(NLP)基准测试。该数据集包含多个任务,旨在帮助社区更好地理解和处理古文。
任务列表及描述
| 任务 | 训练集 | 开发集 | 测试集 | 描述 | 评估指标 | 来源 |
|---|---|---|---|---|---|---|
| PUNC | 90k | 20k | 20k | 序列标注 | F1 | 权威文本 |
| TLC | 28k | 6k | 6k | 句子分类 | 准确率 | 古文 |
| GJC | 100k | 20k | 20k | 句子分类 | 准确率 | 戴志阁 |
| XuCi | 800 | 200 | 200 | 词相似度 | 准确率 | 考试试卷 |
| WYWRC | 3k | 500 | 500 | 阅读理解 | 准确率 | 考试试卷 |
| IRC | 3k | 1k | 1k | 阅读理解 | 准确率 | 考试试卷 |
| WYWMT | 20k | 3k | 3k | 机器翻译 | BLEU | 在线 |
| GLNER | 80k | 18k | 18k | 序列标注 | F1 | citet{GULIAN2020} |
| FSPC | 3000 | 1000 | 1000 | 句子分类 | 准确率 | THU-FSPC |
模型性能
主要任务性能
| 模型 | 平均 | PUNC | GLNER | GJC | FSPC | TLC | XuCi | WYWRC | IRC |
|---|---|---|---|---|---|---|---|---|---|
| Human | 88.0 | 92.4 | 94.3 | 90.3 | 80.0 | 89.0 | 85.3 | 80.0 | 92.3 |
| DeBERTa-base | 75.9 | 83.3 | 86.7 | 85.2 | 61.1 | 86.7 | 72.4 | 45.1 | 86.7 |
| GuwenBERT-base | 72.9 | 82.5 | 82.8 | 84.8 | 61.3 | 85.1 | 71.7 | 28.0 | 86.8 |
| GuwenBERT-large | 75.6 | 83.1 | 86.1 | 84.9 | 58.5 | 87.6 | 73.4 | 44.4 | 87.8 |
| GuwenBERT-base-fs | 74.6 | 82.9 | 84.8 | 84.2 | 61.0 | 86.7 | 70.0 | 42.1 | 85.3 |
| RoBERTa-CCBC | 74.5 | 82.5 | 84.7 | 84.5 | 59.5 | 85.0 | 73.2 | 40.7 | 86.1 |
| RoBERTa-CCLC | 75.3 | 82.8 | 86.1 | 84.7 | 58.6 | 87.1 | 74.9 | 41.0 | 86.9 |
| SikuBERT | 73.7 | 80.8 | 82.8 | 82.2 | 60.9 | 82.4 | 70.4 | 44.0 | 85.8 |
| SikuRoBERTa | 73.5 | 81.4 | 82.8 | 82.5 | 62.2 | 83.8 | 68.5 | 41.0 | 85.8 |
| RoBERTa-wwm-ext | 72.1 | 78.8 | 79.8 | 81.3 | 59.2 | 78.3 | 71.0 | 42.1 | 86.2 |
WYWMT 任务性能
| 模型 | BLEU | chrF2 | TER | ROUGE-1 | ROUGE-2 | ROUGE-L |
|---|---|---|---|---|---|---|
| Human | 45.6 | 44.2 | 34.4 | 77.4 | 50.7 | 76.2 |
| guwenbert-base | 40.1 | 38.1 | 37.5 | 72.5 | 46.0 | 70.3 |
| guwenbert-large | 38.8 | 37.2 | 38.1 | 70.1 | 43.7 | 67.7 |
| guwenbert-base-fs | 36.3 | 35.2 | 39.2 | 68.3 | 41.2 | 65.7 |
| roberta-CCBC | 39.1 | 37.1 | 36.8 | 71.4 | 44.9 | 69.3 |
| roberta-CCLC | 39.8 | 38.0 | 36.4 | 71.6 | 45.3 | 69.3 |
| SikuBERT | 38.8 | 36.2 | 37.9 | 72.0 | 45.5 | 69.8 |
| SikuRoBERTa | 39.1 | 36.5 | 37.7 | 72.2 | 45.7 | 70.0 |
| DeBERTa-base | 39.5 | 37.8 | 35.9 | 71.9 | 44.2 | 68.7 |
| Roberta-wwm-ext | 38.0 | 35.8 | 39.1 | 69.9 | 43.2 | 66.7 |
如何测试新模型
研究人员可以使用评估工具包,通过几行代码快速评估预训练语言模型。具体步骤如下:
- 在每个任务上测试你的模型。
- 获取最佳开发集分数,使用该模型评估测试集。
- 将测试集结果发送给我们。
- 维护人员验证结果后更新排行榜。
引用
@inproceedings{zhou-etal-2023-wyweb, title = "{WYWEB}: A {NLP} Evaluation Benchmark For Classical {C}hinese", author = "Zhou, Bo and Chen, Qianglong and Wang, Tianyu and Zhong, Xiaomi and Zhang, Yin", booktitle = "Findings of the Association for Computational Linguistics: ACL 2023", month = jul, year = "2023", address = "Toronto, Canada", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2023.findings-acl.204", doi = "10.18653/v1/2023.findings-acl.204", pages = "3294--3319" }

- 1WYWEB: A NLP Evaluation Benchmark For Classical Chinese · 2023年



