遇见数据集

NiuTrans/LMT-60-sft-data

收藏
Hugging Face2025-11-16 更新2026-01-03 收录
官方服务:

资源简介:

--- task_categories: - translation --- # LMT-60-sft-data: Large-scale Multilingual Translation SFT Dataset This repository contains the `LMT-60-sft-data` dataset, a key component of the research presented in the paper "[Beyond English: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs](https://huggingface.co/papers/2511.07003)". The LMT (Large-scale Multilingual Translation) project aims to advance Multilingual Machine Translation (MMT) by building inclusive, scalable, and high-performance multilingual translation models. This supervised fine-tuning (SFT) dataset was instrumental in developing these models, which are centered on both Chinese and English, covering 60 languages and 234 translation directions. **Paper:** [Beyond English: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs](https://huggingface.co/papers/2511.07003) **Project Page / Code:** [https://github.com/NiuTrans/LMT](https://github.com/NiuTrans/LMT) ## Dataset Composition The `LMT-60-sft-data` dataset comprises a diverse collection of translation data, including: - Flores-200 devset - NTREX-128 - SMol - WMT14–23 test sets - IWSLT17–24 test sets In total, it contains 567K samples, providing a rich resource for multilingual machine translation research. ## Supported Languages The LMT project and its associated datasets support 60 languages, categorized by their resource tier: | Resource Tier | Languages | | :---- | :---- | | High-resource Languages (13) | Arabic(ar), English(en), Spanish(es), German(de), French(fr), Italian(it), Japanese(ja), Dutch(nl), Polish(pl), Portuguese(pt), Russian(ru), Turkish(tr), Chinese(zh) | | Medium-resource Languages (18) | Bulgarian(bg), Bengali(bn), Czech(cs), Danish(da), Modern Greek(el), Persian(fa), Finnish(fi), Hindi(hi), Hungarian(hu), Indonesian(id), Korean(ko), Norwegian(no), Romanian(ro), Slovak(sk), Swedish(sv), Thai(th), Ukrainian(uk), Vietnamese(vi) | | Low-resouce Languages (29) | Amharic(am), Azerbaijani(az), Tibetan(bo), Modern Hebrew(he), Croatian(hr), Armenian(hy), Icelandic(is), Javanese(jv), Georgian(ka), Kazakh(kk), Central Khmer(km), Kirghiz(ky), Lao(lo), Chinese Mongolian(mn_cn), Marathi(mr), Malay(ms), Burmese(my), Nepali(ne), Pashto(ps), Sinhala(si), Swahili(sw), Tamil(ta), Telugu(te), Tajik(tg), Tagalog(tl), Uighur(ug), Urdu(ur), Uzbek(uz), Yue Chinese(yue) | ## Citation If you find this dataset or the associated paper useful for your research, please kindly cite: ```bibtex @misc{luoyf2025lmt, title={Beyond English: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs}, author={Yingfeng Luo, Ziqiang Xu, Yuxuan Ouyang, Murun Yang, Dingyang Lin, Kaiyan Chang, Tong Zheng, Bei Li, Peinan Feng, Quan Du, Tong Xiao, Jingbo Zhu}, year={2025}, eprint={2511.07003}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2511.07003}, } ```

任务类别:翻译 # LMT-60-sft-data:大规模多语言翻译监督微调(Supervised Fine-tuning, SFT)数据集 本仓库包含`LMT-60-sft-data`数据集,该数据集是论文《超越英语:面向大语言模型(Large Language Model, LLM)的包容性可扩展多语言机器翻译》(https://huggingface.co/papers/2511.07003)中展示的研究工作的核心组成部分。 LMT(大规模多语言翻译)项目旨在通过构建包容性强、可扩展且高性能的多语言机器翻译(Multilingual Machine Translation, MMT)模型,推动该领域的发展。本监督微调(Supervised Fine-tuning, SFT)数据集是开发此类模型的关键支撑,相关模型以中英双语为核心,覆盖60种语言与234个翻译方向。 **论文**:[Beyond English: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs](https://huggingface.co/papers/2511.07003) **项目主页 / 代码仓库**:[https://github.com/NiuTrans/LMT](https://github.com/NiuTrans/LMT) ## 数据集组成 `LMT-60-sft-data`数据集由多样化的翻译语料集合构成,具体包括: - Flores-200开发集(Flores-200 devset) - NTREX-128 - SMol - WMT14至WMT23测试集 - IWSLT17至IWSLT24测试集 该数据集总计包含56.7万个样本,为多语言机器翻译研究提供了极为丰富的资源支持。 ## 支持语种 LMT项目及其关联数据集共支持60种语言,按资源层级分类如下: | 资源层级 | 语言列表 | | :---- | :---- | | 高资源语言(13种) | 阿拉伯语(ar)、英语(en)、西班牙语(es)、德语(de)、法语(fr)、意大利语(it)、日语(ja)、荷兰语(nl)、波兰语(pl)、葡萄牙语(pt)、俄语(ru)、土耳其语(tr)、中文(zh) | | 中资源语言(18种) | 保加利亚语(bg)、孟加拉语(bn)、捷克语(cs)、丹麦语(da)、现代希腊语(el)、波斯语(fa)、芬兰语(fi)、印地语(hi)、匈牙利语(hu)、印度尼西亚语(id)、韩语(ko)、挪威语(no)、罗马尼亚语(ro)、斯洛伐克语(sk)、瑞典语(sv)、泰语(th)、乌克兰语(uk)、越南语(vi) | | 低资源语言(29种) | 阿姆哈拉语(am)、阿塞拜疆语(az)、藏语(bo)、现代希伯来语(he)、克罗地亚语(hr)、亚美尼亚语(hy)、冰岛语(is)、爪哇语(jv)、格鲁吉亚语(ka)、哈萨克语(kk)、高棉语(km)、吉尔吉斯语(ky)、老挝语(lo)、中国蒙古语(mn_cn)、马拉地语(mr)、马来语(ms)、缅甸语(my)、尼泊尔语(ne)、普什图语(ps)、僧伽罗语(si)、斯瓦希里语(sw)、泰米尔语(ta)、泰卢固语(te)、塔吉克语(tg)、他加禄语(tl)、维吾尔语(ug)、乌尔都语(ur)、乌兹别克语(uz)、粤语(yue) | ## 引用说明 若您的研究中用到本数据集或相关论文,请引用如下文献: bibtex @misc{luoyf2025lmt, title={Beyond English: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs}, author={Yingfeng Luo, Ziqiang Xu, Yuxuan Ouyang, Murun Yang, Dingyang Lin, Kaiyan Chang, Tong Zheng, Bei Li, Peinan Feng, Quan Du, Tong Xiao, Jingbo Zhu}, year={2025}, eprint={2511.07003}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2511.07003}, }

提供机构:
NiuTrans
搜集汇总
数据集介绍
NiuTrans/LMT-60-sft-data 数据集图片
背景与挑战
背景概述
LMT-60-sft-data是一个用于多语言机器翻译的大规模监督微调数据集,覆盖60种语言和234个翻译方向,包含来自Flores-200、WMT等多个测试集的567K样本。该数据集旨在支持构建包容性和可扩展的多语言翻译模型,特别关注高、中、低资源语言的平衡,是LMT项目的重要组成部分。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务