遇见数据集

CMLI-NLP/MiTC

收藏
Hugging Face2024-11-08 更新2025-04-19 收录
官方服务:

资源简介:

# MiTC ## Introduction [MiLMo](https://github.com/CMLI-NLP/MiLMo) constructs a minority multilingual text classification dataset named MiTC which contains five languages, including Mongolian, Tibetan, Uyghur, Kazakh and Korean. We also use [MiLMo](https://github.com/CMLI-NLP/MiLMo) for the downstream experiment of text classification on MiTC. ## Hugging Face https://huggingface.co/datasets/CMLI-NLP/MiTC ## Citation Plain Text: J. Deng, H. Shi, X. Yu, W. Bao, Y. Sun and X. Zhao, "MiLMo:Minority Multilingual Pre-Trained Language Model," 2023 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Honolulu, Oahu, HI, USA, 2023, pp. 329-334, doi: 10.1109/SMC53992.2023.10393961. BibTeX: ``` @INPROCEEDINGS{10393961, author={Deng, Junjie and Shi, Hanru and Yu, Xinhe and Bao, Wugedele and Sun, Yuan and Zhao, Xiaobing}, booktitle={2023 IEEE International Conference on Systems, Man, and Cybernetics (SMC)}, title={MiLMo:Minority Multilingual Pre-Trained Language Model}, year={2023}, volume={}, number={}, pages={329-334}, keywords={Soft sensors;Text categorization;Social sciences;Government;Data acquisition;Morphology;Data models;Multilingual;Pre-trained language model;Datasets;Word2vec}, doi={10.1109/SMC53992.2023.10393961}} ``` ## Disclaimer This dataset/model is for academic research purposes only. Prohibited for any commercial or unethical purposes.

# MiTC ## 引言 [MiLMo](https://github.com/CMLI-NLP/MiLMo)构建了一款名为MiTC的少数民族多语种文本分类数据集,该数据集涵盖蒙古语、藏语、维吾尔语、哈萨克语与朝鲜语共五种语言。 我们在MiTC数据集上开展文本分类下游实验时,同时采用了MiLMo模型。 ## Hugging Face 数据集页面 https://huggingface.co/datasets/CMLI-NLP/MiTC ## 引用格式 ### 纯文本格式 邓俊杰、施涵如、于鑫赫、鲍吴格德勒、孙源、赵小兵, "MiLMo:少数民族多语种预训练语言模型", 2023年IEEE系统、人与控制论国际会议(SMC), 美国夏威夷州瓦胡岛火奴鲁鲁, 2023年, 第329-334页, DOI: 10.1109/SMC53992.2023.10393961. ### BibTeX格式 @INPROCEEDINGS{10393961, author={Deng, Junjie and Shi, Hanru and Yu, Xinhe and Bao, Wugedele and Sun, Yuan and Zhao, Xiaobing}, booktitle={2023 IEEE International Conference on Systems, Man, and Cybernetics (SMC)}, title={MiLMo:Minority Multilingual Pre-Trained Language Model}, year={2023}, volume={}, number={}, pages={329-334}, keywords={软传感器;文本分类;社会科学;政府;数据采集;形态学;数据模型;多语种;预训练语言模型;数据集;Word2vec}, doi={10.1109/SMC53992.2023.10393961}} ## 免责声明 本数据集/模型仅用于学术研究,严禁用于任何商业或不道德用途。

提供机构:
CMLI-NLP
搜集汇总
数据集介绍
CMLI-NLP/MiTC 数据集图片
构建方式
MiTC数据集由MiLMo项目构建,旨在填补少数民族语言文本分类领域的资源空白。该数据集涵盖蒙古语、藏语、维吾尔语、哈萨克语和朝鲜语五种语言,通过系统化采集与标注流程,从多源文本中提取并分类,确保语言多样性与标注一致性。构建过程依托于MiLMo预训练语言模型的下游任务需求,以支持跨语言文本分类研究。
特点
MiTC数据集的核心特点在于其多语言覆盖与少数民族语言专属性,包含五种低资源语言,为跨语言文本分类提供了稀缺的基准数据。数据集结构经过精心设计,兼顾各语言的形态学特征与语义表达,适用于多分类任务。其规模与质量经过验证,可直接用于预训练模型的微调与评估,推动少数民族语言自然语言处理的发展。
使用方法
使用MiTC数据集时,可通过Hugging Face平台直接加载,兼容主流深度学习框架。数据集适用于文本分类任务的训练与测试,用户可结合MiLMo等预训练模型进行微调。具体操作包括数据划分(如训练集、验证集、测试集),并利用标准评估指标(如准确率、F1分数)进行性能评测。建议在学术研究场景下使用,禁止商业或非伦理用途。
背景与挑战
背景概述
在自然语言处理领域,多语言预训练模型的研究日益受到关注,然而对于少数民族语言的资源建设与模型开发仍处于起步阶段。由邓俊杰、史涵如等研究人员于2023年提出的MiTC数据集,源自IEEE SMC国际会议发布的MiLMo项目,旨在填补蒙古语、藏语、维吾尔语、哈萨克语及朝鲜语这五种少数民族语言在文本分类任务中的标注数据空白。该数据集由CMLI-NLP团队构建,核心研究问题聚焦于如何为低资源语言提供高质量的多语文本分类基准,从而推动少数民族语言的智能化处理。MiTC的发布不仅为多语言预训练模型MiLMo提供了关键的评测平台,也为少数民族语言的信息检索、舆情分析及机器翻译等下游应用奠定了数据基础,对促进多语种社会计算与语言技术公平性具有重要影响。
当前挑战
MiTC数据集面临的核心挑战首先在于少数民族语言本身的资源稀缺性,这些语言在语料获取、标注规范及形态学复杂度上存在显著困难,例如蒙古语的黏着特性与朝鲜语的混合书写系统增加了文本分类的歧义性。其次,构建过程中需克服跨语言数据采集的不平衡问题,五种语言在语料规模、领域覆盖及标注一致性上难以统一,导致模型泛化能力受限。此外,由于少数民族语言缺乏成熟的预训练词向量与形态分析工具,数据集需额外处理词汇形态变化与拼写变体,这进一步加剧了标注成本与质量控制的难度。最终,如何在低资源条件下设计有效的多任务学习策略以缓解数据稀疏性,仍是该数据集推动领域进步的关键技术瓶颈。
常用场景
经典使用场景
MiTC数据集作为面向少数民族语言的多语种文本分类基准,其经典使用场景聚焦于低资源语言的自然语言理解任务。该数据集涵盖了蒙古语、藏语、维吾尔语、哈萨克语和朝鲜语五种语言,为跨语言文本分类研究提供了标准化的评测平台。研究者通常利用MiTC评估预训练语言模型在多语种环境下的泛化能力,尤其是在形态复杂、资源匮乏的少数民族语言上,通过零样本或少样本学习范式验证模型对语言特异性的捕获程度。该场景的核心在于推动多语种表示学习的前沿探索,填补主流语言之外的研究空白。
实际应用
在实际应用中,MiTC数据集支撑了少数民族语言智能处理系统的构建,涵盖智能客服、舆情监测与教育辅助等场景。例如,在边疆地区的多语种政务系统中,基于MiTC训练的文本分类模型能够自动识别和归类蒙古语或藏语的用户诉求,提升公共服务效率。此外,该数据集还可用于少数民族语言的内容审核与信息检索,帮助社交媒体平台实现跨语言敏感内容过滤。这些应用不仅降低了人工处理多语种文本的成本,还增强了语言服务的普惠性。
衍生相关工作
MiTC数据集直接衍生出MiLMo多语种预训练语言模型,该模型采用词级与形态级联合训练策略,显著提升了少数民族语言的文本分类性能。在此基础上,后续工作进一步探索了基于对比学习的跨语言表示对齐方法,以及融合知识图谱的语义增强技术。该数据集还催生了面向少数民族语言的词嵌入评估基准,推动了Word2Vec等经典模型在多语种场景下的适应性改进。这些衍生研究共同构建了从数据到模型再到应用的完整生态链,为低资源语言NLP领域树立了典型范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务