b09902056/include
收藏官方服务:
资源简介:
该数据集是一个多语言问答数据集,包含id、language(语言)、subject(学科)、answer(答案)和question(问题)等特征。数据集仅提供测试分割,共有2742个示例,涉及多种语言和学科主题,旨在用于问答相关任务的评估或测试。数据大小约为1.16 MB,下载大小约为508 KB。
This dataset is a multilingual question-answering dataset that includes features such as id, language, subject, answer, and question. It only provides a test split with 2742 examples, covering multiple languages and subject topics, and is designed for evaluation or testing in question-answering related tasks. The dataset size is approximately 1.16 MB, with a download size of about 508 KB.
提供机构:
b09902056搜集汇总
数据集介绍

构建方式
INCLUDE数据集由2742个样本构成,每个样本包含唯一标识符、语言、主题、问题及答案五个核心字段。数据以test单一分割形式组织,存储为可高效读取的文件格式。该数据集通过系统化收集多语言、多主题的问题-答案对构建而成,覆盖广泛的知识领域,旨在为问答系统训练与评估提供结构化数据基础。
特点
INCLUDE数据集具备多语言特性,涵盖不同语言的问题与答案,能够支持跨语言自然语言处理任务。其结构化字段设计清晰,通过subject字段对主题进行分类,便于按领域筛选和分析。数据集规模适中,且所有样本统一存放于测试集,适合用作模型零样本或少样本学习的基准测试。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,利用默认配置读取test分割数据。访问时可指定特征字段,如question和answer用于问答任务,language和subject用于多语言或多主题滤波。该数据集可直接用于微调或评估序列到序列模型,亦可用于构建多语言问答系统的训练样例。
背景与挑战
背景概述
在自然语言处理领域,多语言与多领域问答数据的稀缺长期制约着模型泛化能力的提升。为应对这一挑战,研究者构建了“include”数据集,旨在通过涵盖多种语言与学科主题的问答对,为模型提供跨语言与跨领域的训练与评估基准。该数据集发布于HuggingFace平台,包含2742条测试样本,每条样本由标识符、语言、主题、问题与答案五部分构成,覆盖了从技术到人文的广泛学科。其核心研究问题在于探索模型在多样化语言与主题组合下的推理与应答能力。尽管数据集规模较小,但其设计思想推动了多语言问答系统的评价标准,为后续跨语言理解研究提供了可复用的资源。
当前挑战
数据集面临的核心挑战在于多语言与多领域问答对的稀疏性——跨语言迁移中常见问答对不足导致模型学习偏差,不同语言与主题组合下模型性能差异显著。构建过程中,如何平衡各语言与主题的样本数量以避免分布不均是主要难题;同时,确保跨语言问题翻译的语义一致性、主题标注的准确性也消耗大量标注资源。此外,现有测试集仅包含2742例样本,难以全面反映模型在真实应用中的鲁棒性,尤其是在低资源语言与专业领域的表现评估上存在明显局限。
常用场景
经典使用场景
INCLUDE数据集以其多语言、跨学科的问题-答案对结构,成为评估和提升大型语言模型跨语言理解与生成能力的基石。研究者常利用该数据集进行零样本或少样本条件下的推理测试,考察模型在英语之外的语言(如中文、西班牙语等)以及不同学科领域(如科学、历史、文学)中的知识掌握程度。其经典使用场景包括构建多语言问答基准、检验模型的知识迁移能力,以及探索语言与学科交叉对模型性能的影响。
解决学术问题
该数据集有效解决了当前自然语言处理领域中对多语言、多学科知识覆盖不足的评估难题。传统数据集多集中于单语言或特定领域,难以全面反映模型在真实多语环境下的泛化能力。INCLUDE通过系统化整合不同语言和学科的问题,使得研究者能够精准分析模型在跨语言知识检索、跨学科推理中的短板,为改进模型的多语言对齐与知识表征提供了重要依据,推动了多语言模型公平性评估的发展。
衍生相关工作
基于INCLUDE数据集,衍生出了一系列重要的研究工作,包括多语言知识蒸馏方法的创新、跨语言模型适配技术的优化以及多学科评测基准的扩展。例如,研究者借鉴其数据构建思路,开发了针对低资源语言的多模态问答数据集,并探索了模型在不同语言间的知识迁移策略。此外,该数据集还催生了针对语言模型偏见检测的专门研究,推动了多语言环境下模型公平性与鲁棒性的深入探讨。
以上内容由遇见数据集搜集并总结生成



