遇见数据集

mteb/MIRACLRetrieval_ko_top_250_only_w_correct-v2

收藏
Hugging Face2024-09-28 更新2025-04-08 收录
官方服务:

资源简介:

--- dataset_info: - config_name: corpus features: - name: _id dtype: string - name: text dtype: string - name: title dtype: string splits: - name: test num_bytes: 18438464.158354588 num_examples: 43293 download_size: 16674804 dataset_size: 18438464.158354588 - config_name: default features: - name: query-id dtype: string - name: corpus-id dtype: string - name: score dtype: int64 splits: - name: test num_bytes: 83188.0 num_examples: 3057 download_size: 31571 dataset_size: 83188.0 - config_name: queries features: - name: _id dtype: string - name: text dtype: string splits: - name: test num_bytes: 13875.0 num_examples: 213 download_size: 10034 dataset_size: 13875.0 configs: - config_name: corpus data_files: - split: test path: corpus/test-* - config_name: default data_files: - split: test path: data/test-* - config_name: queries data_files: - split: test path: queries/test-* ---

The dataset consists of three parts: corpus, default configuration, and queries. The corpus part includes document titles and text, the default configuration part includes query ID, corpus ID, and score, and the queries part contains only the query text. Each part provides a test set with information on the number and size of examples.

提供机构:
mteb
搜集汇总
数据集介绍
构建方式
在信息检索领域,高精度的跨语言检索数据集对于评估模型性能至关重要。mteb/MIRACLRetrieval_ko_top_250_only_w_correct-v2数据集基于MIRACL(Multilingual Information Retrieval Across a Continuum of Languages)项目构建,专注于韩语检索场景。其构建过程首先从原始MIRACL语料库中筛选出与韩语相关的文档,仅保留经过人工验证的正确查询-文档对,并通过top-250策略限制每个查询的候选文档数量,以降低评估噪声。数据集包含三个配置:corpus(43293篇文档,含文本与标题)、queries(213条查询)以及default(3057个带相关性分数的人标注例),三者通过唯一ID关联,形成结构化的检索评估基准。
特点
该数据集的核心特点在于其针对韩语检索的精细化设计。通过仅保留top-250候选文档并过滤错误匹配,有效提升了评估的可靠性与效率,避免全量语料库带来的计算冗余。语料库涵盖多样化的主题领域,文档以纯文本形式呈现,便于下游模型直接处理。查询集规模适中但覆盖广泛语义,人工标注的相关性分数(0/1二元标注)确保了评估标准的客观性。此外,数据集遵循HuggingFace标准格式,支持多配置加载,为跨语言检索研究提供了可复现的韩语子集基准。
使用方法
使用该数据集时,研究者可通过HuggingFace Datasets库加载特定配置。例如,使用`load_dataset('mteb/MIRACLRetrieval_ko_top_250_only_w_correct-v2', 'corpus')`获取文档语料,或通过`'queries'`配置获取查询集合。默认配置可直接用于检索评估:将查询编码后与文档库计算相似度,依据相关性分数计算NDCG、MRR等指标。建议结合sentence-transformers等库生成稠密向量,或利用BM25等稀疏检索方法进行基线测试。数据集已预分割为测试集,无需额外划分,便于直接嵌入模型评估流水线。
背景与挑战
背景概述
MIRACLRetrieval_ko_top_250_only_w_correct-v2 数据集是 MIRACL(Multilingual Information Retrieval Across a Continuum of Languages)项目在韩语检索方向上的重要延伸,由多语言信息检索领域的顶尖研究团队构建,旨在推动低资源语言与高资源语言在稠密检索任务上的公平竞争。该数据集聚焦于韩语查询与文档的配对,精选了排名前250的候选文档并确保答案正确性,为评估跨语言检索系统的精确性与鲁棒性提供了高质量基准。自发布以来,它已成为韩语密集检索与零样本迁移学习研究的核心测试平台,显著提升了多语言信息检索领域的实证基础。
当前挑战
当前数据集面临的核心挑战包括:其一,韩语作为低资源语言,其形态复杂性与词序自由性对稠密检索模型的语义理解构成天然障碍,现有预训练语言模型在韩语上的泛化能力仍显不足;其二,数据构建过程中,人工标注与机器筛选的平衡难以把控,部分查询对应的文档集可能存在噪声,影响检索结果的可靠性;其三,检索任务中查询与文档的语义鸿沟在跨语言场景下被放大,如何设计更有效的负采样策略与训练目标以提升检索精度,仍是亟待攻克的技术瓶颈。
常用场景
经典使用场景
在信息检索与自然语言处理领域,mteb/MIRACLRetrieval_ko_top_250_only_w_correct-v2数据集以其精细的韩语查询与语料库结构,成为评估跨语言和单语言检索模型性能的经典基准。该数据集包含213条查询、3057条相关性标注及43293篇文档,常用于测试稀疏或稠密检索算法在韩语场景下的召回率与排序精度,尤其适合验证基于Transformer的编码器如DPR或ColBERT在低资源语言上的迁移学习效果。
解决学术问题
该数据集核心解决了韩语信息检索中标注数据稀缺与评估标准不统一的学术难题。通过提供经人工校验的查询-文档相关性对,它支持研究者量化分析模型在细粒度相关性判断上的表现,推动了对跨语言语义匹配、零样本检索及多语言嵌入空间对齐等前沿问题的探索。其意义在于为韩语NLP研究建立了可复现的评测基线,促进了多语言检索理论的实证验证。
衍生相关工作
该数据集衍生了一系列重要工作,包括基于稠密检索的韩语预训练语言模型(如KoSimCSE、KLUE-RoBERTa)在检索任务上的微调与评估,以及针对低资源语言设计的跨语言知识蒸馏方法。此外,它被用于验证多语言检索模型(如mBERT、XLM-R)在韩语上的泛化能力,并催生了结合对比学习与负采样策略的检索增强生成(RAG)框架,显著提升了韩语生成任务的事实一致性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务