MAIR
收藏资源简介:
MAIR(Massive Instructed Retrieval Benchmark)是一个大规模的异构信息检索基准,包含126个不同的信息检索任务,涵盖6个领域。数据集从现有的信息检索数据集中收集,包括SIGIR资源跟踪论文、现有基准任务、TREC共享任务和最近的LLM基准。数据集包含10,038个查询和4,274,916个文档,通过数据采样和清洗过程构建,确保评估的准确性和成本效益。MAIR旨在评估模型在未见任务上的泛化能力,特别适用于评估指令调优的检索模型,解决信息检索中的多样化任务和长尾任务的挑战。
MAIR (Massive Instructed Retrieval Benchmark) is a large-scale heterogeneous information retrieval benchmark encompassing 126 distinct information retrieval tasks across 6 domains. This dataset is curated from existing information retrieval resources, including SIGIR Resource Tracking papers, established benchmark tasks, TREC shared tasks, and recent LLM benchmarks. It consists of 10,038 queries and 4,274,916 documents, and is constructed via rigorous data sampling and cleaning processes to ensure the accuracy and cost-effectiveness of model evaluations. MAIR is intended to assess the generalization capability of models on unseen tasks, and is particularly suited for evaluating instruction-tuned retrieval models, thereby addressing the challenges posed by diverse and long-tail tasks in information retrieval.
MAIR: A Massive Benchmark for Evaluating Instructed Retrieval
数据集概述
- 名称: MAIR (Massive Instructed Retrieval Benchmark)
- 描述: 一个异构基准,用于评估指令信息检索(IR)。包含126个跨6个领域的检索任务,每个查询都带有详细的检索指令。
- 扩展应用: 包括RAG、代码检索、基于代理的检索、生物医学、法律IR等领域。
- 数据增强: 通过数据采样和多样化提高评估效率。
数据链接
- Queries: MAIR-Queries
- Docs: MAIR-Docs
数据结构
Queries Data
- 字段:
qid: 查询IDinstruction: 任务指令query: 查询内容labels: 相关文档列表,包含id和score
Docs Data
- 字段:
id: 文档IDdoc: 文档内容
任务和领域
- 领域: Web、Medical、Code、Legal、Finance、Academic
- 任务数量: 126个任务
评估脚本
- 文本嵌入模型评估:
eval_embedding - 重排序模型评估:
eval_rerank - RankGPT评估:
RankGPT, eval_rerank - BM25评估:
BM25, eval_bm25
IFEval任务
- 描述: 包含8个不同的指令跟随子任务,如
format、keywords、length等。
引用
@inproceedings{Sun2024MAIR, title={MAIR: A Massive Benchmark for Evaluating Instructed Information Retrieval}, author={Weiwei Sun and Zhengliang Shi and Jiulong Wu and Lingyong Yan and Xinyu Ma and Yiding Liu and Min Cao and Dawei Yin and Zhaochun Ren}, booktitle={EMNLP}, year={2024}, }




