MS MARCO Web Search - 包含数百万真实点击标签的网页数据集
收藏资源简介:
MS MARCO Web Search是微软发布的一个大规模、信息丰富的网页数据集。该数据集包含约10亿个高质量网页,源自ClueWeb22,这些网页不仅包括纯文本,还有视觉元素、HTML结构、语义标注等,覆盖207种语言,同时包含1000万个独特查询和数百万带有相关标签的查询-文档对,这些数据来自微软Bing搜索引擎的搜索日志。MS MARCO Web Search提供了100M和10B两种规模的数据集。该数据集可以帮助研究人员开发出更好的搜索引擎和信息检索系统,以及训练和测试大型语义理解模型,使其更精准把握用户搜索意图和文档内容。
MS MARCO Web Search is a large-scale, information-rich web dataset released by Microsoft. This dataset contains approximately 1 billion high-quality web pages sourced from ClueWeb22, which include not only plain text but also visual elements, HTML structures, semantic annotations, and more, covering 207 languages. It also includes 10 million unique queries and millions of query-document pairs with relevance labels, derived from the search logs of Microsoft's Bing search engine. MS MARCO Web Search offers datasets in two scales: 100M and 10B. This dataset can assist researchers in developing better search engines and information retrieval systems, as well as in training and testing large semantic understanding models to more accurately capture user search intents and document content.
MS MARCO Web Search 数据集概述
数据集简介
MS MARCO Web Search 是一个大规模的信息丰富的网络数据集,包含数百万个真实的点击查询-文档标签。该数据集紧密模拟了真实世界的网络文档和查询分布,为各种下游任务提供了丰富的信息。数据集整合了最大的开放网络文档数据集 ClueWeb22,包含约100亿个高质量网页,以及1000万个来自93种语言的独特查询,这些查询与数百万个相关标记的查询-文档对一起,从Microsoft Bing搜索引擎的搜索日志中收集。
数据集任务
该数据集提供了三个主要的网络检索挑战任务:
-
嵌入模型排名任务:关注嵌入模型排名,要求在大型网络数据量下保证足够的知识覆盖。评估指标包括平均倒数排名(MRR)、召回率、吞吐量(QPS)和延迟。
-
嵌入检索排名任务:关注嵌入检索算法/系统的性能和准确性,评估近似最近邻(ANN)召回率、吞吐量和延迟。
-
端到端检索排名任务:比较不同解决方案的结果质量和系统性能,包括嵌入模型加ANN系统、倒排索引解决方案、混合解决方案、神经索引器和大语言模型等。
数据集内容
100M数据集
- ClueWeb22集合:包含100亿个网页。
- 文档ID映射:提供ClueWeb22中的文档ID映射。
- 训练、开发和测试集:包含查询和相关性标签。
- 文档和查询嵌入向量:用于嵌入检索任务。
10B数据集
- ClueWeb22集合:包含100亿个网页。
- 训练、开发和测试集:包含查询和相关性标签,用于验证方法在大型数据集上的有效性。
使用条款
数据集仅供非商业研究目的使用,使用时需遵守相关条款和条件,包括但不限于禁止使用外部数据集进行提交。




