AskUbuntuDupQuestions
收藏资源简介:
该数据集包含四个配置:corpus、default、queries和top_ranked。corpus配置包含文档的唯一标识符、文本内容和标题;default配置包含查询的唯一标识符、文档的唯一标识符和评分;queries配置包含查询的唯一标识符和文本内容;top_ranked配置包含查询的唯一标识符和相关文档的唯一标识符列表。每个配置都有一个test分割,并提供了相应的数据大小和示例数量。
This dataset comprises four configurations: corpus, default, queries, and top_ranked. The corpus configuration holds the unique identifier, textual content, and title of each document. The default configuration includes the unique identifier of a query, the unique identifier of a document, and their relevance score. The queries configuration contains the unique identifier and textual content of each query. The top_ranked configuration consists of the unique identifier of a query and a list of unique identifiers of its relevant documents. Each configuration features a test split, with corresponding data sizes and sample counts provided.
AskUbuntuDupQuestions 数据集概述
数据集配置
配置名称:corpus
- 特征:
_id: 字符串text: 字符串title: 字符串
- 分割:
test:- 字节数: 667643
- 样本数: 7220
- 下载大小: 274293 字节
- 数据集大小: 667643 字节
配置名称:default
- 特征:
query-id: 字符串corpus-id: 字符串score: 整数 (int64)
- 分割:
test:- 字节数: 409115
- 样本数: 7220
- 下载大小: 55985 字节
- 数据集大小: 409115 字节
配置名称:queries
- 特征:
_id: 字符串text: 字符串
- 分割:
test:- 字节数: 25572
- 样本数: 361
- 下载大小: 16214 字节
- 数据集大小: 25572 字节
配置名称:top_ranked
- 特征:
query-id: 字符串corpus-ids: 字符串序列
- 分割:
test:- 字节数: 238286
- 样本数: 361
- 下载大小: 50286 字节
- 数据集大小: 238286 字节
数据文件路径
- corpus:
test:corpus/test-*
- default:
test:data/test-*
- queries:
test:queries/test-*
- top_ranked:
test:top_ranked/test-*




