官方服务:
资源简介:
LTR article coding dataset
应用场景:
创建时间:
2016-09-02
相关数据集
irds/tripclick_train_hofstaetter-triples
--- pretty_name: '`tripclick/train/hofstaetter-triples`' viewer: false source_datasets: ['irds/tripclick', 'irds/tripclick_train'] task_categories: - text-retrieval --- # Dataset Card for `tripclick/
Hugging Face2023-01-05 更新240
T2K2
T2K2是由布加勒斯特理工大学创建的一个包含250万条推文的数据集,旨在通过分析文本数据中的关键词来提取知识。数据集通过Twitter的REST API收集,并经过预处理,包括提取标签、扩展缩写、提取句子和词干等步骤。该数据集被用于评估不同的权重计算方案和数据库实现,特别关注计算性能。T2K2的应用领域包括文本分析、趋势识别和异常检测,旨在通过高效计算关键词来解决信息检索中的问题。
arXiv2017-09-14 更新90
milos-andric/ruscifact_with_ruscibench
该数据集包含三个部分:corpus、default和queries。corpus部分是一个大型的文本集合,default部分包含查询和相应的corpus标识及评分,queries部分是查询的集合。具体来说,corpus部分包含182268条文本数据,default部分包含1128条测试数据,queries部分也包含1128条查询数据。
Hugging Face2025-01-19 更新70
timaeus/dsir-pile-13m-filtered-for-freelaw
该数据集包含三个主要特征:contents(内容,数据类型为字符串)、metadata(元数据,包含一个名为pile_set_name的字符串序列)和id(ID,数据类型为int64)。数据集分为一个训练集(train),包含1,467,628个样本,总大小为2,333,845,157.1210465字节。下载大小为1,338,671,296字节。配置部分指定了默认配置下的数据文件路径。
Hugging Face2024-11-15 更新140
rweics5cs7/exo7-realworld-db-combined-deg-enhanced-text-v3-fixed
该数据集包含三个部分:文本数据(corpus)、查询与文档相关性信息(qrels)和查询及其答案(queries)。文本数据部分包含3000个训练样本,查询与文档相关性信息部分包含1000个训练样本,查询及其答案部分也包含1000个训练样本。每个部分都有其独特的特征,例如corpus部分包含文本ID和文本内容,qrels部分包含查询ID和文档ID,queries部分包含查询ID、查询内容以及答案。
Hugging Face2025-11-10 更新80



