官方服务:
资源简介:
NTCIR13の学習結果をいれておく 多言語も日本語だけもある
应用场景:
创建时间:
2022-12-25
相关数据集
Vikhrmodels/Grounded-RAG-QA-RU
该数据集是基于13,000篇俄语维基百科文章构建的,使用了GPT-4-turbo-1106生成的合成问题和答案。数据集中的对话格式遵循HuggingFace的标准,包含文档、用户和助手三个角色。特别地,助手的角色在对话末尾重复出现,第一次出现时提供文档ID的JSON数组,第二次出现时提供对用户问题的完整回答。数据集旨在训练模型回答基于多个文档的复杂和简单问题,并学会拒绝那些无法在提供文档中找到答案
Hugging Face2024-07-04 更新340
ahmadSiddiqi/fr-retrieval-syntec-s2p
该数据集包含两个主要部分:corpus和queries。corpus部分包含90个例子,总字节数为114096;queries部分包含100个例子,总字节数为8475。数据集的总下载大小为61749字节,总大小为122571字节。每个数据项包含id和text两个字段,分别表示数据的唯一标识和文本内容。
Hugging Face2024-01-26 更新80
FAIRsharing record for: FAST (Faceted Application of Subject Terminology) Topic Facet
This FAIRsharing record describes: FAST (Faceted Application of Subject Terminology) is an enumerative, faceted subject heading schema derived from the Library of Congress Subject Headings (LCSH). The
DataCite Commons2024-01-29 更新60
1-800-SHARED-TASKS/Wiki2018_Devanagari_Script_Language_Identification
--- dataset_info: features: - name: sentence dtype: string - name: label dtype: class_label: names: '0': cdo '1': glk '2': jam '3':
Hugging Face2024-09-19 更新90
FrancophonIA/LongEval-Retrieval
LongEval 2024信息检索数据集,包含基于Qwant搜索引擎的用户查询和对应的相关网页文档,用于2024年LongEval信息检索实验室的训练和测试。数据集包含法语文档和英文翻译。
Hugging Face2025-03-30 更新70



