遇见数据集

osunlp/QUEST-Mid-Training-Data

收藏
Hugging Face2026-06-22 更新2026-07-22 收录
官方服务:

资源简介:

QUEST Mid-Training Data 是一个用于QUEST模型中期训练的数据集,以Parquet分片格式提供。目前发布了一个分支:context_summarization(上下文摘要)。每行数据包含一个messages字段,该字段是一个聊天格式的列表,其中每个元素是一个字典,包含角色(role)和内容(content)键值对,用于表示对话消息。数据集旨在支持模型在研究和摘要任务中的训练,特别是通过合成任务来训练深度研究代理。

QUEST Mid-Training Data is a dataset designed for the mid-stage training of the QUEST model, provided in Parquet shard format. Currently, one branch has been released: context_summarization (context summarization). Each data row includes a `messages` field, which is a chat-formatted list. Each entry in this list is a dictionary with `role` and `content` key-value pairs to represent individual conversation messages. This dataset aims to support model training for research and summarization tasks, particularly for training deep research agents via synthetic tasks.

提供机构:
osunlp
搜集汇总
数据集介绍
osunlp/QUEST-Mid-Training-Data 数据集图片
构建方式
QUEST-Mid-Training-Data 是 QUEST 系列模型中期训练阶段的核心数据资源,专为提升模型在复杂信息处理任务上的能力而设计。该数据集以 Parquet 格式分片存储,目前仅发布了一个名为 context_summarization 的拆分。每条数据以聊天格式呈现,包含一个 messages 字段,即 list[{"role": "...", "content": "..."}] 结构,模拟了从系统指令到用户查询的完整对话流。值得注意的是,另一个名为 relevant_info_extraction 的任务因涉及原始 HTML 内容可能引发法律风险而未被公开,官方仅提供了最小示例以说明其格式。
特点
该数据集的核心特点在于其高度结构化的对话式构建方式与面向深度研究场景的适配性。每条样本中的系统指令详细定义了模型作为深度研究助手的角色与行为规范,包括多工具调用能力,如搜索引擎与网页访问函数。用户查询部分则整合了网页标题、来源、元数据及 Markdown 内容,并指定明确的信息提取目标。这种设计不仅模拟了真实研究过程中的多源信息检索与综合摘要过程,也为模型在上下文理解与信息压缩方面提供了高质量的训练信号,兼具任务的真实性与挑战性。
使用方法
研究人员可通过 Hugging Face Datasets 库便捷加载该数据集。使用 load_dataset 函数并指定数据集名称 'osunlp/QUEST-Mid-Training-Data' 及拆分名称 'context_summarization',即可获得可流式读取的数据迭代器。例如,执行 split='context_summarization' 并以 streaming=True 模式加载,能够有效节省内存开销,适合大规模训练场景。每条样本的 messages 字段可直接用于对话模型的输入输出构造,开发者只需按规定格式提取系统、用户及助手的角色与内容,即可快速集成至下游训练流程。
背景与挑战
背景概述
QUEST-Mid-Training-Data是由俄亥俄州立大学孙焕研究团队于2026年推出的数据集,隶属于QUEST(训练前沿深度研究智能体)项目,旨在通过全合成任务训练具备深度多源调查能力的大语言模型。该数据集包含约数百万条上下文总结样本,以对话格式呈现,支撑模型在中期训练阶段提升信息综合与结构化输出能力。作为QUEST系列的关键组件,它与其他阶段数据(如强化学习数据)协同,构建了从基础能力到开放任务的全栈训练体系,对推动深度研究智能体的发展具有重要影响。
当前挑战
该数据集面临的主要挑战包括:1) 领域问题方面,传统模型缺乏对多源异质信息的自主检索、筛选与结构化整合能力,而深度研究任务要求模型跨越开放域和学术领域进行可信证据的综合;2) 构建过程中,相关性信息提取任务因包含原始HTML内容存在法律与版权风险而无法公开发布,迫使团队仅能提供最小示例,这限制了数据集的完整性与多样性;此外,如何设计全合成任务以确保数据质量、避免简化偏差,也是构建中的关键技术挑战。
常用场景
经典使用场景
在大型语言模型的后训练阶段,中间训练(Mid-Training)是连接预训练与指令微调的关键环节。QUEST-Mid-Training-Data作为QUEST系列的核心中间训练数据集,最经典的使用场景是用于训练模型掌握上下文摘要(Context Summarization)能力。该数据集包含数百万条对话格式的样本,每条样本通过精心构造的messages字段模拟推理代理(Deep Research Assistant)与用户之间的交互过程,引导模型从长文档或多源信息中提取关键内容并生成精炼摘要。这种训练范式显著提升了模型对复杂信息的压缩与重组能力,为后续的指令微调与强化学习奠定了坚实基础,使其能够胜任深度研究场景下的信息提炼任务。
衍生相关工作
QUEST-Mid-Training-Data的发布直接催生了一系列后续研究。基于该数据集的中间训练检查点,研究社区衍生出多种强化学习策略(如QUEST-RL)以进一步优化推理链的探索与利用平衡。同时,该数据集与QUEST-SFT系列(面向客观与开放式任务)形成互补,推动了多阶段训练流水线的标准化设计。许多工作探索了将中间训练数据集与领域自适应技术相结合,例如在法律文档摘要和医学病历凝练等垂直领域进行二次微调,显著提升了特定场景下的任务表现。此外,该数据集的对话格式设计启发了后续研究者在合成数据生成中引入多轮交互范式,为构建更具深度推理能力的研究型代理奠定了方法论基础。
数据集最近研究
最新研究方向
该数据集聚焦于通过纯合成任务驱动的中间训练(mid-training)范式,提升深度研究助手的上下文摘要生成能力,其最新研究动向紧密围绕大模型在复杂信息提取与归纳任务上的对齐优化。QUEST-Mid-Training-Data作为QUEST系列的核心中间训练数据,旨在为模型提供面向长篇网页内容的结构化摘要训练样本,反映了当前前沿研究中利用大规模合成数据替代人工标注来驱动模型泛化能力的主流趋势。特别是在研究热点上,该数据集回避了可能涉及版权的原始HTML内容,转而采用简洁的对话格式进行任务表征,呼应了学术界与工业界对数据合规性与可复现性的双重关注。其意义在于推动了从搜索-摘要联动到深度研究链构建的实证探索,为未来可扩展、低风险的智能研究助手训练提供了兼具效率与伦理考量的数据范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务