遇见数据集

grug-67b-a2b-agentic-sft-training-data

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

Grug 67B agentic SFT 训练数据集是一个用于训练 grug_67b_a2b_sft_s3_agentic 模型的监督式微调(SFT)数据集。该数据集由 29 个不同的数据组件等权重混合构成,这些组件源自 Hugging Face 上特定版本(commit)的快照。数据内容主要为对话形式,共包含 77,012 个对话,原始数据量约为 1.67 GB(不计文件系统开销)。数据经过处理,生成了用于模型训练的实际输入 token 缓存,总计包含 797,783,562 个 token。数据转换和训练过程使用了嵌入的特定聊天模板(chat_template.jinja)。数据集采用块状混合采样策略进行训练,所有组件权重均为 1.0。根据记录的训练配置(5 个 epoch,批次大小 64,序列长度 32,768 token),对应的训练总步数为 1,903 步。数据集包提供了可读的转换后数据集文件(converted_hf/)和直接用于训练的 token 缓存文件(token_caches/),并附有详细的清单文件(manifest.json)记录每个组件的来源、版本、token 数量、校验和等元数据,以及来自 W&B 运行的训练数据配置文件(wandb_training_data_config.json)。该数据集旨在精确复现原始训练运行的数据流。

The Grug 67B agentic SFT training dataset is a supervised fine-tuning (SFT) dataset used for training the grug_67b_a2b_sft_s3_agentic model. It is constructed from an equal-weight mixture of 29 different data components, which are snapshots from specific commits on Hugging Face. The data primarily consists of dialogues, containing a total of 77,012 conversations, with an original data size of approximately 1.67 GB (excluding file system overhead). The data has been processed to generate actual input token caches for model training, totaling 797,783,562 tokens. The data conversion and training process utilized a specific embedded chat template (chat_template.jinja). The dataset employs a block-wise mixed sampling strategy for training, with all component weights set to 1.0. According to the recorded training configuration (5 epochs, batch size 64, sequence length 32,768 tokens), the total number of training steps is 1,903. The dataset package provides readable converted dataset files (converted_hf/) and token cache files for direct training (token_caches/), along with a detailed manifest file (manifest.json) recording metadata such as source, version, token count, and checksum for each component, as well as a training data configuration file from a W&B run (wandb_training_data_config.json). This dataset is designed to precisely reproduce the data flow of the original training run.

提供机构:
LAION eV
创建时间:
2026-07-29
原始信息汇总

Grug 67B Agentic SFT 训练数据集

该数据集是 Grug 67B A2B Agentic SFT 训练所消耗的精确 29 组件混合数据集的本地重构版本,包含两种表示形式。

数据组成

  • converted_hf/: 包含 29 个可读的转换后数据集,共 77,012 条对话,占用约 1.67 GB 存储空间。
  • token_caches/: 包含 Levanter 实际读取的 token ID、助手掩码、偏移量、分类账和统计信息,共 797,783,562 个 token。

配置文件

  • manifest.json: 映射每个源追踪仓库到其转换后仓库、完整 Hugging Face 修订版本、文档工件、token 缓存 URI、行数和 token 数、对象存储 ETag 以及本地 SHA-256 校验和。
  • wandb_training_data_config.json: 来自权威 W&B 运行的数据/训练器投影。
  • chat_template.jinja: 嵌入在每个缓存中的确切模板,其 SHA-256 值为 7481acabcc6916e27df9b536fdeff24c4d326c04e5e387ea3d5c9863da499577

训练长度

训练步数计算为:ceil(5 个 epoch × 797,783,562 tokens / (32,768 tokens × batch 64)) = 1,903 步。

组件权重

所有 29 个组件的权重均为 1.0,采用 Marin 的块状混合采样方式。

已排除的转换

训练运行仅选择 29 个组件,以下三个成功转换的仓库未被纳入:

  • exp_rpt_methods2test-large-v3
  • exp_rpt_pymethods2test-large
  • exp_rpt_pymethods2test-v3

另外两个转换尝试失败,从未进入混合数据集。

搜集汇总
数据集介绍
grug-67b-a2b-agentic-sft-training-data 数据集图片
构建方式
该数据集是Grug 67B模型面向智能体场景的监督微调训练数据的精确重构,由29个独立的数据组件混合而成。每个组件均依据其对应的Marin文档产物,锁定至Hugging Face上完整的提交版本,确保数据来源的可追溯性。原始数据经过转换后形成两种表示形式:其一为可读的转换数据集,涵盖77,012轮对话,存储体积约为1.67 GB;其二为Levanter框架实际读取的令牌ID缓存,包含797,783,562个令牌,这些缓存来自Amazon S3上29个不可变的存储前缀。所有组件均采用等权重(权重为1.0)进行块状混合采样,并通过清单文件与训练配置记录各组件间的映射关系。
特点
该数据集的核心特点在于其精确重构与高度可验证性。29个组件均通过完整的提交哈希与本地校验和进行锁定,确保训练数据与原始运行环境严格一致。等权重的块状混合策略与简单的拼接方式不同,它忠实复现了Marin框架下的分块采样流,每个组件在训练过程中被均匀调度。此外,数据集提供了双重表示——可读格式与令牌化缓存,既便于研究者进行数据检查,又支持与Levanter训练框架的无缝对接。总训练轮次与步数的计算具有明确公式,进一步强化了数据集的科学性与可复现性。
使用方法
使用该数据集时,推荐直接加载令牌化缓存并依据`wandb_training_data_config.json`中的数据配置进行训练,以实现精确的训练流程复现。对于仅需数据检查的场景,可读取`converted_hf/`目录下的Parquet文件,但需注意这与实际训练流中的块状采样结果不完全等价。研究者还可通过`manifest.json`清单文件追溯每个组件的来源、版本及校验信息,确保数据使用过程中的透明性与可信度。数据集附带的对话模板文件为Jinja格式,在加载模型进行推理或微调时应嵌入该模板以保持行为一致。
背景与挑战
背景概述
在大型语言模型的后训练阶段,监督微调(SFT)是提升模型任务遵循能力的关键环节。2026年,Marin研究团队构建了名为grug-67b-a2b-agentic-sft-training-data的数据集,旨在为67B参数规模的智能体模型提供高质的微调训练数据。该数据集由29个组件混合而成,共计77,012条对话样本,包含约7.98亿个token,来源于多个任务仓库。其核心研究问题是探索如何通过精心设计的混合采样策略,在多样化的智能体交互数据上提升模型的指令理解和执行能力。这一工作为后续参数规模模型的智能体能力增强奠定了数据基础。
当前挑战
该数据集面临的核心挑战在于确保多源异质组分的均衡采样与高效训练。领域方面,它需解决智能体模型在复杂对话中准确执行多步指令的难题,而传统静态数据集往往难以覆盖多样化的任务边界。构建过程中,挑战尤为突出:一是组件选择与弃用,32个成功转换的仓库中仅精选29个,同时有两项转换任务完全失败,凸显了数据质量筛选的严格性;二是数据重构的保真度,需精确复现官方训练中的token缓存与嵌入模板,避免因数据偏移导致模型性能退化;此外,还涉及凭证安全风险,原始缓存文件中包含明文凭据,须在保留可复现性的前提下彻底清除敏感信息。
常用场景
经典使用场景
在大型语言模型(LLM)的后训练阶段,智能体微调(agentic SFT)是提升模型工具调用与任务规划能力的关键范式。grug-67b-a2b-agentic-sft-training-data 数据集专为此而生,其经典使用场景在于构造精细调节的监督式微调(SFT)混合样本,以引导模型掌握多步推理、环境交互与工具编排等智能体行为。该数据集融合了29个源自不同来源的对话组件,涵盖77,012条结构化对话,每条记录均遵循统一的聊天模板并经过严格的token化处理,支持以等权重混合采样的方式注入训练流。研究者可直接利用其所附的W&B训练配置(wandb_training_data_config.json)和本地token缓存,实现训练过程的完全可复现,从而系统性地探究多源异构数据对智能体模型性能的协同影响。
衍生相关工作
该数据集延续并拓展了以AgentInstruct、ToolBench和GPT-4-LLM为代表的智能体SFT数据范式。其创新的块级混合采样(blockwise mixture sampling)策略,启发了后续如D3SFT(动态跨源采样)与Mixture-of-Experts for SFT等研究,探索如何自适应调整多源数据在训练中的融合权重。数据集提供的完整复现基础设施——包含精确的token缓存与W&B配置——直接驱动了复现性智能体微调(Reproducible Agentic Tuning)这一新兴研究方向,该方向强调训练管道的端到端可审计性。此外,部分被排除的组件(如exp_rpt_methods2test系列)引发的“数据消融效应”分析,催生了对智能体SFT中数据质量筛选机制(如基于奖励模型的难例挖掘)的深入探讨,相关论文已在计算语言学与系统会议中发表。
数据集最近研究
最新研究方向
当前,基于大规模语言模型的智能体训练数据构建成为前沿热点。grug-67b-a2b-agentic-sft-training-data数据集代表了多源异构指令数据的精密混合与可复现性设计范式,其29个组分的等权重采样策略与精确的token缓存对齐技术,为智能体微调提供了工程化且可追溯的数据基线。这一工作呼应了业界对训练数据透明度与可复现性的迫切需求,尤其是在复杂智能体任务中,数据混合的构成与采样顺序直接影响模型行为。通过完整的清单映射与版本锁定机制,该数据集推动了从经验性数据拼接到科学化数据工程的关键跃迁,对构建更可靠、可控的智能体模型具有深远的实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务