PolyTrace
收藏资源简介:
PolyTrace是一个用于LLM RLVR训练的工作负载数据集,包含3个大规模内部RL训练工作负载和4个开源RL训练工作负载,主要包含工具调用延迟和实际工作负载两种数据类型。数据集涵盖数学、编程、搜索、视频理解、工具使用和图像理解等多个任务领域,支持多轮任务工作负载,并提供数据匿名化和分布生成功能。
PolyTrace is a workload dataset designed for LLM RLVR training. It includes three large-scale internal RL training workloads and four open-source RL training workloads, featuring two main data types: tool call latency and actual workloads. The dataset covers multiple task domains such as mathematics, programming, search, video understanding, tool usage, and image understanding, supports multi-turn task workloads, and provides data anonymization and distribution generation functions.
PolyTrace数据集概述
数据集简介
PolyTrace是一个用于大语言模型强化学习训练的数据集,主要包含两种数据类型:工具调用延迟数据和实际工作负载数据。
任务构成
数据集包含7个训练任务,分为两大类:
开源RL训练工作负载(4个)
- Mathematics:32B模型,191个训练步骤,使用DAPO数据集
- Programming:14B模型,190个训练步骤,使用DeepCoder数据集
- Searching:7B模型,147个训练步骤,使用NO hotpotqa数据集
- Video Understanding:7B模型,112个训练步骤,使用RoboVQA数据集
内部RL训练工作负载(3个)
- Mathematics:235B模型,188个训练步骤,使用内部数据集
- Tool Use:235B模型,59个训练步骤,使用内部数据集
- Image Understanding:235B模型,46个训练步骤,使用内部数据集
数据结构
单轮任务格式
json { "0": { "input": [], "output": [] }, "1": { "input": [], "output": [] } }
多轮任务格式
json { "0": [ { "input": [...], "output": [...] }, { "input": [...], "output": [...] } ], "1": [ { "input": [...], "output": [...] }, { "input": [...], "output": [...] } ] }
数据特征
- 从训练轨迹中收集长度信息以实现数据匿名化
- 提供基于高斯混合分布的数据生成方法用于更严格的数据脱敏
- 在开源任务中,部分输入输出可能存在不一致,但不影响数据采样
使用工具
数据集提供生成脚本:
generate.py:生成Verl中Cosmos任务的输入数据generate_distribution.py:使用拟合分布生成工作负载数据




