TerminalTraj
收藏资源简介:
TerminalTraj是一个大规模终端代理轨迹数据集,通过从真实世界的GitHub仓库中生成Docker对齐的终端代理轨迹,并包含实例特定的可执行验证。该数据集包含50,733个经过验证的终端轨迹,覆盖八个专业领域,并支持持续、可扩展的数据合成。
TerminalTraj is a large-scale terminal agent trajectory dataset. It is constructed by generating Docker-aligned terminal agent trajectories from real-world GitHub repositories, and incorporates instance-specific executable validation. This dataset contains 50,733 validated terminal trajectories, covers eight professional domains, and supports continuous and scalable data synthesis.
TerminalTraj 数据集概述
数据集基本信息
- 数据集名称: TerminalTraj
- 发布机构/作者: m-a-p (Multimodal Art Projection)
- 关联论文: Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments
- 论文链接: https://arxiv.org/abs/2602.01244
- 数据集访问地址: https://huggingface.co/datasets/m-a-p/TerminalTraj
- 模型访问地址: https://huggingface.co/m-a-p/TerminalTraj-32B
数据集简介
TerminalTraj 是一个用于训练终端智能体模型的大规模、高质量终端轨迹数据集。该数据集旨在解决构建可执行且可验证的终端交互数据所面临的挑战,其核心是通过一个可扩展的流水线,从真实的 Docker 化环境中生成智能体轨迹。
核心方法与构建
- 核心挑战: 数据构建需满足可执行性(每个实例需要特定Docker环境)和可验证性(异构任务输出难以统一验证)。
- 解决方案: 提出了 TerminalTraj 流水线:
- 环境构建: 通过基于模型的仓库质量评分,筛选高质量 GitHub 仓库,自动化构建了 32,325 个 Docker 镜像,涵盖八种编程语言。
- 实例生成: 生成与 Docker 环境对齐的任务实例,涵盖八个专业领域,涉及真实世界的工具和依赖。
- 轨迹合成与验证: 合成智能体轨迹,并通过任务特定的可执行验证器(受 TerminalBench 启发)进行过滤验证。
- 数据规模: 最终生成了 50,733 条经过验证的终端轨迹。
数据特点与用途
- 领域覆盖: 涵盖八个不同的专业领域。
- 环境真实性: 数据基于真实的 Docker 化环境生成,确保了交互的可行性和真实性。
- 核心用途: 用于训练面向终端任务的智能体模型,以提升其在复杂、长程交互任务上的性能。
实验效果
使用该数据集训练的模型(基于 Qwen2.5-Coder 主干)在 TerminalBench (TB) 基准测试上取得了显著的性能提升:
- 在 TB 1.0 上最高提升 20%。
- 在 TB 2.0 上最高提升 10%。
- 其中,TerminalTraj-32B 模型在参数量小于 100B 的模型中表现优异,在 TB 1.0 上达到 35.30%,在 TB 2.0 上达到 22.00%,并展现出改进的测试时缩放能力。
数据获取与使用
数据集已发布在 Hugging Face Datasets 平台,可通过以下代码加载: python from datasets import load_dataset ds = load_dataset("m-a-p/TerminalTraj")
未来计划
计划在近期额外发布 5,000 个配备基于 Docker 环境的实例。




