Workspace-Bench
收藏资源简介:
Workspace-Bench是由上海交通大学与字节跳动联合构建的大规模工作空间智能体评估基准,包含5种职业角色的真实数字工作环境,涵盖74种文件类型、20,476个文件(总容量达20GB)及其复杂的依赖关系。该数据集通过388个依赖驱动型任务(含7,399项评估细则)系统检验智能体在跨文件检索、上下文推理和自适应决策等方面的能力,并推出100任务的精简版本降低70%评估成本。其创新性体现在首次模拟真实办公场景中的文件谱系关系和语义关联,为突破当前智能体在异构文件理解与版本追踪等瓶颈问题提供标准化测试平台。
Workspace-Bench is a large-scale workspace AI Agent evaluation benchmark jointly constructed by Shanghai Jiao Tong University and ByteDance. It comprises realistic digital work environments for 5 occupational roles, covering 74 file types, 20,476 files with a total capacity of 20GB, and their complex dependency relationships. This benchmark systematically evaluates the capabilities of AI Agents in cross-file retrieval, contextual reasoning, adaptive decision-making and other aspects via 388 dependency-driven tasks, which include 7,399 evaluation metrics. Moreover, a lightweight 100-task variant is released to reduce the evaluation cost by 70%. Its core innovation lies in the first simulation of file lineage relationships and semantic associations in real office scenarios, providing a standardized test platform for breaking through current bottlenecks of AI Agents in heterogeneous file understanding, version tracking and other related fields.
数据集概述:Workspace-Bench 1.0
Workspace-Bench 是一个用于评估 AI 智能体在工作空间任务中处理大规模文件依赖关系的基准测试,旨在测试智能体的 工作空间学习 能力——即识别、推理、利用和更新工作空间中异构文件之间显式和隐式依赖关系的能力。
核心特点
- 真实工作场景:模拟真实工作空间,要求智能体独立探索目录、定位相关信息、理解跨文件关系并生成正确的交付成果。
- 对比其他基准:不同于将全部信息直接放入提示或仅提供少量任务特定文件的基准,Workspace-Bench 在具有大规模文件依赖的真实工作空间中进行评估。
数据集规模与组成
- 5 个 真实工作者画像:运营经理、物流经理、AI 产品经理、研究员、后端开发人员。
- 74 种 文件类型,覆盖多种异构工作空间环境。
- 20,476 个 文件,单个工作空间规模可达 20GB。
- 388 个 任务,每个任务均配有明确的文件依赖图。
- 7,399 条 细粒度评估标准(rubrics)。
轻量级子集
- Workspace-Bench-Lite:包含 100 个 任务的子集,在保留基准分布的同时,将评估成本降低约 70%。
评估方式
- 使用面向能力的评估标准,不仅衡量最终结果的正确性,还衡量智能体导航复杂工作空间结构和文件关系的能力。
数据集发布状态
- 完整数据集即将发布,计划包含任务规格、输入文件、标准化输出格式以及评估脚本。
相关论文
- 论文链接:https://arxiv.org/abs/2605.03596




