Auto-ClawEval
收藏资源简介:
Auto-ClawEval是由ClawEnvKit框架自动生成的第一个大规模爪类智能体评估基准,包含24个语义类别的1040个任务环境。该数据集通过自然语言描述生成结构化任务参数,整合了模拟服务接口和自动化评分配置,其数据来源于框架的流程化合成而非人工标注。创建过程采用三阶段模块化流水线:解析器提取任务要素、生成器构建沙盒环境、验证器确保逻辑一致性,单任务生成成本仅为人工的1/13800。该数据集主要应用于爪类智能体的跨工具链评估和持续学习训练,旨在解决传统人工构建环境存在的多样性不足、迭代滞后等 scalability 瓶颈问题。
Auto-ClawEval is the first large-scale claw agent evaluation benchmark automatically generated by the ClawEnvKit framework, comprising 1,040 task environments across 24 semantic categories. This dataset generates structured task parameters via natural language descriptions, integrates simulated service interfaces and automated scoring configurations, and its data is derived from framework-driven procedural synthesis rather than manual annotation. Its creation follows a three-stage modular pipeline: the parser extracts task elements, the generator builds sandbox environments, and the validator ensures logical consistency. The generation cost per single task is only 1/13,800 of that of manual work. This dataset is primarily used for cross-toolchain evaluation and continual learning training of claw agents, aiming to address scalability bottlenecks such as insufficient diversity and iterative lag in traditional manually constructed environments.
ClawEnvKit 数据集概述
数据集基本信息
- 名称: ClawEnvKit
- 性质: 开源环境生成工具包,用于类爪型智能体(claw-like agents)。
- 核心功能: 集成了任务生成与评估。支持从自然语言自动生成训练环境,并通过可靠的验证进行评估。
- 许可证: MIT
主要特性与优势
- 可扩展性: 支持生成1000+任务,解决了传统人工编写基准任务(每个任务耗时2+小时)无法规模化的问题。
- 自动化生成: 无需手动编写测试;由LLM根据自然语言请求生成YAML配置文件,固定引擎处理验证。
- 统一评估框架: 无需为每个任务编写自定义评分代码;提供15种结构化检查类型(14种基于规则+LLM评判)和2项安全检查,可跨所有任务复用。
- 可靠验证: 基于审计日志进行验证(关注智能体实际行为,而非其声明),避免脆弱的pytest。
- 连续评分: 提供0.0-1.0的连续评分,并设有安全门控,而非简单的通过/失败二元判断。
- 部署简化: 无需为每个任务构建Docker镜像;使用一个基础镜像,通过卷挂载任何
task.yaml文件。
数据集内容与生成
- 任务生成: 可从自然语言请求或指定服务自动生成完整的评估环境(包含提示、固定数据、工具、评分标准和安全检查的
task.yaml)。 - 预生成基准数据集: 提供预生成的基准数据集 Auto-ClawEval 及其精简版 Auto-ClawEval-mini,可从HuggingFace下载。
- 任务范围: 涵盖20个模拟服务,24个类别,包括基于API的任务和文件依赖型任务(终端、OCR、办公QA、数据分析)。
- 评分导向: 结果导向型评分,混合了40-60%的基于规则检查和40-60%的LLM评判。
评估与集成
- 支持的智能体: 支持10种评估工具链,涵盖3个集成层级:
- 层级1(原生插件): OpenClaw
- 层级2(MCP服务器): Claude Code, NanoClaw, IronClaw, PicoClaw, ZeroClaw
- 层级3(SKILL.md + shell): CoPaw, NemoClaw, Hermes
- 评估模式:
- Docker工具链评估: 在Docker容器中运行智能体,使用模拟服务,具备审计日志和轨迹捕获功能。
- 智能体循环评估(无Docker): 轻量级函数调用循环,本地运行模拟服务,无需Docker。
- 支持的后端模型: 适用于提供商原生的Anthropic和OpenAI设置,以及通过OpenRouter路由的工具调用模型。
模拟服务
- 数量: 内置20个模拟服务。
- 领域: 涵盖电子邮件、日程安排、CRM、金融、库存、OCR、PDF和实时网络任务。
- 特性: 每个服务都支持审计日志、重置端点以及可选的错误注入,并且可以组合成跨服务基准测试。
- 扩展性: 可以从自然语言自动生成新的模拟服务(例如:
clawenvkit service create --request "Slack messaging")。
评分体系
最终分数结合了加权任务完成度、在注入故障下的鲁棒性以及作为硬性门控的安全性。
最终分数 = 安全性 × (0.80 × 完成度 + 0.20 × 鲁棒性)
获取与使用
- 安装: 通过Git克隆仓库并使用
pip install -e ".[all]"进行安装。 - 快速生成任务: 使用CLI命令,例如
clawenvkit generate --request "测试智能体能否对电子邮件进行分类并标记紧急邮件"。 - 使用预生成数据集: 从HuggingFace下载Auto-ClawEval数据集。
- 运行评估: 可使用提供的脚本在Docker工具链或智能体循环模式下对数据集进行评估。
相关资源
- 代码仓库: https://github.com/xirui-li/ClawEnvKit
- PyPI包: https://pypi.org/project/clawenvkit/
- 预生成数据集(HuggingFace):
- Auto-ClawEval: https://huggingface.co/datasets/AIcell/Auto-ClawEval
- Auto-ClawEval-mini: https://huggingface.co/datasets/AIcell/Auto-ClawEval-mini
- 论文: https://arxiv.org/abs/2604.18543

- 1ClawEnvKit: Automatic Environment Generation for Claw-Like Agents马里兰大学; 加州大学伯克利分校; 加州大学洛杉矶分校; 穆罕默德·本·扎耶德人工智能大学 · 2026年



