ATBench
收藏资源简介:
ATBench(代理轨迹安全与安全基准)是一个用于轨迹级安全评估和细粒度风险诊断的数据集。它包括500个轨迹(250个安全/250个不安全),每个轨迹约8.97个回合(约4486个回合交互)。数据集包含1575个独特工具,以及一个独立的未见工具库,包含2292个工具定义(与训练工具无重叠)。标签包括二进制“安全”/“不安全”;不安全轨迹还包括细粒度标签(风险来源、故障模式、现实世界危害)。
ATBench (Agent Trajectory Safety and Security Benchmark) is a dataset designed for trajectory-level safety evaluation and fine-grained risk diagnosis. It includes 500 trajectories (250 safe / 250 unsafe), with approximately 8.97 rounds per trajectory, totaling around 4486 interactive rounds. The dataset contains 1575 unique tools, alongside an independent unseen tool library with 2292 tool definitions that have no overlap with the training tools. The labels include binary "safe"/"unsafe" categories; for unsafe trajectories, fine-grained labels covering risk sources, failure modes, and real-world hazards are also provided.
AgentDoG 数据集概述
数据集基本信息
- 数据集名称: ATBench (Agent Trajectory Safety and Security Benchmark)
- 发布地址: https://huggingface.co/datasets/AI45Research/ATBench
- 主要用途: 用于轨迹级安全评估和细粒度风险诊断。
数据集规模与内容
- 轨迹数量: 500条轨迹(250条安全 / 250条不安全)。
- 交互轮次: 平均每条轨迹约8.97轮,总计约4486轮交互。
- 工具库:
- 轨迹中出现的独特工具数量:1575个。
- 独立的未见工具库:包含2292个工具定义(与训练工具无重叠)。
- 标注类型:
- 二元标签:
safe(安全)或unsafe(不安全)。 - 对于不安全轨迹,额外提供细粒度标签:风险来源(Risk Source)、失效模式(Failure Mode)、现实世界危害(Real-World Harm)。
- 二元标签:
安全分类体系
数据集采用统一的三维安全分类体系对智能体风险进行组织:
- 风险来源: 威胁在智能体循环中的起源(例如:用户输入、环境观察、外部工具/API、智能体内部推理)。
- 失效模式: 不安全行为的表现形式(例如:有缺陷的规划、不安全的工具使用、指令优先级混淆、不安全内容生成)。
- 现实世界危害: 造成的现实影响(例如:隐私泄露、财务损失、人身伤害、安全漏洞、更广泛的社会/心理危害)。
- 当前版本分类数量: 8个风险来源类别、14个失效模式、10个现实世界危害类别。
数据合成方法
数据通过分类体系引导的合成流程生成,旨在生成真实、多步骤的智能体轨迹。
- 流程: 基于采样的风险元组(风险来源、失效模式、现实世界危害)生成轨迹,扩展为连贯的工具增强执行序列,并通过质量检查过滤。
- 工具库规模: 显著大于现有基准(例如,约为R-Judge的86倍,ASSE-Safety的55倍,ASSE-Security的41倍)。
- 分布平衡: 确保合成数据在三个分类维度(风险来源、失效模式、危害类型)上具有平衡且多样的风险分布。
性能亮点(基于ATBench等基准)
- 二元轨迹安全评估: 在R-Judge、ASSE-Safety和ATBench基准上优于现有方法。
- 细粒度风险诊断准确率(最佳FG模型):
- 风险来源准确率:82.0%
- 失效模式准确率:32.4%
- 危害类型准确率:59.2%
相关模型
数据集用于训练和评估名为 AgentDoG 的风险感知评估与防护框架模型。该框架提供两种任务模型:
- 轨迹级安全评估模型(二进制): 预测整个轨迹为
safe或unsafe。 - 细粒度风险诊断模型(FG): 对
unsafe轨迹,额外预测(风险来源,失效模式,现实世界危害)元组。
已发布的模型基于不同基础模型微调,详情见项目主页模型列表。
许可证
- 本项目依据 Apache 2.0 许可证 发布。




