SmartSnap-FT
收藏资源简介:
SmartSnap是一个用于支持自我验证GUI代理研究的数据集,包含模型检查点、训练数据集、评估套件和系统提示等资源。训练数据集包含超过550K的QA对,来自30K+的AndroidLab轨迹,并遵循3C原则(完整性、简洁性、创造性)进行证据标注。该数据集旨在通过统一的策略处理任务执行和证据管理,提升代理在复杂移动任务中的可靠性和性能。
SmartSnap is a dataset designed to support research on self-verifying GUI agents. It encompasses resources including model checkpoints, training datasets, evaluation suites, and system prompts. The training dataset contains over 550K QA pairs derived from more than 30K AndroidLab trajectories, with evidence annotations following the 3C principles (Completeness, Conciseness, Creativity). This dataset aims to enhance the reliability and performance of agents in complex mobile tasks by leveraging a unified strategy for task execution and evidence management.
SmartSnap-FT 数据集概述
基本信息
- 许可证: Apache 2.0
- 任务类别: 文本生成
- 语言: 英语
- 标签: 智能体、移动端、图形用户界面
- 数据规模: 100K < n < 1M
核心概念
SmartSnap 是一种范式转变,它将 GUI 智能体从被动的任务执行者转变为主动的自我验证者。通过赋予智能体遵循 3C 原则(完整性、简洁性、创造性)来策划自身成功证据的能力,消除了昂贵的事后验证瓶颈,同时提升了复杂移动任务上的可靠性和性能。
框架特点
- 统一策略: 处理任务执行和证据策划。
- 增强的 MDP: 智能体在扩展的动作空间 ⊕ 中操作,包括执行动作(点击、输入等)和策划动作(提交证据索引)。
- 双目标训练: 基于 GRPO 的强化学习同时优化任务完成度和证据质量。
- 密集奖励塑造: 多组件奖励 $R_{format}$ + $R_{validity}$ + $R_{complete}$ + $R_{concise}$ 引导智能体成为有效的自我验证者。
- 创造性证据生成: 智能体在任务完成后主动执行额外操作以捕获稳健的证明。
发布内容
-
模型检查点
SmartSnap-Llama3.1-8B-Instruct- RL 训练,成功率为 31.15%SmartSnap-Qwen2.5-7B-Instruct- RL 训练,成功率为 30.43%SmartSnap-Qwen3-8B-Instruct- RL 训练,成功率为 36.23%SmartSnap-Qwen3-32B-Instruct- RL 训练,成功率为 34.78%- 每个模型系列对应的 SFT 检查点
-
训练数据集
- 来自 AndroidLab 上 30K+ 条精选轨迹的 550K+ 问答对。
- 遵循 3C 原则的证据标注。
- 基于 XML 的环境观察和工具交互日志。
-
评估套件
- AndroidLab 基准集成(涵盖 9 个应用的 138 个验证任务)。
- LLM-as-a-Judge 评估流程(基于 GLM4)。
- 使用 DeepSeek-R1 和多数投票的验证器实现。
-
系统提示
- 编码了 3C 原则的智能体系统提示(约 4K 词元)。
- 用于结构化证据评估的验证器指令。
- 奖励塑造配置文件。
关键结论
- 协同学习循环: 执行和验证的双重使命培养了更深层次的任务理解——智能体学习将问题分解为证据里程碑,隐式地提高了规划能力。
- 证据质量至关重要: 普通 SFT 在所有模型上仅达到约 22% 的成功率,而自我验证 SFT 达到 23-30% 的成功率,表明证据策划训练比解决方案记忆更有效。
- RL 解锁泛化能力: 微调模型在 RL 训练后显示出持续 >16% 的绝对增益,较小模型(8B)的表现比其朴素提示基线高出 26.08%。
- 通过简洁性实现效率: 训练后的智能体平均提交约 1.5 个证据快照,大幅降低了验证器成本,同时保持了高可靠性。
- 局限性: 需要广泛领域知识的任务(例如 Maps.me 导航)在没有显式知识注入的情况下仍然具有挑战性,表明仅靠 RL 无法弥合巨大的知识差距。
性能表现
- 该方法在 AndroidLab 上实现了高达 26.08% 的绝对性能提升,匹配或超过了 DeepSeek-V3.1 和 Qwen3-235B-A22B 等大得多的模型。
- 所有模型系列相比提示基线实现了 >16% 的改进,达到了与 10-30 倍大模型相竞争的性能。
- 在 Settings(占训练任务的 31%)上的显著改进验证了平衡任务分布的重要性。
引用
bibtex @article{smartsnap2025, title={SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents}, author={Shaofei Cai and Yulei Qin and Haojia Lin and Zihan Xu and Gang Li and Yuchen Shi and Zongyi Li and Yong Mao and Siqi Cai and Xiaoyu Tan and Yitao Liang and Ke Li and Xing Sun}, journal={arXiv preprint arXiv:2025}, year={2025}, eprint={2512.22322}, url={https://arxiv.org/abs/2512.22322}, }




