Agent-X
收藏资源简介:
Agent-X是一个用于评估视觉中心LLM代理在真实世界环境中深度推理和工具使用技能的基准。它包含828个由人类编写的任务,涵盖六个领域,如网页浏览、监控、自动驾驶、体育和数学推理。每个任务都需要明确的逐步决策和明智的工具使用。
Agent-X is a benchmark designed to evaluate the deep reasoning and tool-use capabilities of vision-centric LLM agents in real-world scenarios. It consists of 828 human-written tasks spanning six domains, including web browsing, monitoring, autonomous driving, sports, and mathematical reasoning. Each task demands explicit step-by-step decision-making and prudent tool utilization.
Agent-X 数据集概述
数据集基本信息
- 名称: Agent-X
- 发布日期: 2025-05-22
- 论文标题: Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- 论文地址: https://arxiv.org/abs/2505.24876
- 数据集地址:
- Hugging Face: https://huggingface.co/datasets/Tajamul21/Agent-X
- 下载地址: https://github.com/Tajamul21/Agent-X-Benchmark/releases/download/v0.1.0/agent-X_dataset.zip
数据集简介
Agent-X 是一个用于评估视觉中心 LLM 代理在真实场景中深度推理和工具使用能力的基准测试。主要特点包括:
- 真实多步骤任务: 包含 828 个人工编写的任务,涵盖六个领域(网页浏览、监控、自动驾驶、体育、数学推理等)。
- 真实部署工具: 提供感知、网页、操作、数学和数据处理等多种工具。
- 多样化多模态上下文: 每个任务都配有真实图像、多图像比较或视频片段以及文本指令。
数据集统计
- 任务数量: 828
- 领域分布: 六个视觉中心环境
- 工具使用频率: 详细统计见数据统计图
- 步骤数量: 多步骤任务
数据集生成流程
采用半自动化流程生成任务:
- LMM 基于视觉输入和可用工具集生成候选查询。
- 人工注释者优化查询的清晰度和真实性。
- LMM 生成逐步推理轨迹,包括工具调用、中间输出和最终答案。
- 人工审查逻辑一致性和正确性。
评估协议
评估分为三种模式:
- 逐步评估: 评估代理执行单个推理步骤的能力。
- 深度推理评估: 评估完整推理轨迹的连贯性和逻辑一致性。
- 结果评估: 测量代理的整体任务解决性能。
引用信息
bibtex @misc{ashraf2025agentxevaluatingdeepmultimodal, title={Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks}, author={Tajamul Ashraf and Amal Saqib and Hanan Ghani and Muhra AlMahri and Yuhao Li and Noor Ahsan and Umair Nawaz and Jean Lahoud and Hisham Cholakkal and Mubarak Shah and Philip Torr and Fahad Shahbaz Khan and Rao Muhammad Anwer and Salman Khan}, year={2025}, eprint={2505.24876}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2505.24876}, }




