Vision2Web
收藏资源简介:
Vision2Web是一个全面的基准测试,旨在评估多模态编码代理在视觉网站开发任务中的表现,涵盖整个软件开发生命周期。它包括三个渐进层次:静态网页、交互式前端和全栈网站,每个层次都有相应的评估指标。数据集包含193个任务,涵盖16个子类别和4个主要领域,支持918个原型图像和1,255个功能测试用例。
Vision2Web is a comprehensive benchmark designed to evaluate the performance of multimodal coding agents on visual web development tasks, covering the entire software development lifecycle. It includes three progressive levels: static web pages, interactive frontends, and full-stack websites, with 193 total tasks spanning 16 subcategories and 4 major domains (e-commerce, SaaS, content, and public services), and provides 918 prototype images and 1,256 functional test cases.
Vision2Web 数据集概述
数据集基本信息
- 数据集名称:Vision2Web
- 核心任务:评估多模态编码智能体在端到端视觉网站开发任务上的能力。
- 主要特点:一个分层的基准测试,涵盖从静态网页到全栈网站的完整软件开发生命周期。
数据集结构与内容
- 任务总数:193个任务。
- 层级划分:
- Level 1 – 静态网页:根据多设备UI原型(桌面/平板/移动端)生成响应式、可执行的网页。
- Level 2 – 交互式前端:根据多个原型和文本规范,开发具有连贯导航流程的多页面交互式前端。
- Level 3 – 全栈网站:根据结构化需求文档和视觉原型,构建处理状态管理和后端逻辑的完整全栈系统。
- 领域覆盖:涵盖电子商务、SaaS、内容、公共服务4个主要领域,共16个子类别。
- 数据规模:包含918张原型图像和1,256个功能测试用例。
评估方法
- 评估指标:
- 视觉评分(VS):用于所有层级。
- 功能评分(FS):用于Level 2和Level 3。
- 评估范式:基于工作流的智能体验证,结合GUI智能体验证器进行功能正确性评估,以及基于视觉语言模型的评判器进行视觉保真度评估。
数据集获取与使用
-
许可证:CC-BY-NC-SA-4.0,仅用于学术研究,禁止任何形式的商业用途。
-
下载地址:https://huggingface.co/datasets/zai-org/Vision2Web
-
数据集结构:
datasets/ ├── webpage/ # Level 1: 静态网页 (100个任务) ├── frontend/ # Level 2: 交互式前端 (66个任务) └── website/ # Level 3: 全栈网站 (27个任务)
-
任务目录内容:
prototypes/:UI原型图像。resources/:多媒体资源(图像、图标、视频、字体)。workflow.json:测试工作流规范。prompt.txt:文本需求(仅Level 2)。prd.md:需求文档(仅Level 3)。
相关资源
- 项目主页:https://vision2web-bench.github.io/
- 论文地址:https://arxiv.org/abs/2603.26648
- 排行榜提交:https://huggingface.co/datasets/zai-org/Vision2Web-Leaderboard




