遇见数据集

Hcompany/WebClick

收藏
Hugging Face2025-06-09 更新2025-07-05 收录
官方服务:

资源简介:

WebClick是一个高质量的基准数据集,用于评估多模态模型和代理在Web环境中的导航和定位能力。该数据集包含来自100多个网站的1639个英文网页截图,配以精确标注的自然语言指令和像素级点击目标,格式与广泛使用的screenspot基准相同。数据集分为三个主要组:agentbrowse、humanbrowse和calendars,分别代表代理浏览、人类日常任务和日历界面。每个样本包括网页截图、自然语言指令、点击目标的边界框和所属组。该数据集旨在测量和提升AI系统理解和解释Web界面、根据用户指令采取准确行动的能力。

WebClick is a high-quality benchmark dataset for evaluating navigation and localization capabilities of multimodal models and agents in Web environments. The dataset features 1,639 English-language web screenshots from over 100 websites paired with precisely annotated natural-language instructions and pixel-level click targets, in the same format as the widely-used screenspot benchmark.

提供机构:
Hcompany
搜集汇总
数据集介绍
Hcompany/WebClick 数据集图片
构建方式
WebClick数据集由H Company精心构建,旨在评估多模态模型在网页环境中的导航与定位能力。数据集包含1639张来自100多个网站的英文网页截图,每张截图均配以精准的自然语言指令和像素级点击目标边界框。构建过程注重真实性与严谨性:所有边界框严格对应HTML元素边界,由UI专家手工标注或审核,确保指令不含歧义意图而非视觉描述。截图源自三类场景:SurferH代理在WebVoyager任务中的浏览页面(36%)、人类日常操作页面(31.8%,如网购、旅行规划)以及日历界面(32.2%,UI理解难点)。数据集还剔除了个人身份信息,保障隐私安全。
特点
WebClick的核心特点在于其挑战性与真实性兼备。它超越了标准目标检测或OCR任务,要求模型具备真正的UI理解与基于指令的视觉推理能力。关键挑战包括:UI元素语义理解(如识别齿轮图标为设置按钮)、基于空间或外观的指令消歧(如“中间的登录按钮”)、日历导航(区分可用和灰色日期)以及格式与位置敏感性(如处理“18:45”的时间格式)。数据集通过三类场景的混合,模拟了从代理检索到人类日常任务的广泛真实导航情境,为评估模型在复杂UI交互中的鲁棒性提供了高质量基准。
使用方法
WebClick数据集以标准格式提供,适用于视觉文档检索任务。每个样本包含图像(image)、自然语言指令(instruction)、相对坐标边界框(bbox)和场景类别(bucket)。用户可直接加载数据集进行模型评估,通过比较模型预测的点击位置与真实边界框来量化定位精度。数据集已划分为测试集,并提供了主流模型(如UGround、Qwen2.5-VL、UI-TARS)的基准性能结果,便于新模型对比。使用方法简单:加载图像与指令,让模型输出点击坐标,然后计算与标注框的匹配度,从而评估其在网页导航任务中的表现。
背景与挑战
背景概述
WebClick是由H Company研究团队于2025年发布的高质量多模态定位基准数据集,旨在评估多模态模型与智能体在网页环境中的导航与交互能力。该数据集包含来自100余个网站的1639张英文网页截图,并配以精确的自然语言指令与像素级点击目标标注,借鉴了广泛使用的Screenspot基准格式。其核心研究问题聚焦于提升AI系统对网页界面的理解、用户指令的解读及在数字环境中执行精准操作的能力。数据集涵盖智能体浏览、人工浏览及日历界面三大场景,尤其针对UI理解、指令消歧与动态界面交互等前沿挑战,为视觉语言模型在网页智能体领域的性能评测提供了更具区分度的标准,推动了相关研究的进展。
当前挑战
WebClick所解决的领域挑战集中于多模态模型在网页导航中的细粒度视觉定位与指令理解,包括UI元素语义识别、基于空间关系的指令消歧以及动态界面(如日历组件)的交互。当前模型在区分相似元素(如不同位置的登录按钮)、处理文本与交互元素分离的场景时表现欠佳,且对区域格式(如时间表示)的鲁棒性不足。构建过程中,数据集的挑战在于确保标注的高质量与真实性:所有边界框需精确对应HTML元素边界,指令需模拟自然交互意图而非视觉描述,同时需人工审查去除歧义与隐私信息。这要求标注团队具备UI专业知识,并平衡场景多样性(如100余个网站)与标注一致性,从而构建出可信的评测基准。
常用场景
经典使用场景
WebClick作为多模态定位基准数据集,其最经典的使用场景在于评估和提升多模态模型与智能体在真实网页环境中的导航与交互能力。该数据集精心采集了来自超过100个英文网站的1639张网页截图,并配以精细标注的自然语言指令与像素级点击目标边界框。研究者通过该数据集可系统性地测试模型在理解用户意图、解析界面元素语义以及执行精准定位操作上的综合表现,尤其适用于衡量视觉语言模型在指令驱动的网页元素选取任务中的鲁棒性。
实际应用
在实际应用层面,WebClick数据集所模拟的场景与日常数字生活紧密相连,涵盖在线购物、旅行规划、个人日程管理及基于智能体的网页检索等典型任务。该数据集促使模型掌握真实用户与网页交互时的核心技能,例如准确点击登录按钮、将商品加入购物车、在日历中选择可用日期等。这些能力对于开发可靠的网页自动化代理、智能助理以及无障碍辅助工具具有直接价值,能够显著提升AI系统在复杂数字界面中自主完成任务的可信度与效率。
衍生相关工作
WebClick数据集的发布催生了一系列富有影响力的衍生研究工作。它作为更具挑战性的基准,被用于评估UGround、Qwen2.5-VL、UI-TARS及Holo1等前沿视觉语言模型在GUI定位任务上的性能。相关论文如《SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents》和《Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents》均引用了该数据集以验证其方法在复杂网页场景下的有效性。此外,WebClick与Screenspot系列基准的对比分析,为构建更强大的通用GUI智能体提供了关键的评测依据与改进方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务