相关数据集
ADL-X
ADL-X是由北卡罗来纳大学夏洛特分校和英智†蔚蓝海岸大学合作创建的多视角RGBD指令ADL数据集,包含100,000个未修剪的RGB视频-指令对,3D姿态,语言描述和动作条件对象轨迹。该数据集通过新颖的半自动化框架生成,旨在训练大型语言视觉模型(LLVMs)以理解和预测日常生活中的活动。ADL-X的创建过程涉及从NTU RGB+D 120数据集中提取和处理视频,采用人物中心裁剪策略和动作序列随机
arXiv2024-06-14 更新1340
unipic_nano_3images
UniPic-Nano-3Images 是一个高质量的多图像合成数据集,包含 35,394 个样本,专为训练先进的图像融合和合成模型而设计。每个样本由 3 张输入图像和 1 张输出图像组成,根据自然语言指令将三张输入图像中的元素无缝组合。数据集采用 JSON 格式,每个样本包含输入图像路径、合成指令和输出图像路径。数据集涵盖了 20 多种不同的合成场景,包括人物+物品+物品、人物+穿戴物品+物品等
Hugging Face2026-02-04 更新190
datacomp/ImageNetTraining100.0-frac-1over8
这是一个未详细描述的数据集,可能是ImageNet数据集的一个子集,包含了原数据集的1/8部分,但具体内容、数据类型和用途未在README中明确说明。
Hugging Face2025-01-22 更新140
Hy-Embodied-0.5-VLA-Data
Hy-Embodied-0.5-VLA-Data 是由腾讯 Robotics X 与腾讯混元团队发布的大规模双臂机器人操作数据集,用于训练视觉-语言-动作(Vision-Language-Action, VLA)基础模型。该数据集基于定制化指尖式 UMI(Universal Manipulation Interface)设备结合光学动作捕捉系统采集,包含超过 2,000 小时的高保真机器人操作演示
魔搭社区2026-07-11 更新500
swiss-ai/patho-ssl-data-curation
本研究提供了数字病理学中用于视觉基础模型的自动数据筛选的数据集。数据集包含了3500万个瓦片的层次聚类结果,以及用于可视化的瓦片图像和相关的元数据。这些数据可以帮助研究人员在瓦片级别上进行无监督的数据筛选,以改善视觉基础模型在下游临床任务中的表现。
Hugging Face2025-06-02 更新140



