遇见数据集

open-gigaai/Giga-World-1-Toydata

收藏
Hugging Face2026-07-01 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是Giga-World-1的示例数据,提供用于测试GigaWorld-1推理、数据管道和模型训练工作流的示例资产和玩具数据集。它包括推理资产(如图像到视频推理的输入图像和控制视频)、原始LeRobot格式的玩具数据集(包含RGB视频、深度输出、Plücker坐标控制信号、草图控制信号和元数据标签)以及模型训练数据(分为nano和pro两个规模,用于验证训练管道)。数据集旨在帮助用户快速测试和验证GigaWorld-1项目的相关流程。

This directory provides example assets and toy datasets for testing the GigaWorld-1 inference, data pipeline, and model training workflow.

提供机构:
open-gigaai
搜集汇总
数据集介绍
open-gigaai/Giga-World-1-Toydata 数据集图片
构建方式
Giga-World-1-Toydata专为验证GigaWorld-1世界模型的推断、数据流水线与模型训练工作流而构建。其原始数据以LeRobot格式存储,包含来自多视角摄像头的高清视频、深度图、Plücker坐标控制信号及草图控制信号,并附有每段轨迹的动作序列与关节角度等元数据。在此基础上,数据被进一步预处理为可直接用于模型训练的episode_*.pt文件,并划分为nano与pro两个规模层级,分别服务于快速调试与完整数据加载测试。整个构建过程强调从原始传感器数据到训练就绪样本的端到端流水线验证。
特点
该数据集的核心特质在于其多层次、多模态的结构设计。它不仅提供了RGB视频与深度图作为视觉观测,还融入了Plücker坐标与草图两种控制信号,从而支持对图像到视频生成任务的全面测试。同时,每段轨迹均配有短提示与长提示,前者概括任务目标,后者通过视觉语言模型生成细粒度描述,为条件生成提供了丰富的语义上下文。nano与pro的双规模划分则兼顾了快速迭代与规模真实性的平衡,使得数据流水线和训练流程能够在不同计算资源下得到充分验证。
使用方法
使用者可直接将本数据集与GigaWorld-1主仓库的脚本配合使用。对于推断测试,调用infer_assest目录下的输入图像与控制视频即可快速启动图像到视频的生成流水线。原始LeRobot格式数据可借助LeRobot可视化工具进行直观浏览与调试。训练方面,nano与pro两个子集各自包含预处理的episode_*.pt文件与dataset_cache.pkl缓存索引,加载后即可无缝接入模型的训练循环。具体的数据准备、推断、可视化与训练命令,应参照主项目的README文档进行配置与执行。
背景与挑战
背景概述
在机器人学习与具身智能领域,构建能够理解物理世界动态并预测未来状态的世界模型已成为核心研究方向之一。为此,研究团队(依托Hugging Face社区及LeRobot框架)于近期发布了Giga-World-1-Toydata数据集,这是一个面向机器人世界模型验证的小规模玩具数据集,旨在为大规模视频预测与模仿学习流水线提供测试基准。数据集包含了来自多视角摄像头的RGB视频、深度图、普吕克坐标控制信号及手绘草图等多种模态信息,并提供了标准化标签结构以支撑从数据预处理到模型训练的全流程开发。尽管其规模有限,但作为GigaWorld-1大项目的先导验证数据,该数据集为探索多模态信息融合下的长视频生成与动作推理提供了关键实验基础,有望推动机器人学习领域内可复现基准的建立。
当前挑战
当前,机器人世界模型研究面临的核心挑战在于如何高效整合多模态异构数据并实现精确的物理动态预测。Giga-World-1-Toydata旨在解决领域问题中的两大难点:其一,多视角信息(如头部相机与左右腕部相机画面)的时空对齐与一致性建模,因不同视角下的视觉特征差异及遮挡问题而极具挑战;其二,将控制信号(如普吕克坐标与草图)与视觉观测融合为端到端可学习的表示,需克服模态间语义鸿沟。在构建过程中,数据流水线面临协调深度估计(借助Depth Anything V2)、标签自动化标注(如通过Qwen3-VL生成长文本描述)以及大规模视频片段的高效切分与缓存等工程难题。此外,确保玩具数据集在有限规模下仍能反映真实场景中的动作分布多样性,亦是验证流程可靠性的一大挑战。
常用场景
经典使用场景
Giga-World-1-Toydata作为机器人世界模型领域的一个示例性小规模数据集,其最经典的使用场景是用于验证和调试视频生成、数据管道处理及模型训练的全流程工作流。该数据集提供了从原始LeRobot格式的机器人视频数据到预处理训练样本的完整转换链条,研究人员可以借助其包含的多视角RGB视频、深度图、Plücker坐标控制信号以及手绘草图等多模态信息,快速搭建从数据加载、特征提取到模型推理的端到端测试环境。
解决学术问题
该数据集有效解决了机器人世界模型研究中数据格式碎片化和流程验证困难的学术痛点。通过提供规范化的原始数据与预处理模板,它使得研究人员能够聚焦于视频预测、模仿学习等核心算法的优化,而非耗费大量精力在数据接口的调试上。其深远意义在于树立了一个可复现的基准测试范例,推动了机器人领域从单一视觉任务向多模态融合与时序建模的范式跃迁。
衍生相关工作
该数据集衍生了一系列与机器人世界模型训练和评估相关的经典工作。例如,基于其提供的nano和pro两种颗粒度的训练数据,研究者开发了针对不同规模模型架构的训练数据加载器优化方案;同时,其所包含的多视图控制信号催生了融合Plücker坐标与手绘草图的混合条件视频生成方法,这些工作共同推动了机器人具身智能领域从仿真环境向真实数据栖居的迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务