世界模型训练开放世界虚拟场景视频数据
收藏资源简介:
用于世界模型训练中开放世界虚拟场景的生成与理解能力优化,覆盖3A级游戏画面的空间布局学习、环境物理模拟、场景动态演化及多视角连续视觉建模。适用对象为具身智能研发企业、自动驾驶仿真团队、游戏AI工作室及通用人工智能研究机构。本数据集应用于虚拟开放世界环境中的自然语言指令理解、视觉导航、轨迹预测和具身智能模型训练,主要解决智能体如何根据任务指令,结合场景画面、角色位置及朝向信息,理解目标并学习三维环境中的导航过程。 数据以单次任务为基本样本。“编号”作为唯一标识,关联“虚拟场景视频”、自然语言任务指令、状态流及结果文件;“任务类型”用于任务分类,“场景起点标识”和“起点校验结果”用于确定角色初始位置并筛选起点稳定时间符合要求的样本。任务指令通过文本编码器提取语义特征:F_text=Encoder_text(T)。 “状态记录序号”和“状态流时间戳”用于排列状态快照;“角色三维坐标”“角色旋转方向”“当前场景单元”和“当前世界空间”共同构成第t时刻状态:S_t=[P_t,R_t,C_t,W_t],用于描述角色位置、朝向及所处空间。视频按“视频时间轴参数”解码为连续帧,并提取视觉特征:F_visual,t=Encoder_vision(I_t)。 “状态采样频率”“状态快照数量”和“时间同步信息”用于将视频帧与状态流对齐。依据Windows QPC计数及频率计算状态相对时间:t_state=(QPC_t-QPC_0)/F_QPC;视频帧时间为t_video=j/FPS,按照最小时间差匹配对应状态。模型融合任务语义、视频特征和历史状态,预测下一时刻角色状态或导航轨迹:Ŝ_{t+1}=NavigationModel(F_text,F_visual,1:t,S_1:t)。 “任务执行时长”限定有效任务区间;“任务结果”“任务结束原因”和“成功判定条件”用于判断角色是否进入目标区域并持续停留规定时间,支持任务成功率和完成时长统计。模型采用三维位置误差、朝向误差、平均位移误差(ADE)、最终位移误差(FDE)及任务成功率进行评价。 数据处理时检查起点校验、时间戳递增性、状态序号连续性、视频与状态时间一致性。“数据完整性状态”用于确认视频、状态流、重置报告、结果报告及时间映射是否齐全;“数据文件校验值”采用SHA-256验证文件在存储和传输过程中是否损坏或被篡改,保证数据完整、可追溯。




