>>直播和内容获取转到
点击按钮预约直播
两篇连续工作,勾勒出一条清晰路线:先让 AI 看懂空间如何随时间变化,再让它推演未来,并生成可交互的 4D 世界。
当 AI 开始走进真实世界,仅仅识别一张图片已经不够。机器人、自动驾驶和具身智能系统,还需要理解空间结构如何随时间变化,判断下一刻可能发生什么,并进一步生成可交互的动态场景。
这里的“4D”并不是四个空间维度,而是“三维空间 + 时间”。围绕这一目标,4D-VGGT 与 ST-Gen4D 两篇连续工作,给出了一条清晰的技术路线:理解、推演、生成。
01
先看懂:
4D-VGGT 的动态几何感知
真实场景中,相机在移动,物体也在运动,两类变化很容易混在一起。4D-VGGT 将空间与时间分开建模:跨视角理解全局空间关系,沿时间捕捉局部运动连续性。
在统一表征下,模型可以同时完成相机位姿、深度、动态区域、点图以及 2D/3D 轨迹等任务。它更像是动态世界的“几何底座”——先把世界的结构与运动看准,再为后续预测和生成提供可靠基础。
02
再推演:
ST-Gen4D 让世界模型预测未来
ST-Gen4D 在此基础上继续向前一步。它不只预测下一帧像素,而是把场景组织成语义、全局外观和局部运动等结构化状态,再交给世界模型推演未来。
这意味着模型关注的不只是画面“像不像”,还包括物体在哪里、怎样运动,以及彼此关系将如何变化。
03
最后生成:
构建时空一致的 4D 世界
预测出的未来状态会进一步引导扩散模型,生成可渲染的 4D Gaussians。目标是在多个时间步中,同时保持外观稳定、运动连贯和几何结构一致。
因此,最终生成的不只是一段视觉上连贯的视频,而是一个能够被观察、渲染和进一步交互的动态三维世界。
04
两篇工作,一条技术链路
4D-VGGT 解决“动态世界如何被感知和表示”,ST-Gen4D 则进一步回答“世界状态如何被推演和生成”。两者共同串起了:
动态几何理解 → 未来状态推演 → 一致性 4D 生成
对于具身智能而言,这条路线的价值十分直接:机器需要先看懂环境,再预测变化,才能更安全、更有效地规划动作。未来,随着动态数据、世界模型与生成技术持续演进,面向真实物理世界的智能系统将拥有更强的理解、想象与行动能力。
当然,高速运动的捕捉、长时间推演中的误差累积等问题仍待解决。但从“看见变化”到“生成变化”,AI 对真实世界的建模,正在从二维像素走向结构化的时空认知。
真实世界从不静止。要让具身智能真正进入物理世界,模型不仅要理解三维空间,还要感知时间中的运动、预测未来状态,并生成可交互的动态场景。本次分享将结合4D-VGGT和ST-Gen4D,介绍我们在动态场景理解、世界模型推演与4D生成方面的探索。
相关论文
4D-VGGT:https://arxiv.org/abs/2511.18416
ST-Gen4D:https://arxiv.org/abs/2605.07390
个人主页;https://haonan-wang-aurora.github.io/

更多精彩回顾
🚀 直播精华看不够?完整版深度内容已独家上线知识星球「」!涵盖所有技术细节、QA及未公开彩蛋。深度解析!
干货满满,快来加入