重磅分享!具身动态世界认知与生成,如何从“看见”走向“推演”

具身智能之心 2026-08-04 11:00
点击下方卡片,关注“具身智能之心”公众号

>>直播和内容获取转到

点击按钮预约直播

两篇连续工作,勾勒出一条清晰路线:先让 AI 看懂空间如何随时间变化,再让它推演未来,并生成可交互的 4D 世界。

当 AI 开始走进真实世界,仅仅识别一张图片已经不够。机器人、自动驾驶和具身智能系统,还需要理解空间结构如何随时间变化,判断下一刻可能发生什么,并进一步生成可交互的动态场景。

这里的“4D”并不是四个空间维度,而是“三维空间 + 时间”。围绕这一目标,4D-VGGT 与 ST-Gen4D 两篇连续工作,给出了一条清晰的技术路线:理解、推演、生成。


01

先看懂:

4D-VGGT 的动态几何感知


真实场景中,相机在移动,物体也在运动,两类变化很容易混在一起。4D-VGGT 将空间与时间分开建模:跨视角理解全局空间关系,沿时间捕捉局部运动连续性。

在统一表征下,模型可以同时完成相机位姿、深度、动态区域、点图以及 2D/3D 轨迹等任务。它更像是动态世界的“几何底座”——先把世界的结构与运动看准,再为后续预测和生成提供可靠基础。


02

再推演:

ST-Gen4D 让世界模型预测未来


ST-Gen4D 在此基础上继续向前一步。它不只预测下一帧像素,而是把场景组织成语义、全局外观和局部运动等结构化状态,再交给世界模型推演未来。

这意味着模型关注的不只是画面“像不像”,还包括物体在哪里、怎样运动,以及彼此关系将如何变化。


03

最后生成:

构建时空一致的 4D 世界


预测出的未来状态会进一步引导扩散模型,生成可渲染的 4D Gaussians。目标是在多个时间步中,同时保持外观稳定、运动连贯和几何结构一致。

因此,最终生成的不只是一段视觉上连贯的视频,而是一个能够被观察、渲染和进一步交互的动态三维世界。


04

两篇工作,一条技术链路


4D-VGGT 解决“动态世界如何被感知和表示”,ST-Gen4D 则进一步回答“世界状态如何被推演和生成”。两者共同串起了:

动态几何理解  →  未来状态推演  →  一致性 4D 生成

对于具身智能而言,这条路线的价值十分直接:机器需要先看懂环境,再预测变化,才能更安全、更有效地规划动作。未来,随着动态数据、世界模型与生成技术持续演进,面向真实物理世界的智能系统将拥有更强的理解、想象与行动能力。

当然,高速运动的捕捉、长时间推演中的误差累积等问题仍待解决。但从“看见变化”到“生成变化”,AI 对真实世界的建模,正在从二维像素走向结构化的时空认知。

真实世界从不静止。要让具身智能真正进入物理世界,模型不仅要理解三维空间,还要感知时间中的运动、预测未来状态,并生成可交互的动态场景。本次分享将结合4D-VGGT和ST-Gen4D,介绍我们在动态场景理解、世界模型推演与4D生成方面的探索。



相关论文


  • 4D-VGGT:https://arxiv.org/abs/2511.18416

  • ST-Gen4D:https://arxiv.org/abs/2605.07390

  • 个人主页;https://haonan-wang-aurora.github.io/


分享介绍
重磅分享!具身动态世界认知与生成,如何从“看见”走向“推演”图1


更多精彩回顾

🚀 直播精华看不够?完整版深度内容已独家上线知识星球「」!涵盖所有技术细节、QA及未公开彩蛋。深度解析!

干货满满,快来加入

END

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
AMD :一家芯片公司如何在机器人赛道铺物理 AI 地基? 和中国机器人公司走相反的起点
斥资12个亿!年产数千台的无轨导航机器人基地在苏开工
VLA重构机器人智能:从“听懂话”到“自己干”
无本体数据直达真机,深朴智能拔掉机器人后训练的「真机数据锚点」
成都又一机器人“学校”来了!
具身智能迈入产业落地深水区,鹿明破解机器人技能获取难题
宇树科技科创板IPO路演定档,人形机器人“第一股”即将申购
借力以旧换新,外骨骼机器人迈向消费市场
全行业都在卷大模型,他们却用不确定微分几何给机器人做了个大脑
人形机器人一用灵巧手就“站桩”?人形控制全新框架,双运动先验实现移动灵巧操作
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号