>>直播和内容获取转到
点击按钮预约直播
01.
为什么一定要一帧一帧预测未来?带你解锁首个连续世界模型ODEWorld,像人类一样理解世界变化
让机器人把一只虾夹起来,再放进锅里。真正困难的,可能不是认出虾,也不是找到锅,而是把握夹爪闭合的那个瞬间:早一点,夹爪会落空;晚一点,虾可能已经被推走。夹住之后,机械臂还要连续调整力度、方向和速度。整个过程没有暂停键,也不会等摄像头拍完「下一帧」再继续。但许多视觉世界模型认识时间的方式,恰恰来自这些被摄像头截取的画面。它们看到第1帧、第2帧、第3帧,并学习如何从一张图跳到下一张图。至于两帧之间发生了什么、换一种帧率后该如何预测,甚至某个关键瞬间缺失后如何还原,模型通常没有一条可以直接查询的连续轨迹。
问题也由此变得具体:如果机器人对世界的理解只存在于一格格画面里,它要怎样抓住发生在两帧之间的那一瞬间?清华大学智能产业研究院(AIR)与UC Berkeley BAIR的研究团队提出了ODEWorld——全球首个连续时间具身世界模型。它不再只问「下一帧是什么」,而是直接学习世界在每个时刻朝什么方向、以多快的速度变化,并由此还原一条随真实物理时间连续演化的潜空间轨迹。
02.
Fast-LeWM: 世界模型新接口—动作前缀预测,rollout速度提升四倍,cem时间减半,同时大幅提升成功率。
现有Latent world model默认采用单步潜空间转移:训练只监督相邻状态,更多拟合局部一步变化,难以直接学习动作累积下的多步状态演化规律,并且rollout速度慢且误差会随时域累积。然而人类在想象未来时往往不是单步想象,而是可以直接想象不同horizon的最终结果,因此我们提出 Fast-LeWM,以 action prefix 为建模单位,从当前视觉 latent 出发,对不同长度的动作前缀进行监督,并行预测多个未来状态,从而直接学习动作累积效应与状态演化,同时避免逐步生成中间状态。
对比近期Latent world model中的LeWM,相同设置下Fast-LeWM动态模块耗时由 31.4s 降至 8.0s,CEM 规划时间降低 48%,平均成功率由 85.8% 提升至 90.5%,实现更快、更稳定的未来想象与规划。Fast LeWorldModel已全面开源,欢迎使用与复现。
03.
QQWorld:仅需10行代码,
世界模型成功率提升5.33个百分点
当个别潜变量样本落入分布尾部时,LeWorldModel 使用的 EP 正则对这些样本产生的梯度会迅速衰减。QQWorld 为此引入分位数—分位数匹配,将投影后的潜变量排序,并与标准高斯分布中相应的分位点逐一对齐,使尾部样本仍能获得有效的优化信号。
其核心代码不足 10 行,在四个控制环境中将平均规划成功率从 79.75% 提升至 85.08%,提高 5.33 个百分点。此外,Cross-Batch QQ 将历史批次的投影结果一同用于排序,在训练批次大小降至原来的四分之一、显存占用降低约 73% 的情况下,平均规划成功率仍达 83.50%,高于 LeWM 基线。
04.
让JEPA真正落地的重要拼图,
INTACT,the SOTA in JEPAs
INTACT 是一个面向目标条件机器人控制的端到端统一 JEPA,补上了传统潜在世界模型从“动作到结果”之外缺失的另一半:从意图到动作。传统 LeWM 虽然能够预测执行动作后环境如何变化,但在控制时仍需通过 CEM 搜索大量动作序列;INTACT 则从无奖励、带动作标注的轨迹中,同时学习真实状态变化对应的局部意图,以及未来目标对应的可部署意图,并通过同一个条件动作分布建立二者与动作之间的对应关系。
由此,世界模型可以根据当前视觉状态和目标图像直接产生动作,无需在测试时进行大规模搜索。实验中,INTACT 仅训练 1 个 full-data epoch,便在四项 LeWM 任务上取得 95.33% Direct Macro SR,实现 0 条候选序列搜索和 2.9–5.5 ms推理延迟,相比规划式控制将延迟降低约 300 倍;同时,它还支持一个视觉编码器联合学习四个不同控制任务。
INTACT 的训练、评测与复现代码现已全面开源,欢迎大家使用、复现、提交 Issue 或 PR,也欢迎加入 World Model Community 共同交流。

本次分享发起人:
赵昊,清华大学智能产业研究院助理教授,于清华大学电子工程系获得学士和博士学位,曾任英特尔中国研究院研究员,并于北京大学开展博士后研究工作。曾任清华大学“天空工场”理事长,负责该校规模最大的机器人学生组织之一。
赵昊博士的主要研究方向为机器人相关计算机视觉,重点关注三维场景理解、神经渲染、自动驾驶仿真与世界模型等领域。他在计算机视觉、机器人与人工智能领域的重要国际会议及期刊上发表研究论文70余篇,包括 CVPR、ICCV、ECCV、SIGGRAPH、NeurIPS、ICLR、RSS、CoRL 等国际会议,以及 IEEE TPAMI、IJCV、RA-L 等学术期刊。
其研究成果曾获得多项国际算法挑战赛冠军,并主导研发了全球首个开源模块化真实感自动驾驶仿真器 MARS,该工作获得 CICAI 2023 Best Paper Runner-up 奖项。其提出的可调节渲染精度与速度的神经渲染方法 SlimmeRF 获得 3DV 2024 Best Paper 奖项。此外,相关研究成果还获得 CVPR 2026 Best Student Paper、ICRA 2026 Best Paper Finalist、RSS 2026 Best Paper Finalist 等学术荣誉。

更多精彩回顾
🚀 直播精华看不够?完整版深度内容已独家上线知识星球「」!涵盖所有技术细节、QA及未公开彩蛋。深度解析!
干货满满,快来加入