从预测未来到评价后果,ActEffect 给世界模型换了个位置

具身智能之心 2026-08-27 11:00

点击下方卡片,关注“具身智能之心”公众号


机器人伸手抓杯子时,向右多走3厘米,会发生什么?

可能稳稳抓住杯沿,也可能把杯子直接碰倒。

对人来说,这两种结果差别很大。

但对许多以模仿学习为主的机器人策略来说,它们最先学习的往往是另一件事:专家在这个状态下向右移动了3厘米,那我也预测一个尽可能接近的动作。

这正是VLA的优势,也是它没完全解决的问题。动作预测得像,不代表任务结果一定对。

尤其在接触丰富的操作任务里,位置差几毫米、夹爪早闭合一点、接触力度大一些,都可能把任务带向完全不同的结果。

许多VLA接受动作层面的模仿监督,模型知道专家“怎么做”,却很少被单独追问:“你提出的动作,会把世界变成什么样?”

WAM试图解决这个问题。

把未来视觉状态纳入机器人学习,让模型在输出动作前,先预测场景接下来会怎样变化。视频模型在大量视频中见过物体运动、接触和场景演化,用这些知识辅助机器人理解物理世界,逻辑上似乎很顺。

然而,但凡真正考虑过真机部署的人,也会立刻碰到下一个问题:生成未来,很贵。

未来视频的迭代去噪、世界模型rollout和候选动作比较,都会带来额外延迟。

机器人控制又是一个持续闭环的过程,视频模型多算一轮,机械臂可能已经错过了接触窗口。

因此,过去半年里WAM的讨论已经开始发生变化。

Fast-WAM保留训练阶段的视频联合建模,却在测试阶段跳过未来预测,论文里的推理延迟为190ms,较显式想象路线快4倍以上。GigaWorld-Policy把动作解码放到中心位置,让未来视频生成在部署时成为可选项。VLA-JEPA和LaWAM则进一步转向潜在空间,试图绕开像素级未来生成的成本。

行业一直在把WAM推向可用,但当下痛点也很清晰:

机器人需要理解动作后果,但真机控制又等不起世界模型慢慢“想象”。

近日,光象科技联合清华大学李升波教授课题组发布了第一代物理原生世界模型,即Phi-WM 1.0 ActEffect,简称ActEffect,给出了一个不同的答案。

不是VLA,也不是WAM,叫物理原生世界模型Phi-WM。

从预测未来到评价后果,ActEffect 给世界模型换了个位置图1

它是一种“动作优先”的机器人模型:策略先提出动作,受控世界模型再预测这些动作会产生什么后果,并用后果反馈引导动作逐步修正。

更关键的是,世界模型只在训练阶段出现。

机器人真正部署时,不需要继续预测未来,也不需要在线比较不同候选动作。

把世界模型留在训练场,策略自己上岗。


01

路线之争!

先动作生成  or  先预测未来?


VLA和WAM看起来像两条路线,背后对应的是两种不同的建模顺序。

一种是先预测未来,再生成动作。这是许多WAM采用的foresight路线。

另一种是先生成动作,再预测动作后果(不过VLA就没这个能力了)。

策略根据当前任务提出一份动作,世界模型随后判断:如果机器人真这样做,场景会发生什么变化?这个预测结果继续反过来修正策略。

ActEffect就是后者,它的出发点很简单:

模型能否预测策略自身动作提案的后果,再用这种反馈把动作改得更好?

这里的区别不只是先后顺序。未来预测主要服务于动作生成,为策略提供一段“预告片”;在ActEffect里,未来预测变成了训练信号,负责评价策略已经提出的动作。

所以你看,就像驾校的教练一样。你先打一把方向,教练马上告诉你:沿着这个方向继续走,车会停在线内,还是会压到路沿。

直接看论文报告的结果:ActEffect在LIBERO上的平均成功率达到98.8%,在LIBERO-PLUS上达到80.3%,在RoboCasa-GR1上达到67.5%。

但这篇工作的重点,并不是是多拿了几个百分点。它改变了世界模型在机器人策略中的位置。


02

预测出的动作,

如何作用于最终action?


ActEffect并没有搭建一套特别庞杂的系统。

策略侧使用Qwen3-VL 4B作为与任务目标强关联的视觉语言骨干,连接DiT动作头;动作生成采用Minimal Iterative Policy,也就是MIP。世界模型侧则是一个4层、隐藏维度为768的轻量Transformer,在冻结的DINOv3潜在空间中预测与任务目标无关的状态转移。

结构里面比较关键的,是它怎样把“动作后果”变成可以训练策略的反馈。

从预测未来到评价后果,ActEffect 给世界模型换了个位置图2


1

用“后果排序”教策略改动作


ActEffect从同一个当前状态出发,产生三份完整的动作提案:由视觉语言表征直接输出的前馈动作、MIP生成的粗粒度动作、在粗粒度动作基础上进一步修正的精修动作。

可以把它理解成机器人同时交了三份质量不同的答案。

随后,同一个受控世界模型分别接收这三份动作,预测每份动作执行后会产生什么未来,再把预测未来与专家示范中真正出现的未来进行比较。

训练目标比较简单:精修动作对应的未来,要比粗粒度动作更接近专家未来;粗粒度动作又要优于前馈动作。

这里解决了机器人学习中一个很现实的问题。

在真实物理世界里,同一个状态只能执行一次动作。机器人选择从左边抓杯子,杯子的位置就已经发生变化;我们无法回到完全相同的状态,再让它从右边抓一次。

世界模型提供了一个共享的“假想试验场”。

三份动作从同一个状态出发,现实里只有一份会被执行,模型里却可以预测并比较三种后果。

论文里将其称为counterfactual consequence ranking,也就是反事实后果排序。

为了避免模型走捷径,ActEffect还停止了参考差异的梯度传播。否则,排序目标可能通过“让较差的动作变得更差”来得到满足。停止这部分梯度后,训练会更多地推动后续动作靠近专家未来。

说白了,ActEffect希望教会策略一件事:

每次改动作,都要让结果更好。


2

为什么要把“懂任务”和“看后果”拆开?


ActEffect还有一个很关键的设计:它没有直接在VLM的表征空间中评价动作后果。

语言和任务语义留在Qwen3-VL这里,负责理解“用户想让机器人做什么”;动作后果则放到冻结的DINOv3视觉空间中判断。

受控世界模型只接收当前视觉状态和候选动作,不接收语言指令。

为什么要这样做?我们来举个例子。

假设任务指令是“把杯子放进篮子”。

VLM很清楚任务目标,因此很容易生成或偏向“杯子已经进入篮子”的理想未来。这个未来在语义上完全正确,却未必是当前候选动作真正造成的结果。机器人可能夹偏了,也可能在移动过程中把杯子碰倒。

语言告诉机器人目标在哪里,物理世界决定这个动作会产生什么结果。

DINOv3潜在空间则相对比较冷静。它不负责理解任务说得多漂亮,主要比较动作前后的视觉状态是否真正对应。


3

真的有效吗?看下实验结果


PHI-WM 1.0的消融实验也支持这一设计。

从预测未来到评价后果,ActEffect 给世界模型换了个位置图3

完整模型在LIBERO上的平均成功率为98.8%;把后果空间从DINO换成VLM表征后,成功率下降到97.3%。完全移除后果反馈,结果进一步降至97.0%;保留后果预测、移除反事实排序,成功率为98.1%。

这说明,后果监督本身有效;把任务语义和物理后果拆开,也确实带来了额外增益。

ActEffect在三个仿真基准上都进行了评估。

在LIBERO上,ActEffect取得98.8%的平均成功率,超过DiT4DiT和LaWAM的98.6%,排名第一。

从预测未来到评价后果,ActEffect 给世界模型换了个位置图4

LIBERO-PLUS考察的是更接近真实泛化的问题:相机位置改变、机器人初始状态变化、指令改写、光照、背景、传感器噪声和物体布局发生变化后,策略还能不能工作。

从预测未来到评价后果,ActEffect 给世界模型换了个位置图5

ActEffect的平均成功率为80.3%,明显高于Fast-WAM的51.5%。

RoboCasa-GR1的结果也值得参考。

从预测未来到评价后果,ActEffect 给世界模型换了个位置图6

这个基准使用Fourier GR-1人形机器人,包含两条7自由度手臂、两只6自由度灵巧手和3自由度腰部,动作空间达到29维。ActEffect在24个家庭桌面任务上取得67.5%的平均成功率,比Fast-WAM的56.7%高出10.8个百分点,比DiT4DiT的50.8%高出16.7个百分点。

从单臂桌面操作走向高维双臂人形,后果反馈仍然有效。


03

ActEffect在解决什么问题?


写到这里,我们就很清晰地了解了ActEffect在解决哪些问题。


1

世界模型开始从“生成器”变成“评审器”


之前谈世界模型,大家首先想到的是生成未来:输入当前画面和动作,让模型预测接下来几秒会发生什么。

ActEffect给世界模型重新设定了一个角色。

训练时,它负责评价不同动作会带来怎样的后果;部署时,只留下被它训练过的动作策略。世界模型不必跟着机器人进入实时控制回路。

这一定程度上意味着VLA和WAM之间的边界正在变薄。

最终上线的仍然可以是一套直接输出动作的策略,但它的训练信号已经不再只有action label,还包括未来状态、动作后果,以及不同动作提案之间的相对优劣。


2

数据里的“下一帧”,可能比想象中更值钱


具身数据团队过去最关心的,往往是动作标注是否准确:关节角、末端位姿、夹爪状态有没有对齐。

ActEffect提醒了另一件事。

一条遥操作轨迹天然包含“动作之后发生了什么”。这些未来画面本来就跟在动作后面,可以直接成为后果监督,不需要再人工补充一整套奖励标签。

这让同一条机器人数据多了一层价值。

它既可以教策略模仿专家动作,也可以教世界模型判断动作会把场景带向哪里。

但只有成功示范还不够。

ActEffect用专家未来作为目标,学习哪一份动作更接近成功轨迹。如果训练数据中缺少碰撞、打滑、抓空、恢复和重试,模型能够认识的后果依然很窄。

对正在建设数据闭环的团队来说,下一步很自然:把失败与恢复数据也放进后果空间。让模型既知道错误怎样发生,也知道出错以后还有哪些路径能够走回来。


3

部署效率,这次有保障了


这里的保障,首先来自架构选择。

ActEffect在推理阶段会移除受控世界模型和未来观测分支,不需要进行world-model rollout,也不用在线生成并比较多个候选未来。

策略直接产生精修动作。

对实时操作任务来说,这一点很重要。

机器人控制需要持续闭环。尤其在抓取、插拔和工具操作中,接触窗口往往很短。少一次视频生成和候选搜索,就少一部分推理等待。

ActEffect部署时仅保留策略的前向推理过程,整套部署策略的参数量约为4.6B。


04

写在最后


从 Phi-WM 这套思路看,世界模型的价值不只在于“预测得像不像”,更在于这些预测能否真正改善机器人的动作。

ActEffect做了一次很有意思的位置调整:训练时,让世界模型充当“评审器”,提前判断不同动作可能带来的后果;部署时,再把这套判断沉淀进策略,让机器人不必一边干活、一边等待未来视频生成,成本一下子降了好多。

这也给具身提供了更务实的路径:把世界模型对物理规律的理解,直接变成策略学习的监督信号。并从预测未来,走向影响行动。

从预测未来到评价后果,ActEffect 给世界模型换了个位置图7


END

 推荐阅读 :

从预测未来到评价后果,ActEffect 给世界模型换了个位置图8


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
兆驰、凯格精机两大LED显示相关项目签约
又一Micro LED企业获融资
又一豪华新能源车预售,Mini LED 供应链披露
小米入局,RGB Mini LED电视阵容+1
1.48亿,一LED上市企业易主
抢滩AI算力与MLED双风口,兆驰7.5亿PCB项目落子南昌
Polar Light完成首批Micro LED试产
不止于显示!Micro LED光互联×AI+AR智能眼镜×玻璃基板TGV等全新赛道集结2026深圳全触与显示展
行家说观察 | LED显示产业8大关键信号
聚灿光电宣布Micro LED光互连重要落子
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号