RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制

机智流 2026-09-09 22:05

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图1

给机器人下达“准备一份早餐”的指令,它需要依次完成取餐盘、拿面包放入吐司机、接水、摆放水果等十多个步骤,过程中还要随时应对动作偏差、物品位移等突发情况。过往主流的视觉-语言-动作(VLA)模型在处理这类长时序复杂任务时,常常出现记忆缺失、泛化性不足、动作精度不达标的问题,背后的核心原因是这类模型大多采用直接从观测映射到动作的反应式范式,没有显式建模环境的演化规律。——而LingBot‑VA早已给出另一种答案。

这篇被机器人顶会RSS 2026接收的工作,选择让机器人先预测环境如何演化,再决定如何行动,为解决上述问题提供了新的技术方案。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图2

论文标题:Causal World Modeling for Robot Control

论文链接:https://arxiv.org/pdf/2601.21998

项目主页:https://technology.robbyant.com/lingbot-va

开源仓库:https://github.com/robbyant/lingbot-va

模型权重:https://huggingface.co/robbyant/lingbot-va

研究背景

近年来VLA模型已经成为通用机器人操作领域的主流范式,能够将语言指令落地为不同场景下的操作动作,但其技术路径本身存在明显的瓶颈。现有VLA模型大多采用前馈架构,直接将当前观测映射为动作序列,单个网络需要同时完成视觉场景理解、物理动力学学习、电机控制策略学习三类任务,从统一的监督信号中压缩异质知识,很容易出现表征纠缠的问题,最终导致样本效率低下、泛化能力有限。这类反应式策略本质上依赖模式匹配,没有对环境演化规律做显式建模,无法形成对物理动力学的结构化认知,面对复杂任务时容易出现偏差。

此前也有不少研究尝试将世界模型引入机器人策略中,包括交互式神经模拟器、基于块的视频动作扩散模型、用于子目标生成的离线视频生成器等,但这类方案在实际闭环控制中仍然存在三类局限:一是反应性不足,开环生成长序列时无法纳入实时反馈,难以应对环境扰动;二是长时序记忆能力有限,按块生成的模式不会持久缓存历史信息,长序列执行过程中容易出现不一致的问题;三是不符合因果性,块内的双向注意力机制允许未来词元影响过去的预测,和物理世界中当前状态仅由过去决定的因果规律相悖。这些问题都限制了世界模型在真实机器人控制场景中的落地。

核心设计思路

针对上述问题,研究团队提出了LingBot-VA自回归扩散世界模型,通过统一的视频-动作框架解决现有方案的不足。和常规自回归大语言模型预测离散词元不同,LingBot-VA基于流匹配在连续潜空间中工作,通过迭代去噪自回归生成视频块和动作表征,核心是将视频词元和动作词元穿插到同一个自回归序列中,采用混合Transformer(MoT)架构做联合处理,两个模态共享注意力机制。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图3
图 1:LingBot-VA整体框架示意图,包含预训练、多场景评估、多能力支持和涌现特性四个核心模块

这种统一的自回归生成流程中,视觉想象和动作推理是同步进行的:每一个自回归步骤里,模型通过迭代去噪生成预测的未来视觉状态,同时解码对应的动作,两个流可以互相作为条件。这种设计带来了三个明显的优势:首先是具备反应式自回归循环,视频和动作词元组成统一序列,每一步都可以根据最新的真实观测重新校准,及时调整预测的未来状态和电机指令;其次是通过KV缓存实现持久上下文存储,缓存的键值对保留了穿插的视频-动作轨迹信息,提供丰富的上下文减少时序漂移;最后是满足因果一致性,统一序列上的因果注意力掩码保证了预测的视觉状态和动作指令都仅由前面的状态决定,符合物理世界的时序规律,每一步都纳入真实世界观测也能缓解开环方法常见的分布漂移问题。

技术框架详解

LingBot-VA的整体框架采用双流MoT架构,分别对应视频流和动作流,其中视频流基于Wan2.2-5B大规模预训练视频生成模型初始化,动作流和视频流深度相同但宽度更小,这种不对称设计是因为动作分布本身比视觉数据简单,不需要太多参数即可有效建模,同时还能保留视觉动力学的建模能力。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图4
图 2:LingBot-VA框架总览,采用双流混合Transformer(MoT)架构,将视频和动作token穿插在同一序列中联合处理

考虑到视频帧存在明显的时序冗余,尤其是机器人操作场景下场景变化较慢,研究团队对视频序列做了4倍的时序下采样,减少视觉词元数量提升效率。因为动作的变化频率高于视觉变化,每一个视频帧对应4个连续动作,最终形成“视频词元+对应动作词元”的交替统一序列,实现高频率控制的同时保持视频生成的效率。

混合Transformer块的设计兼顾了模态交互和模态特有特征空间的保留,视频和动作词元在每一层分别由独立的Transformer块处理,再通过跨模态注意力融合。动作词元会先投影到视频维度参与联合自注意力,再投影回原有维度通过残差连接保留动作特有的表征,这种设计让两个模态可以通过注意力互相影响,同时保持独立的参数化,避免模态间的特征干扰。

训练阶段研究团队采用了多项优化策略保障效果和效率。首先是可变块大小训练,训练时随机从1到8的范围内采样块大小,让模型学习不同时间跨度的连贯预测,推理时可以自由选择块大小平衡计算效率和规划跨度。其次是采用教师强制策略进行统一的视频-动作训练,把穿插的视频-动作序列作为单一统一序列,用标准的下一词元预测目标训练,通过注意力掩码保证每个词元仅能访问之前的时序内容,机器人部署时自然会获取真实观测,和训练 regime 完全匹配,不会出现纯生成模型常见的训练测试分布 mismatch 问题。此外团队还引入了噪声历史增强策略,训练时随机给历史视频词元加噪,让动作解码器可以从部分带噪的视频表征中预测动作,推理时仅需要将视频词元去噪到0.5的流时间即可,直接将视频生成的去噪步数减半,同时不影响动作预测的质量。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图5
图 3:教师强制训练的因果注意力掩码示意图,每个token仅能访问时序上早于自身的历史token,保障因果一致性

部署阶段的异步推理管线进一步解决了延迟问题,实现计算和执行的并行:机器人执行当前动作块的同时,模型基于最新的真实观测预测下一个动作块。为了避免朴素异步实现依赖过期视觉预测导致的漂移问题,团队还引入了前向动力学模型接地步骤,用最新的反馈和执行的动作重新想象当前的视觉状态,替换掉过期的预测结果,强制模型在预测下一步之前和环境反馈重新对齐,让异步管线也能实现可靠的闭环控制。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图6
图 4:异步推理管线设计对比,传统同步管线存在计算阻塞延迟,优化后的异步管线通过前向动力学预测对齐真实观测,实现计算与执行并行

实验效果验证

研究团队在仿真基准和真实世界场景中都对LingBot-VA做了充分验证。训练数据集聚合了6个公开来源的机器人操作数据,加上内部采集的演示数据总时长约16K小时,覆盖不同的机器人形态、环境和任务类别,预训练阶段词元总量达到1.4T。

仿真实验选择了RoboTwin 2.0和LIBERO两个主流基准,其中RoboTwin 2.0是包含50项双手机器人操作任务的基准,对双臂协同要求较高。实验结果显示,LingBot-VA在固定初始配置的Easy场景下平均成功率达到92.9%,在物体位姿和场景布局随机的Hard场景下平均成功率达到91.6%,相比此前的最优方案分别提升4.2%和4.6%,这种优势在更长时序的任务上更为明显,3步任务中相比次优方案分别提升8.2%和9.1%。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图7

在LIBERO基准上,LingBot-VA的平均成功率达到98.5%,其中长时序任务套件的成功率达到98.5%,刷新了该基准的最优水平。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图8

真实世界部署实验选择了三类共六项典型操作任务:长时序任务(做早餐、捡螺丝)、精度任务(插试管、拆快递)、可变形与关节物体操作(叠上衣、叠裤子),仅用50条真实世界演示做微调。结果显示LingBot-VA在所有六项任务的成功率和进度得分上均超过基线模型π0.5,尤其是拆快递、叠裤子这类对时序逻辑和精度要求较高的任务,提升幅度更为明显。

RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图9
图 5:真实世界部署实验结果,LingBot-VA在长时序、精度任务、可变形物体操作三类共六项任务上的成功率和进度得分均达到最优水平
RSS26|先预测,再行动:LingBot-VA 的因果世界模型与机器人控制图10
图 6:六项真实世界任务的详细执行流程与关键步骤示意

核心能力分析

除了基准性能的提升,研究团队还对LingBot-VA的三项核心能力做了验证。首先是样本效率,在低数据量下的优势尤为突出,仅用10条演示数据时,在“做早餐”任务上的进度得分比π0.5高15.6%,在RoboTwin 2.0 Easy基准上高10.3%,这是因为预训练的视频生成骨干已经包含了丰富的物理动力学和物体交互先验,微调阶段仅需要很少的数据即可让动作模块适配新任务。

其次是时序记忆能力,团队设计了两项专门需要记忆历史状态的任务:擦盘子需要准确计数擦拭6次,找盒子需要记住已经打开过的空盒子不会重复打开。实验结果显示LingBot-VA在两项任务上的成功率都显著高于基线,这得益于自回归架构的设计,训练阶段的教师强制让预测依赖完整历史,推理阶段的KV缓存自然保留了所有历史信息。

最后是泛化能力,LingBot-VA在仅用单一种类物体训练拾取任务的情况下,可以泛化到不同形状、纹理的新物体,也能适配训练中没有出现过的物体摆放位置,这是因为世界模型通过视频预测学习到了可迁移的视觉表征,掌握了和物体无关的物理先验,可以迁移到新场景中。

总结与展望

LingBot-VA作为统一视频动力学预测和动作推理的自回归扩散框架,通过混合Transformer架构穿插处理视频和动作词元,既捕捉了物理交互的因果结构,又能通过持续纳入真实观测实现闭环控制,多项实验证明该方案在仿真和真实场景下都达到了领先水平,仅需要极少的演示数据即可适配新任务。该研究也验证了视频世界建模和视觉语言预训练并列,可以成为机器人学习的独立新基础,为通用机器人操作的发展提供了新的技术路径。

未来研究团队将进一步优化视频压缩方案降低计算开销,同时纳入触觉、力、音频等多模态传感输入,提升复杂接触动力学场景下的操作可靠性。


> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式
最大涨幅约176%!港股“全场景商用服务机器人第一股”  来了
第一台机器人下产线,小鹏人形机器人生产线启用
清华博士做具身大脑拿下9轮融资,他说机器人行业不存在所谓ChatGPT时刻丨36氪专访
60分靠数据,100分靠自进化:清华曹婷和「域变换」攻向机器人可部署
人形机器人新品井喷背后:同质化内卷与量产鸿沟并存
利润增速是营收增速的14倍,这家机器人公司做对了什么?
机器人开源项目清单:GitHub上这些项目,硬件工程师值得收藏
三星电子冲刺2027 CES首秀,人形机器人“软硬一体”加速商业化进程
“协作机器人第一股” 越疆科技中报:营收翻倍,亏损扩大,具身智能业务暴涨20倍
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号