
给机器人下达“准备一份早餐”的指令,它需要依次完成取餐盘、拿面包放入吐司机、接水、摆放水果等十多个步骤,过程中还要随时应对动作偏差、物品位移等突发情况。过往主流的视觉-语言-动作(VLA)模型在处理这类长时序复杂任务时,常常出现记忆缺失、泛化性不足、动作精度不达标的问题,背后的核心原因是这类模型大多采用直接从观测映射到动作的反应式范式,没有显式建模环境的演化规律。——而LingBot‑VA早已给出另一种答案。
这篇被机器人顶会RSS 2026接收的工作,选择让机器人先预测环境如何演化,再决定如何行动,为解决上述问题提供了新的技术方案。

论文标题:Causal World Modeling for Robot Control
论文链接:https://arxiv.org/pdf/2601.21998
项目主页:https://technology.robbyant.com/lingbot-va
开源仓库:https://github.com/robbyant/lingbot-va
模型权重:https://huggingface.co/robbyant/lingbot-va
研究背景
近年来VLA模型已经成为通用机器人操作领域的主流范式,能够将语言指令落地为不同场景下的操作动作,但其技术路径本身存在明显的瓶颈。现有VLA模型大多采用前馈架构,直接将当前观测映射为动作序列,单个网络需要同时完成视觉场景理解、物理动力学学习、电机控制策略学习三类任务,从统一的监督信号中压缩异质知识,很容易出现表征纠缠的问题,最终导致样本效率低下、泛化能力有限。这类反应式策略本质上依赖模式匹配,没有对环境演化规律做显式建模,无法形成对物理动力学的结构化认知,面对复杂任务时容易出现偏差。
此前也有不少研究尝试将世界模型引入机器人策略中,包括交互式神经模拟器、基于块的视频动作扩散模型、用于子目标生成的离线视频生成器等,但这类方案在实际闭环控制中仍然存在三类局限:一是反应性不足,开环生成长序列时无法纳入实时反馈,难以应对环境扰动;二是长时序记忆能力有限,按块生成的模式不会持久缓存历史信息,长序列执行过程中容易出现不一致的问题;三是不符合因果性,块内的双向注意力机制允许未来词元影响过去的预测,和物理世界中当前状态仅由过去决定的因果规律相悖。这些问题都限制了世界模型在真实机器人控制场景中的落地。
核心设计思路
针对上述问题,研究团队提出了LingBot-VA自回归扩散世界模型,通过统一的视频-动作框架解决现有方案的不足。和常规自回归大语言模型预测离散词元不同,LingBot-VA基于流匹配在连续潜空间中工作,通过迭代去噪自回归生成视频块和动作表征,核心是将视频词元和动作词元穿插到同一个自回归序列中,采用混合Transformer(MoT)架构做联合处理,两个模态共享注意力机制。

这种统一的自回归生成流程中,视觉想象和动作推理是同步进行的:每一个自回归步骤里,模型通过迭代去噪生成预测的未来视觉状态,同时解码对应的动作,两个流可以互相作为条件。这种设计带来了三个明显的优势:首先是具备反应式自回归循环,视频和动作词元组成统一序列,每一步都可以根据最新的真实观测重新校准,及时调整预测的未来状态和电机指令;其次是通过KV缓存实现持久上下文存储,缓存的键值对保留了穿插的视频-动作轨迹信息,提供丰富的上下文减少时序漂移;最后是满足因果一致性,统一序列上的因果注意力掩码保证了预测的视觉状态和动作指令都仅由前面的状态决定,符合物理世界的时序规律,每一步都纳入真实世界观测也能缓解开环方法常见的分布漂移问题。
技术框架详解
LingBot-VA的整体框架采用双流MoT架构,分别对应视频流和动作流,其中视频流基于Wan2.2-5B大规模预训练视频生成模型初始化,动作流和视频流深度相同但宽度更小,这种不对称设计是因为动作分布本身比视觉数据简单,不需要太多参数即可有效建模,同时还能保留视觉动力学的建模能力。

考虑到视频帧存在明显的时序冗余,尤其是机器人操作场景下场景变化较慢,研究团队对视频序列做了4倍的时序下采样,减少视觉词元数量提升效率。因为动作的变化频率高于视觉变化,每一个视频帧对应4个连续动作,最终形成“视频词元+对应动作词元”的交替统一序列,实现高频率控制的同时保持视频生成的效率。
混合Transformer块的设计兼顾了模态交互和模态特有特征空间的保留,视频和动作词元在每一层分别由独立的Transformer块处理,再通过跨模态注意力融合。动作词元会先投影到视频维度参与联合自注意力,再投影回原有维度通过残差连接保留动作特有的表征,这种设计让两个模态可以通过注意力互相影响,同时保持独立的参数化,避免模态间的特征干扰。
训练阶段研究团队采用了多项优化策略保障效果和效率。首先是可变块大小训练,训练时随机从1到8的范围内采样块大小,让模型学习不同时间跨度的连贯预测,推理时可以自由选择块大小平衡计算效率和规划跨度。其次是采用教师强制策略进行统一的视频-动作训练,把穿插的视频-动作序列作为单一统一序列,用标准的下一词元预测目标训练,通过注意力掩码保证每个词元仅能访问之前的时序内容,机器人部署时自然会获取真实观测,和训练 regime 完全匹配,不会出现纯生成模型常见的训练测试分布 mismatch 问题。此外团队还引入了噪声历史增强策略,训练时随机给历史视频词元加噪,让动作解码器可以从部分带噪的视频表征中预测动作,推理时仅需要将视频词元去噪到0.5的流时间即可,直接将视频生成的去噪步数减半,同时不影响动作预测的质量。

部署阶段的异步推理管线进一步解决了延迟问题,实现计算和执行的并行:机器人执行当前动作块的同时,模型基于最新的真实观测预测下一个动作块。为了避免朴素异步实现依赖过期视觉预测导致的漂移问题,团队还引入了前向动力学模型接地步骤,用最新的反馈和执行的动作重新想象当前的视觉状态,替换掉过期的预测结果,强制模型在预测下一步之前和环境反馈重新对齐,让异步管线也能实现可靠的闭环控制。

实验效果验证
研究团队在仿真基准和真实世界场景中都对LingBot-VA做了充分验证。训练数据集聚合了6个公开来源的机器人操作数据,加上内部采集的演示数据总时长约16K小时,覆盖不同的机器人形态、环境和任务类别,预训练阶段词元总量达到1.4T。
仿真实验选择了RoboTwin 2.0和LIBERO两个主流基准,其中RoboTwin 2.0是包含50项双手机器人操作任务的基准,对双臂协同要求较高。实验结果显示,LingBot-VA在固定初始配置的Easy场景下平均成功率达到92.9%,在物体位姿和场景布局随机的Hard场景下平均成功率达到91.6%,相比此前的最优方案分别提升4.2%和4.6%,这种优势在更长时序的任务上更为明显,3步任务中相比次优方案分别提升8.2%和9.1%。

在LIBERO基准上,LingBot-VA的平均成功率达到98.5%,其中长时序任务套件的成功率达到98.5%,刷新了该基准的最优水平。

真实世界部署实验选择了三类共六项典型操作任务:长时序任务(做早餐、捡螺丝)、精度任务(插试管、拆快递)、可变形与关节物体操作(叠上衣、叠裤子),仅用50条真实世界演示做微调。结果显示LingBot-VA在所有六项任务的成功率和进度得分上均超过基线模型π0.5,尤其是拆快递、叠裤子这类对时序逻辑和精度要求较高的任务,提升幅度更为明显。


核心能力分析
除了基准性能的提升,研究团队还对LingBot-VA的三项核心能力做了验证。首先是样本效率,在低数据量下的优势尤为突出,仅用10条演示数据时,在“做早餐”任务上的进度得分比π0.5高15.6%,在RoboTwin 2.0 Easy基准上高10.3%,这是因为预训练的视频生成骨干已经包含了丰富的物理动力学和物体交互先验,微调阶段仅需要很少的数据即可让动作模块适配新任务。
其次是时序记忆能力,团队设计了两项专门需要记忆历史状态的任务:擦盘子需要准确计数擦拭6次,找盒子需要记住已经打开过的空盒子不会重复打开。实验结果显示LingBot-VA在两项任务上的成功率都显著高于基线,这得益于自回归架构的设计,训练阶段的教师强制让预测依赖完整历史,推理阶段的KV缓存自然保留了所有历史信息。
最后是泛化能力,LingBot-VA在仅用单一种类物体训练拾取任务的情况下,可以泛化到不同形状、纹理的新物体,也能适配训练中没有出现过的物体摆放位置,这是因为世界模型通过视频预测学习到了可迁移的视觉表征,掌握了和物体无关的物理先验,可以迁移到新场景中。
总结与展望
LingBot-VA作为统一视频动力学预测和动作推理的自回归扩散框架,通过混合Transformer架构穿插处理视频和动作词元,既捕捉了物理交互的因果结构,又能通过持续纳入真实观测实现闭环控制,多项实验证明该方案在仿真和真实场景下都达到了领先水平,仅需要极少的演示数据即可适配新任务。该研究也验证了视频世界建模和视觉语言预训练并列,可以成为机器人学习的独立新基础,为通用机器人操作的发展提供了新的技术路径。
未来研究团队将进一步优化视频压缩方案降低计算开销,同时纳入触觉、力、音频等多模态传感输入,提升复杂接触动力学场景下的操作可靠性。
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群