SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去

Xbotics具身智能实验室 2026-09-18 18:00

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图1

arXiv:2609.05533
Github:OpenBMB/SimpleMemVLA
HuggingFace:collections/yinchenghust/simplememvla

不增加专用记忆模块,直接把带时间戳的视觉历史作为上下文,机器人能做到什么?SimpleMemVLA 给出的答案是:在论文比较范围内,四项记忆基准上均取得 SOTA,并在不更新参数的情况下,表现出视觉上下文学习能力。它也是 MiniCPM-RobotManip 中上下文记忆和流式记忆的支撑技术

这条路线的核心很直接:让机器人结合过去发生的事情,理解眼下该做什么。被遮住的物体在哪里、某个动作已经完成几次、任务进行到了哪一步,都可以从原生视觉历史中获得依据。

为什么现在可以这样做?按论文设置,60 秒历史仅占约 5.6k token,而主干模型支持 262k token 上下文。分钟级历史已经能够直接放入模型,不必一开始就将其压缩成另一套记忆表示。

这项工作由面壁智能联合华中科技大学、中国人民大学、清华大学、北京大学、北京智源人工智能研究院和北京中关村学院共同提出。

一:原生视觉上下文,让机器人在长任务中记得更准

从遮挡、计数到长程交互,SimpleMemVLA 在四项记忆基准上取得最佳总体成绩,同时在两项通用操控评测中保持高性能。

这些任务考验的不只是机器人能否看懂当前画面,还包括它能否记住已经消失的线索、区分重复发生的事件,并持续跟踪任务进度。

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图2
图 1|四项记忆基准与两项通用操控评测。各基准分别比较;灰色条为参考结果,不参与排名。

在需要持续跟踪任务进度的长程交互中,这种记忆能力带来了明显收益。RoboMemArena 包含 26 项任务,轨迹平均超过 1,000 个控制步。使用 126 秒历史窗口时,SimpleMemVLA 的全阶段任务成功率达到 63.6%,比此前最强模型 提高 17.4 个百分点。其中,计数任务从 31.4% 提升至 71.4%,遮挡任务从 39.1% 提升至 64.3%。

优势不仅来自主干模型,也来自模型在决策时仍能直接理解原生视觉历史。

一个细节是否重要,往往要到后续任务中才知道。提前筛选、压缩或覆盖历史,可能丢掉未来需要的信息。论文将这种限制称为“写入时承诺”:在存入记忆时,就必须决定保留什么。

SimpleMemVLA 将历史视觉信息、时间顺序和时间戳保留在上下文中,让模型在理解当前任务时一并理解过去,而不是先把历史加工成固定的摘要,再据此行动。

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图3
图 2|原生视觉上下文与专用记忆机制的区别。图中对应论文测试的具体实现。

具体来说,历史画面沿用视觉语言模型预训练时的视频格式,按时间顺序组织,并附上明文时间戳;当前腕部画面则单独输入。模型据此生成一句当前子任务,例如“揭开红色积木上的盖子”。

生成这句话时形成的上下文隐藏状态,会与词元嵌入、机器人本体状态一起传给动作头,生成下一段动作。消融实验表明,历史信息主要通过这份隐藏状态影响行为,而不只是通过子任务的字面文字。

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图4
图 3|SimpleMemVLA 架构及流式推理流程。

为了区分主干能力与记忆机制的影响,研究者固定训练数据、主干模型、子任务监督、动作头和优化器,只替换记忆机制。在 RoboMME 上,结果如下:

原生上下文

88.3%
检索

31.5%
Token 压缩

22.6%
循环状态

20.6%
SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图5
图 4|相同模型与训练设置下,不同记忆机制的任务级成功率。

这组结果支持一个关键判断:在所测任务中,让模型结合当前任务理解仍然可读的历史,比提前决定哪些信息值得留下更有效。

进一步的消融说明,关键画面和时间顺序确实不可缺少。在 RMBench 的盖积木任务中,30 秒窗口仍包含约 25 秒前的遮盖过程,模型能够完成任务;窗口缩短至 15 秒、关键画面移出后,任务失败。按键计数任务也会随着历史窗口缩短而逐步退化。只保留当前画面或打乱帧顺序时,两项任务均失败。

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图6
图 5|原生上下文的消融实验。(a)(b)检验历史窗口、帧顺序与时间戳;(c)(d)检验子任务隐藏状态如何将历史信息传给动作头。

二:视觉上下文学习:不更新参数,跟随视觉上下文调整策略

SimpleMemVLA 不仅能利用过去的事件,还能根据新提供的视觉上下文调整当前行为。

研究者将另一条执行轨迹中的片段接入原有历史:换掉积木被盖住的位置,模型就转向新位置;将颜色提示从品红换成红色,模型就选择红色物体;替换演示序列的开头动作,机器人也会随之改变下一步操作。

这些拼接后的历史并未在训练中出现,推理时也没有参数更新。模型仍能从新的视觉上下文中判断任务状态,并据此行动。这就是论文观察到的视觉上下文学习能力。

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图7
图 6|遮蔽或替换历史片段,检验模型如何依据过去行动。

模型的行为变化也具有针对性:改变关键历史会影响决策,改变无关历史则不会。遮蔽积木被盖住位置的画面,会使模型选错盖子;遮蔽一次已经完成的抓取—放置事件,模型会少算一次,并追加执行。对等长度的无关片段进行遮蔽时,输出保持不变。

这些实验说明,在所测任务中,原生上下文既能承载记忆,也能让新的视觉信息直接影响模型行为。

三:流式推理优化,让分钟级记忆跟上实时控制

长历史不必意味着长时间等待。通过复用历史计算,SimpleMemVLA 将 60 秒历史的决策延迟从 1.02 秒降至 0.68 秒,低于实测任务的 0.96 秒实时预算。

这一结果来自单张 H100、bf16、batch size 为 1 的设置。实现思路也很直接:连续两次决策共享大部分历史,机器人执行当前动作时,系统提前计算下一次仍会使用的历史前缀,并保存键值缓存。到下一次决策时,再处理新增内容并生成子任务。

这套精确流式推理流程与全量重算生成相同的子任务文本,但将共享历史的计算与动作执行重叠起来,减少了决策时的等待。

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图8
图 7|共享历史的计算与动作执行重叠,缩短下一次决策的等待时间。

在更长上下文的延迟测试中,约 45 分钟历史对应 245k token,全量重算需要 32.1 秒,而流式决策路径缩短至 1.18 秒。这展示了计算复用的收益;超长上下文下,后台预填充与缓存开销仍会随历史增长。

四:真机展示

在三次不同布局的自主执行中,SimpleMemVLA 能依据遮挡前的视觉历史,按红→绿→蓝的顺序揭开盖子。

任务在真实双臂机器人上完成:机器人先用相同的黑盖遮住三块彩色积木,再按指定颜色顺序揭盖。此时当前画面已经看不到积木颜色,机器人必须根据之前的经历,判断每个盖子下是什么。

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图9

布局一:按色揭盖

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图10

布局二:按色揭盖

SimpleMemVLA:原生视觉上下文作为记忆,让机器人记住过去图11

布局三:按色揭盖

三次执行中,揭盖路径随颜色位置改变。第三段采用“中→远→近”的顺序,也说明机器人并非始终沿着固定方向扫描,而是在利用历史中的颜色与位置关系完成任务。

未来展望:从记住过去,走向从经历中学习

SimpleMemVLA 将原生上下文作为记忆,并在这一过程中涌现出视觉上下文学习能力。

下一步,我们将引入更丰富的上下文,包括人类第一视角(ego)数据、机器人示教视频和自主执行历史,充分发挥模型的上下文学习能力,探索如何让机器人从示范与过往经历中学习,并将这些经验运用到新的任务与场景。

让上下文不仅帮助机器人记住过去,也成为它学习和适应的重要来源,是我们希望继续探索的方向。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活
拟斥资23个亿!市值百亿叉车龙头,押注机器人
华为,72亿重磅机器人基地!
顾晓颖:盖世具身智能致力于做机器人产业的连接者与赋能者
新品 | 小米 18 Pro 工程机跑分曝光;Booster K1 机器人开售
当机器人不再“单打独斗”,谁来指挥千千万万台机器人?
一台人形机器人,究竟需要多少芯片?
英诺赛科 vs. 英飞凌:GaN功率半导体巨头竞逐具身智能机器人动力神经中枢
优必选“机器人伴侣”开启交付,奔驰4S店可率先体验
机器人还在等它的“ChatGPT时刻”?英伟达高管揭秘物理AI的数据困局
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号