流式推理优化,让机器人决策延迟低至0.68秒

量子位 2026-09-18 14:06
SimpleMemVLA 团队 投稿 
量子位 | 公众号 QbitAI
流式推理优化,让机器人决策延迟低至0.68秒图1

不增加专用记忆模块,直接把带时间戳的视觉历史作为上下文,机器人能做到什么?

SimpleMemVLA给出的答案是:在论文比较范围内,四项记忆基准的总体成绩达到SOTA,并在不更新参数的情况下,表现出视觉上下文学习能力。它也是MiniCPM-RobotManip中上下文记忆和流式记忆的支撑技术。

这条路线的核心很直接:让机器人结合过去发生的事情,理解眼下该做什么。被遮住的物体在哪里、某个动作已经完成几次、任务进行到了哪一步,都可以从原生视觉历史中获得依据。

为什么现在可以这样做?按论文设置,60秒历史仅占约5.6k token,而主干模型支持262k token上下文。分钟级历史已经能够直接放入模型,不必一开始就将其压缩成另一套记忆表示。

该工作由面壁智能联合华中科技大学、中国人民大学、清华大学、北京大学、北京智源人工智能研究院和北京中关村学院共同提出。

原生视觉上下文,让机器人在长任务中记得更准

从遮挡、计数到长程交互,SimpleMemVLA在四项记忆基准上取得最佳总体成绩,同时在两项通用操控评测中保持高性能。

这些任务考验的不只是机器人能否看懂当前画面,还包括它能否记住已经消失的线索、区分重复发生的事件,并持续跟踪任务进度。

流式推理优化,让机器人决策延迟低至0.68秒图2
四项记忆基准与两项通用操控评测。各基准分别比较;灰色条为参考结果,不参与排名。

在需要持续跟踪任务进度的长程交互中,这种记忆能力带来了明显收益。RoboMemArena包含26项任务,轨迹平均超过1000个控制步。使用126秒历史窗口时,SimpleMemVLA的全阶段任务成功率达到63.6%,比此前最强模型提高17.4个百分点。其中,计数任务从31.4%提升至71.4%,遮挡任务从39.1%提升至64.3%。

优势不仅来自主干模型,也来自模型在决策时仍能直接理解原生视觉历史。

一个细节是否重要,往往要到后续任务中才知道。提前筛选、压缩或覆盖历史,可能丢掉未来需要的信息。论文将这种限制称为“写入时承诺”:在存入记忆时,就必须决定保留什么。

SimpleMemVLA将历史视觉信息、时间顺序和时间戳保留在上下文中,让模型在理解当前任务时一并理解过去,而不是先把历史加工成固定的摘要,再据此行动。

流式推理优化,让机器人决策延迟低至0.68秒图3
原生视觉上下文与专用记忆机制的区别。图中对应论文测试的具体实现。

具体来说,历史画面沿用视觉语言模型预训练时的视频格式,按时间顺序组织,并附上明文时间戳;当前腕部画面则单独输入。模型据此生成一句当前子任务,例如“揭开红色积木上的盖子”。

生成这句话时形成的上下文隐藏状态,会与词元嵌入、机器人本体状态一起传给动作头,生成下一段动作。消融实验表明,历史信息主要通过这份隐藏状态影响行为,而不只是通过子任务的字面文字。

流式推理优化,让机器人决策延迟低至0.68秒图4
SimpleMemVLA架构及流式推理流程。

为了区分主干能力与记忆机制的影响,研究者固定训练数据、主干模型、子任务监督、动作头和优化器,只替换记忆机制。在RoboMME上,结果如下:

流式推理优化,让机器人决策延迟低至0.68秒图5
流式推理优化,让机器人决策延迟低至0.68秒图6
相同模型与训练设置下,不同记忆机制的任务级成功率。

这组结果支持一个关键判断:在所测任务中,让模型结合当前任务理解仍然可读的历史,比提前决定哪些信息值得留下更有效。

进一步的消融说明,关键画面和时间顺序确实不可缺少。在RMBench的盖积木任务中,30秒窗口仍包含约25秒前的遮盖过程,模型能够完成任务;窗口缩短至15秒、关键画面移出后,任务失败。按键计数任务也会随着历史窗口缩短而逐步退化。只保留当前画面或打乱帧顺序时,两项任务均失败。

流式推理优化,让机器人决策延迟低至0.68秒图7
原生上下文的消融实验。(a)(b)检验历史窗口、帧顺序与时间戳;(c)(d)检验子任务隐藏状态如何将历史信息传给动作头。

视觉上下文学习:不更新参数,跟随视觉上下文调整策略

SimpleMemVLA不仅能利用过去的事件,还能根据新提供的视觉上下文调整当前行为。

研究者将另一条执行轨迹中的片段接入原有历史:换掉积木被盖住的位置,模型就转向新位置;将颜色提示从品红换成红色,模型就选择红色物体;替换演示序列的开头动作,机器人也会随之改变下一步操作。

这些拼接后的历史并未在训练中出现,推理时也没有参数更新。模型仍能从新的视觉上下文中判断任务状态,并据此行动。这就是论文观察到的视觉上下文学习能力。

流式推理优化,让机器人决策延迟低至0.68秒图8
遮蔽或替换历史片段,检验模型如何依据过去行动。

模型的行为变化也具有针对性:改变关键历史会影响决策,改变无关历史则不会。遮蔽积木被盖住位置的画面,会使模型选错盖子;遮蔽一次已经完成的抓取—放置事件,模型会少算一次,并追加执行。对等长度的无关片段进行遮蔽时,输出保持不变。

这些实验说明,在所测任务中,原生上下文既能承载记忆,也能让新的视觉信息直接影响模型行为。

流式推理优化,让分钟级记忆跟上实时控制

长历史不必意味着长时间等待。通过复用历史计算,SimpleMemVLA将60秒历史的决策延迟从1.02秒降至0.68秒,低于实测任务的0.96秒实时预算。

这一结果来自单张H100、bf16、batch size为1的设置。实现思路也很直接:连续两次决策共享大部分历史,机器人执行当前动作时,系统提前计算下一次仍会使用的历史前缀,并保存键值缓存。到下一次决策时,再处理新增内容并生成子任务。

这套精确流式推理流程与全量重算生成相同的子任务文本,但将共享历史的计算与动作执行重叠起来,减少了决策时的等待。

流式推理优化,让机器人决策延迟低至0.68秒图9
共享历史的计算与动作执行重叠,缩短下一次决策的等待时间。

在更长上下文的延迟测试中,约45分钟历史对应245k token,全量重算需要32.1秒,而流式决策路径缩短至1.18秒。这展示了计算复用的收益;超长上下文下,后台预填充与缓存开销仍会随历史增长。

真机展示

在三次不同布局的自主执行中,SimpleMemVLA能依据遮挡前的视觉历史,按红→绿→蓝的顺序揭开盖子。

任务在真实双臂机器人上完成:机器人先用相同的黑盖遮住三块彩色积木,再按指定颜色顺序揭盖。此时当前画面已经看不到积木颜色,机器人必须根据之前的经历,判断每个盖子下是什么。

流式推理优化,让机器人决策延迟低至0.68秒图10

流式推理优化,让机器人决策延迟低至0.68秒图11

三次执行中,揭盖路径随颜色位置改变。第三段采用“中→远→近”的顺序,也说明机器人并非始终沿着固定方向扫描,而是在利用历史中的颜色与位置关系完成任务。

未来展望:从记住过去,走向从经历中学习

SimpleMemVLA将原生上下文作为记忆,并在这一过程中涌现出视觉上下文学习能力。

未来,团队将引入更丰富的上下文信息,包括人类第一视角(ego)数据、机器人示教视频和自主执行历史。充分发挥模型的上下文学习能力,让上下文不仅帮助机器人记住过去,也成为它学习和适应的重要来源。

论文:https://arxiv.org/abs/2609.05533
开源代码仓库:https://github.com/OpenBMB/SimpleMemVLA
开源模型仓库:https://huggingface.co/collections/yinchenghust/simplememvla

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
机器人的RTC时刻比iPhone更早到来?
人形机器人的量产死结,被一家车企先解开了
机器人为什么先进猪场?两次创业的她,只问:谁付钱?
募资超8亿!国内连铸龙头加码机器人
“行走外挂”爆火 四川布局外骨骼机器人赛道
深度丨国产撕开缺口,工业机器人四大“老钱家族”的壁垒生变
成都本土机器人关节厂商,完成新一轮融资!
李泽湘又押出一个机器人IPO!本末动力通过港交所聆讯
机器人还在等它的“ChatGPT时刻”?英伟达高管揭秘物理AI的数据困局
西交大成果转化团队发布模块化人形机器人 售价 9800 元起
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号