用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单

机器之心 2026-09-22 12:30
用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图1
编辑|冷猫

谁也没想到, AGI 随着 GPT-6 的到来竟然来得这么快。


GPT-6 Astra 的强大的基础通用模型能力有目共睹,大模型的 RSI 竟恐怖如斯。


几家欢喜几家愁。在此之前,谁也没有想到,这个基础模型能够在具身智能领域掀起一场巨大的浪潮。


就在 GPT-6 Astra 发布后的第二天,Robocurve 将它直接接入机器人执行任务,并惊奇的发现 GPT-6 Astra 在控制机器人方面强悍的夸张,Token 消耗也低的夸张。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图2


GPT-6 Astra 在一项机器人控制任务中的成功率达到 95%,高于 Fable 5.1 的 40%;与此同时,输出 Token 用量仅为后者的约 1/6.2,成本约为后者的 1/2.3


于是这一切开始一发不可收拾,用 GPT-6 基模控制机器人执行复杂操作的案例似雨后春笋。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图3


好了好了,这下好了。我在具身智能领域很焦虑。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图4


通用人工智能模型将接管具身智能领域的讨论越来越多,甚至大有「GPT-6 横扫具身」,具身智能将成为「这类模型的一个子领域」的趋势。


有知名具身智能企业的创始人表示,今天的具身智能还没有真正的护城河,通用模型公司在人才、算力和资金上占优,「未来一两年将是关键窗口」。Robocurve 提到,如果这一趋势持续,大语言模型最早可能在今年年底、最晚在 2029 年实现对机械臂的实时控制。


不过,亮眼的单项成绩,并不意味着基模已经能够在真实环境中安全、稳定地控制机器人。RoboDojo 团队在官方评测中指出,「Astra 在真机测试中反复发出物理上不合理或不安全的动作,部分事故甚至造成了硬件损坏。」出于安全考虑,团队提前停止测试,因此 Astra 未能完成原定包含 18 项任务的 RoboDojo-Real 评测。


这也提醒我们:基模能力的突破只是起点。如何约束动作、处理失败,让机器人安全、稳定地持续工作,仍是系统层面必须解决的问题。


基模在变强,但通用是一把双刃剑。正如打造智能体需要在基模之上构建 Harness 一样,具身智能上缺少的,是一套让经验积累、让能力持续生长的系统。我们发现了这样一个研究工作:


近日,穹彻智能发布 RoboRSI ,一个面向真实复杂场景的机器人多智能体自进化框架。 



穹彻智能试图回答的正是这个问题:当基础模型已经具备强大的理解和推理能力后,如何在系统层面构建起持续执行、诊断、修订和复用的完整闭环。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图5



多智能体自进化:为具身智能打造的 Harness


单次成功和长期稳定运行之间,隔着一整套系统级的能力。


两个核心难题:


第一,谁来处理执行过程中的各种异常? 机器人报错停止、抓取失败、位置偏移之后,需要结果检查、异常恢复、进行安全决策。这些工作过去全靠工程师手动跟进。大模型可以理解任务目标,但它不能负责现场恢复,不判断执行是否成功,也不决定下一步从哪个节点继续。


第二,历史经验如何真正实现沉淀复用? 如果每次都让 Agent 参考过去的完整执行记录,Token 消耗会持续增长,反而让模型难以聚焦。如果每次碰到局部失败就重写整套流程,系统也很难收敛。研究团队观察到一个关键现象:Coding 模型擅长处理局部细节,但在反复修改中容易偏离全局目标。缺少结构性约束的迭代,往往越改越乱。


Context 管理是新时代的代码管理。 过去,机器人系统的核心挑战是写出正确的控制代码。在 Agent 时代,代码可以由模型生成和迭代,真正的瓶颈转移到了如何管理 Agent 在持续运行中产生的海量上下文:轨迹、日志、视频、代码版本、失败记录。管理不当,系统就会在迭代中走向混乱。


穹彻智能的设计哲学由此展开,可以概括为一句话:给人和 Agent 各自提供合适的接口。


对人,提供「高层引导」(Human-Friendly Steering):无需深入底层实现,专注于目标设定、专业判断和安全边界,将日常执行交给多智能体。


对 Agent,提供「清晰结构」(Agent-Friendly Structure):通过层级化技能树,明确修改范围、成功标准和失败反馈路径,让局部修订始终围绕全局目标展开。


所以,不管基模能力再强大,也需要一个系统级的 Harness 框架,使其能够适应具身智能的需求。RoboRSI ,正是围绕这两个问题构建的具身智能版的 Harness。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图6


四个角色,一个闭环


具身的上下文可不是那么好管理的。


机器人的执行过程包含大量图像、轨迹、工具调用和失败细节,如果全部堆在一个上下文里,模型很快就会在信息膨胀和错误归因中失去方向。为此,多智能体是一个很好的解决方案。


RoboRSI 的做法是把规划、执行、诊断和修订拆分到不同的上下文中,采用 Manager、Planner、Engineer、Reviewer 四类智能体协作的架构


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图7



这四个角色围绕同一个任务和同一份执行证据接力运行,形成一个完整的「执行→诊断→修订→再执行」闭环。 关键在于,人类仍然保留着对目标、价值判断和安全边界的控制权。在真机上,人负责安全监管和方向调整;在仿真中,系统可以自动完成更多的复位和判定。


工程师的角色因此发生了根本转变:从逐行编写任务代码、跟进每一次底层执行,转向设定目标、审核结果和提供方向性指导。


TSR:给 Agent 一棵「技能树」


让机器人持续迭代,并不只是让 Agent 一遍遍尝试。最重要的是把尝试后的结果与经验沉淀下来。


穹彻智能为此提出了 TSR(Top-down Skill Refinement,自顶向下技能细化) 机制。它用一棵四层的技能树来组织机器人的全部能力:



为什么需要这样一棵树?这棵技能树的作用,是为 Coding Agent 提供结构性约束。每次修改都被限制在清晰的技能边界内,Agent 可以专注于局部实现和修订,但不会因为连续调试而偏离全局任务目标。


历史经验由此从对话记录和日志,变成了下一轮真正可调用的能力。


从「探索」到「复用」


在早期探索阶段,Agent 需要逐步观察环境、选择工具、执行动作,每一步都需要模型推理。但当某条执行路径被反复验证为稳定后,继续让 Agent 逐步调用每一个工具就成了浪费。


穹彻智能设计了一个三阶段的演进机制:从成功的调用链中提取稳定结构,把物体类别、目标区域和空间关系参数化,然后将可复用流程固化为代码技能。当类似任务再次出现时,Agent 只需选择、监控和必要时修订整条技能,重复的工具调用步骤则由代码承担。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图8


在 LIBERO 基准测试的实验中,启用代码固化(Code-on)相比未启用(Code-off)版本,回合通过率从 21.5% 提升到 29.0%,中位 Token 消耗下降 29.4%,中位 VLM 调用次数下降 27.2%,中位执行时间下降 17.0%。


Agent 的推理资源,只留给真正变化和不确定的部分。


实验验证:零样本适配与扰动鲁棒性


在仿真环境中,穹彻智能进行了更系统的定量验证。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图9


零样本任务适配。 在没有现成任务代码的情况下,系统从基础技能开始迭代。经过约一天的并行执行,LIBERO 基准上的累计任务通过率从 32/120 提升到 95/120;RoboTwin 从初始的 9/50 提升至 36/50。与仅使用 Engineer 单角色的基线相比,完整的多智能体配置(Planner + Engineer + Reviewer)在 RoboTwin 上将通过率提升了 4 倍


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图10


代码固化效果。 在 LIBERO 的 120 个任务、5 组初始布局、共 600 个 episode 实验中,启用代码固化(Code-on)相比未启用版本(Code-off):回合通过率从 21.5% 提升到 29.0%;中位 Token 消耗下降 29.4%;中位 VLM 调用次数下降 27.2%;中位执行时间下降 17.0%


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图11


扰动鲁棒性。 在 LIBERO-Plus 的 840 个扰动实例中(涵盖视觉纹理、相机视角、语言指令、光照条件、物体布局、机器人初始状态、传感器噪声七个维度),RoboRSI 通过自适应修订将通过率从 31.1% 提升至 47.4%,额外恢复了 137 个原本失败的实例。


用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单图12


解锁全场景的商业潜力


让我们回到文章开头的真机演示的视频里。


以同类任务为参照:2024 年,完成一个类似的家庭地面清理 Demo,需要两名工程师连续投入约一个月,编写约 2,000 至 3,000 行任务代码。而在 RoboRSI 的框架下,同样级别的能力构建在一天就走完了一个完整闭环


显而易见,在优秀的基模上,配合运行良好的系统框架,新场景的适配成本会被大幅压缩。


穹彻智能用 RoboRSI 给了我们一个解法。系统能够自主完成任务拆解、技能实现、执行诊断和代码修订的闭环,那么适配一个新场景的核心成本就从「工程师驻场数周」变成了「设定目标 + 系统自主迭代 + 人工审核和安全把关」。


这种变化也为家庭等高度个性化的场景打开了新的商业空间。


每个家庭的户型、家具布局和物品摆放都不同,如果每次部署都需要工程师驻场数周,服务成本就很难支撑大规模推广。穹彻智能打造的 RoboRSI 这类基于智能体的机器人系统提供了一种可能:在通用能力的基础上,通过现场反馈自主迭代,逐步学会适合这个家庭的清理路径和操作技能。家具移动、物品更换后,也有机会沿用同一套机制完成适配,减少重新开发的工作。


类似的需求也存在于布局各异的门店、办公室和小型仓储空间。缩短适配周期,意味着过去因定制成本过高而难以覆盖的分散场景,都有机会成为可服务的市场。


当然,一次实验中的「一天迭代」还不等于任意场景都能一天部署,但能够率先把新场景的适配周期和人力成本大幅压缩,那么自然,其商业价值将不可估量。


尾声:在基础模型之上


GPT-6 之后,具身智能公司该何去何从?


行业里有这样一种观点,我们深以为然。仅在语义基座上做微调改造得到的具身模型,容易遭遇 GPT-6 的降维冲击。


GPT-6 Astra 告诉我们,当模型的通用能力足够强,许多看似需要专门设计的功能会被「涌现」出来。


基模解决了「理解」的问题,但从理解到持续稳定地执行,中间还有一层系统级的能力需要构建。我们认为,这正是具身智能公司不可替代的价值之一。



而穹彻证明了,一套设计得当的自进化框架,可以让机器人在部署之后持续沉淀经验,持续进化。 当模型层的 RSI 和系统层的 RSI 最终合流,具身智能有望进入一个新的阶段:机器人不仅能完成人类教给它的任务,还能从每一次真实执行中发现人类尚未构建的解决方案。


对具身智能公司而言,下一阶段的机会,是把不断增长的模型能力,变成用户在真实世界中用得起来、用得长久的机器人能力。在这一方面,穹彻智能还将探索 RoboRSI 和不久前发布的  协同,突破机器人能力边界、走向真实应用。


强大的基础模型已经到来,具身智能行业需要改变与破局的关键节点也已迫在眉睫。


「Welcome to the AGI era.」


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
行业速递丨开放算力论坛举办、RISC-V新品发布、睿芯牵手启元机器人
刚刚,稚晖君同款机器人来了!发售即发货,下线一台只需2.5分钟
议程公布!家用服务机器人产业生态交流会倒计时1天!
告别臃肿与干扰!ADI全新总线+驱动方案,颠覆机器人灵巧手分布式设计
小智一周要闻 | 丰田计划部署40万台机器人;零跑已做出完全自研机器人
黄仁勋回应或缴税540亿:我不怕缴税,只怕变穷;马斯克深夜放大招,新模型Grok 4.7上线;特斯拉机器人团队在长三角审厂,多家企业获订单
股价腰斩,订单爆满?宇树8月拿下具身机器人1/3招投标项目
亮源新创用互联网“家底”教机器人,与 Figure 共同印证人类行为Scaling Law
全球人形机器人去年售出约7000台,车企成早期“尝鲜”主力
告别“炫技”式表演:Hello Robot Stretch 4如何重新定义家庭辅助机器人的实用边界
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号