
刚刚落幕的WRC 2026,印证了一个清晰的行业信号:具身智能的比拼正告别“实验室成绩单”,取而代之的,是场景交付、具身大脑泛化与因果律探索、物理AI工程化落地的三重考验。
这一信号背后,是一条愈发清晰的行业判断——具身模型已完成认知层面的能力跃迁,但机器人要真正干活,核心瓶颈在于具身大脑如何对齐复杂多变、充满不确定性的物理世界。这也决定了通用机器人能否跨越从“感知理解”到“物理执行”的关键一步。
围绕这一命题,我们特邀中科第五纪青年首席科学家、中科院自动化研究所研究员黄岩,结合中科第五纪最新发布的新一代具身操作基础模型FAM 2.0,就通用具身大脑架构、“一脑多形”落地路径、物理AI技术博弈等话题展开对话,拆解中科第五纪如何以少样本具身大脑实现与物理世界的对齐。

少样本具身大脑
重构“通用”落地逻辑
具身智能落地卡在“大脑”,这是当前业界共识。机器人一旦走出实验室、面对陌生任务,便无据可依,性能快速衰减。
按语言大模型时代的逻辑,解法似乎只有堆数据规模。但真实世界的场景是无限长尾,示教数据只能逐一采集,永远追不上场景的发散速度——规模法则,在物理世界面前遭遇了边界。
中科第五纪青年首席科学家黄岩深耕多模态与具身大模型十余年,兼具研究者与工程派的双重底色。带着这份“产研基因”,黄岩和中科第五纪交出的自研答案是——FAM系列超少样本具身操作大模型。
在技术架构层面,FAM同时承接VLA的语义理解与WM的物理先验。谈及具体机制,黄岩介绍:“FAM创造性地引入了热力图对齐机制,将VLM与VLA的‘低维’语义-动作映射,升维到三维空间。”其在语义决策与物理执行之间架起桥梁,弥合了二者之间长期存在的维度鸿沟。
围绕这一架构,他进一步阐释了其设计哲学:它不追求像素级物理预测的“完美世界模型”,也不依赖暴力数据的“VLA大力出奇迹”,而是用极少量的、物理上“正确”的示范数据,在模型内部建立起“语义-空间-动作”的因果链。换言之,FAM追求的不是数据规模,而是数据的因果密度。
这一路径的有效性在数据层面得到直接验证。黄岩介绍:“FAM模型在仅需3-5条示范数据的前提下,即可完成复杂操作学习,数据效率较传统大模型提升百倍,单任务成功率高达97%。”它让机器人从“死记硬背动作”变成了“开始理解学习”。
在此基础上,中科第五纪还自研BridgeV2W具身世界模型与“人在环路强化学习”形成“预测-避险-进化”三位一体的认知架构。这相当于为具身大脑引入“先想后做”的决策机制,从而在动作落地之前规避碰撞与误操作风险。
那么怎样的具身大脑才算“通用”?在黄岩看来,判断下一代通用具身智能大脑,有一个清晰的终极标尺:“在一个从未见过的物理场景中,面对一个从未见过的物体和指令,仅凭极少量的先验知识或者示教数据,首次尝试即能以非常高的成功率完成任务。”
值得注意的是,黄岩特意对“通用性”做了严格区分:“这并非简单‘见过类似场景后的泛化’。”真正意义上的通用性,模型理解的是“物体的属性以及决定如何与其和环境进行交互”,而不是“这个物体长得像训练集里的哪个物体”。
这一区分也直接指向了具身模型评测方法的深层问题。黄岩直言,目前的评测体系更多衡量的是“记忆-检索”能力,而我们更看重“零样本通用泛化”的指标。即给定一个物体,机器人能否仅凭对其材质、形状、重心的“感知”,就推理出最佳的抓取策略和操作轨迹,而无需在仿真里先练上万次。
这背后,是一条清晰且务实的产品哲学。“真正通用的具身大脑,不是在实验室里跑通100个任务,而是在100个不同的真实产线里,每一个都做到99%以上的成功率。”黄岩强调,这既是中科第五纪当下的工程化选择,也是对“通用”二字的务实理解。
但中科第五纪不追求“一步到位”的通用,而是先在工业高价值场景里把“空间认知+纠偏”做到极致,拿到规模化交付的“入场券”,再用真实场景数据反哺常识推理能力,逐步向开放场景演进。99%这条硬指标,或许正是这条分水线上最诚实的刻度。
从100个任务到100条产线,一词之差,勾勒出的却是具身智能从学术叙事走向产业叙事的分水岭:前者证明模型的能力上限,后者定义商业交付的底线。

全栈“务实派”专家
解锁一脑多形与数据飞轮
谈及通用大脑能力,行业绕不开一个词——“一脑多形”。即单一大脑适配多形态机器人本体。这既是通用性最直观的诠释,也是产业长期追逐的圣杯。
但理想丰满,现实骨感:跨本体泛化,始终是业内公认的硬骨头。面向这一行业难题,中科第五纪发布新一代具身操作基础模型FAM 2.0。
作为FAM-1、FAM-1.3之后的重大升级,FAM 2.0以行业首创的基于动作光流(Action Flow)的世界动作模型为核心,首次将光流作为视频原生的动作表示,深度融入世界动作模型,构建统一的跨本体动作表示空间,实现同一模型对多种机器人本体的通用适配。
同时,黄岩在采访中一针见血地指出,跨本体的症结在于不同本体在机械结构上形态各异,虽然其动作均以坐标点形式加以表征,但各自的运动模式却存在本质差异。因此,对于具身操作模型而言,学习并泛化这些差异化的动作模式,是一项极具挑战性的开发难题。
针对这一难题,黄岩给出了清晰的技术路径。他认为,实现“一脑多形”的关键在于构建统一的本体动作表征——即不同本体的动作坐标能够被编码为同一种表征形式,而该统一表征亦能反向解码出各本体特定的运动指令。
他进一步表示:“解决的核心思路在于将动作坐标进行像素化,不仅可以利用本体配置文件作为先验信息,还能充分利用不同本体的大规模数据,真正发挥数据本体多样化的优势”。
沿此方向,目前其团队已系统探索了本体动作流、本体掩膜、本体动作光流等多种技术方案,迭代出EC‑Flow、BridgeV2W、FlowWAM一系列VLA和WAM算法。相关成果在多个国际评测榜单中拥有领先表现,为跨本体迁移提供了可落地的技术路径。
但打通跨本体泛化只是通用大脑落地的“第一步”,如何构建模型‑场景‑数据迭代飞轮才是隐秘背后的“关键”。
在数据飞轮建设上,黄岩始终保持审慎态度。“数据飞轮不等于简单堆砌原始采集数据。”他解释道,中科第五纪的思路,是将不同场景中的任务执行经验沉淀为可复用能力,重点利用人工接管、执行失败和环境变化等高价值数据持续更新模型。
“每进入一个新场景,都会降低下一个场景的数据需求和部署成本。”黄岩强调,核心壁垒在于提升数据利用效率,降低模型对海量同类数据的依赖。
这一思路已在实践中得到验证。资料显示,FAM系列模型通过三维空间热力图建模位置、姿态与动作之间的关系,使基础任务在理想情况下仅需3至5条真机示范即可完成学习。而BridgeVLA、SpatialWAM等模型均延续该思路持续迭代,进一步夯实中科第五纪在该方向的技术实力。
但具身大脑的价值,最终要在真实物理世界中兑现。中科第五纪选择的路径,是以全栈布局将这件事掌握在自己手中。
黄岩还在采访中强调:“中科第五纪并不是单一模型企业,而是以具身大脑为核心,同时自研机器人本体,目的是加快技术验证和场景交付,同时保持大脑能力的开放性,持续适配不同类型的机器人。”
资料显示,中科第五纪的自研机器人“纪灵”已在中石化等真实场景中投入应用,模型迭代速度与场景交付质量均得到直接验证。需要指出的是,全栈并不意味着封闭,对于中科第五纪而言,本体是手段,大脑才是产品。

跳出模型内卷
物理AI的破局逻辑
数据的解法既已清晰,下一程的分野便落在训练范式本身:走哪条路线,才能让具身模型以更少数据、更低成本完成任务?
刚刚落幕的2026世界机器人大会(WRC 2026)恰好提供了一个观察切口:物理AI已成落地主战场,但训练路线明显分化为两派——传统强化学习与“机器人幼儿园”式的自主泛化探索。
谁更接近终点?黄岩没有急于站队,而是回到第一性原理,先厘清问题本质。在他看来,物理AI正从“看懂世界”走向“在真实世界中完成任务”,但主要问题在于真实物理数据采集成本高,无法覆盖不断变化的任务和场景,需要解决数据数量和采集效率问题,同时在模型方面,要进一步提升模型的数据利用效率。
黄岩指出,传统强化学习的优势是目标明确、结果可量化,在边界清晰的任务中能够获得稳定性能,致命短板是真机试错成本高,仿真能力不能可靠地迁移到真实世界;而“机器人幼儿园”强调自主探索和能力泛化,理论上具有更高上限,但当前最大问题是数据少、探索成本高。
回看两条路线,其短板便不再是孤立的技术缺陷,而是对同一道“数据命题”给出的两种不同答案——各自的取舍,也意味着各自必须缴纳的“学费”。
那么,未来会不会一条路线通吃?黄岩给出了明确的判断:“中长期不会是哪条路线单独胜出。”在他看来,最优解是一套组合方案:以通用预训练形成基础能力,以少量真机示范完成场景适配,再通过人在环路学习持续纠错。
然而,即便数据与路线问题得以厘清,另一重矛盾正在浮出水面:面对机器人毫秒级实时响应,以及模型规模持续膨胀,两头正逼近冲突的极限。端侧算力已从具身智能工程化问题转变为产业化卡点。
如何破局?常规思路是压缩模型、做量化裁剪。但黄岩的解法颇为反直觉——避免让具身大模型承担所有计算。
让一个超大模型同时承担语言理解、任务规划和高频动作控制,并不现实。他认为,不同环节对算力和实时性的要求完全不同。高层认知允许复杂推理,底层控制则必须保障毫秒级响应、稳定性和安全性。

具身智能的
ChatGPT时刻还有多远?
至此,黄岩已将通往通用具身智能拐点的三块拼图摆上桌面——数据、路线、算力。拼图集齐,终极问题自然浮现:具身智能的“ChatGPT时刻”何时到来?
黄岩给出的标准很明确:“模型通用性相较上一代发生显著提升,能够帮助普通用户稳定解决真实问题,并形成明确的付费意愿。”
他同时判断,拐点不会一步到位,而是分场景先后到来:家庭场景复杂度高,可能还需要5-10年;工业场景任务边界更清晰、价值更容易验证,3年左右更有可能率先出现阶段性拐点。
从具身智能技术路线到落地哲学,可最终收敛于黄岩的一个“朴素”思考:“面对全栈竞争,真正的壁垒不只是模型方面,而是超少样本泛化能力、跨场景迁移效率和规模化交付能力的有机体现。”
当模型层面的差距逐渐收窄,真正的胜负手将落在泛化、迁移与交付这三个维度上。这道考题,目前还没有玩家交出满分答卷。
拐点何时点亮,无人能给出确切日期。可以确定的是,答案不在评测榜单上,而在真实世界的每一次稳定运行、每一位愿意付费的用户之中。


