中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04

鲸奇智慧Explore 2026-09-21 16:44
中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图1

刚刚落幕的WRC 2026,印证了一个清晰的行业信号:具身智能的比拼正告别“实验室成绩单”,取而代之的,是场景交付、具身大脑泛化与因果律探索、物理AI工程化落地的三重考验。

这一信号背后,是一条愈发清晰的行业判断——具身模型已完成认知层面的能力跃迁,但机器人要真正干活,核心瓶颈在于具身大脑如何对齐复杂多变、充满不确定性的物理世界。这也决定了通用机器人能否跨越从“感知理解”到“物理执行”的关键一步。

围绕这一命题,我们特邀中科第五纪青年首席科学家、中科院自动化研究所研究员黄岩,结合中科第五纪最新发布的新一代具身操作基础模型FAM 2.0,就通用具身大脑架构、“一脑多形”落地路径、物理AI技术博弈等话题展开对话,拆解中科第五纪如何以少样本具身大脑实现与物理世界的对齐。

中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图2

少样本具身大脑

重构“通用”落地逻辑

具身智能落地卡在“大脑”,这是当前业界共识。机器人一旦走出实验室、面对陌生任务,便无据可依,性能快速衰减。

按语言大模型时代的逻辑,解法似乎只有堆数据规模。但真实世界的场景是无限长尾,示教数据只能逐一采集,永远追不上场景的发散速度——规模法则,在物理世界面前遭遇了边界。

中科第五纪青年首席科学家黄岩深耕多模态与具身大模型十余年,兼具研究者与工程派的双重底色。带着这份“产研基因”,黄岩和中科第五纪交出的自研答案是——FAM系列超少样本具身操作大模型。

在技术架构层面,FAM同时承接VLA的语义理解与WM的物理先验。谈及具体机制,黄岩介绍:“FAM创造性地引入了热力图对齐机制,VLMVLA的‘低维’语义-动作映射,升维到三维空间。”其在语义决策与物理执行之间架起桥梁,弥合了二者之间长期存在的维度鸿沟。

围绕这一架构,他进一步阐释了其设计哲学:它不追求像素级物理预测的“完美世界模型”,也不依赖暴力数据的“VLA大力出奇迹”,而是用极少量的、物理上“正确”的示范数据,在模型内部建立起“语义-空间-动作”的因果链。换言之,FAM追求的不是数据规模,而是数据的因果密度。

这一路径的有效性在数据层面得到直接验证。黄岩介绍:FAM模型在仅需3-5条示范数据的前提下,即可完成复杂操作学习,数据效率较传统大模型提升百倍,单任务成功率高达97%。”它让机器人从“死记硬背动作”变成了“开始理解学习”。

在此基础上,中科第五纪还自研BridgeV2W具身世界模型与“人在环路强化学习”形成“预测-避险-进化”三位一体的认知架构。这相当于为具身大脑引入“先想后做”的决策机制,从而在动作落地之前规避碰撞与误操作风险。

那么怎样的具身大脑才算“通用”?在黄岩看来,判断下一代通用具身智能大脑,有一个清晰的终极标尺:在一个从未见过的物理场景中,面对一个从未见过的物体和指令,仅凭极少量的先验知识或者示教数据,首次尝试即能以非常高的成功率完成任务。”

值得注意的是,黄岩特意对“通用性”做了严格区分:“这并非简单‘见过类似场景后的泛化’。”真正意义上的通用性,模型理解的是“物体的属性以及决定如何与其和环境进行交互”,而不是“这个物体长得像训练集里的哪个物体”

这一区分也直接指向了具身模型评测方法的深层问题。黄岩直言,目前的评测体系更多衡量的是记忆-检索能力,而我们更看重零样本通用泛化的指标。即给定一个物体,机器人能否仅凭对其材质、形状、重心的感知,就推理出最佳的抓取策略和操作轨迹,而无需在仿真里先练上万次。

这背后,是一条清晰且务实的产品哲学。真正通用的具身大脑,不是在实验室里跑通100个任务,而是在100个不同的真实产线里,每一个都做到99%以上的成功率。”黄岩强调,这既是中科第五纪当下的工程化选择,也是对“通用”二字的务实理解。

但中科第五纪不追求“一步到位”的通用,而是先在工业高价值场景里把“空间认知+纠偏”做到极致,拿到规模化交付的“入场券”,再用真实场景数据反哺常识推理能力,逐步向开放场景演进。99%这条硬指标,或许正是这条分水线上最诚实的刻度。

从100个任务到100条产线,一词之差,勾勒出的却是具身智能从学术叙事走向产业叙事的分水岭:前者证明模型的能力上限,后者定义商业交付的底线。

中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图3

全栈“务实派”专家

解锁一脑多形与数据飞轮

谈及通用大脑能力,行业绕不开一个词——“一脑多形”。即单一大脑适配多形态机器人本体。这既是通用性最直观的诠释,也是产业长期追逐的圣杯。

但理想丰满,现实骨感:跨本体泛化,始终是业内公认的硬骨头。面向这一行业难题,中科第五纪发布新一代具身操作基础模型FAM 2.0

作为FAM-1FAM-1.3之后的重大升级,FAM 2.0行业首创的基于动作光流Action Flow)的世界动作模型为核心,首次将光流作为视频原生的动作表示,深度融入世界动作模型,构建统一的跨本体动作表示空间,实现同一模型对多种机器人本体的通用适配。

同时,黄岩在采访中一针见血地指出,跨本体的症结在于不同本体在机械结构上形态各异,虽然其动作均以坐标点形式加以表征,但各自的运动模式却存在本质差异。因此,对于具身操作模型而言,学习并泛化这些差异化的动作模式,是一项极具挑战性的开发难题。

针对这一难题,黄岩给出了清晰的技术路径。他认为,实现“一脑多形”的关键在于构建统一的本体动作表征——即不同本体的动作坐标能够被编码为同一种表征形式,而该统一表征亦能反向解码出各本体特定的运动指令。

他进一步表示:“解决的核心思路在于将动作坐标进行像素化,不仅可以利用本体配置文件作为先验信息,还能充分利用不同本体的大规模数据,真正发挥数据本体多样化的优势”。

沿此方向,目前其团队已系统探索了本体动作流、本体掩膜、本体动作光流等多种技术方案,迭代出EC‑Flow、BridgeV2W、FlowWAM一系列VLA和WAM算法。相关成果在多个国际评测榜单中拥有领先表现,为跨本体迁移提供了可落地的技术路径。

但打通跨本体泛化只是通用大脑落地的“第一步”,如何构建模型场景数据迭代飞轮才是隐秘背后的“关键”。

在数据飞轮建设上,黄岩始终保持审慎态度。“数据飞轮不等于简单堆砌原始采集数据。”他解释道,中科第五纪的思路,是将不同场景中的任务执行经验沉淀为可复用能力,重点利用人工接管、执行失败和环境变化等高价值数据持续更新模型。

“每进入一个新场景,都会降低下一个场景的数据需求和部署成本。”黄岩强调,核心壁垒在于提升数据利用效率,降低模型对海量同类数据的依赖。

这一思路已在实践中得到验证。资料显示,FAM系列模型通过三维空间热力图建模位置、姿态与动作之间的关系,使基础任务在理想情况下仅需35条真机示范即可完成学习。而BridgeVLASpatialWAM等模型均延续该思路持续迭代,进一步夯实中科第五纪在该方向的技术实力。

但具身大脑的价值,最终要在真实物理世界中兑现。中科第五纪选择的路径,是以全栈布局将这件事掌握在自己手中。

岩还在采访中强调:中科第五纪并不是单一模型企业,而是以具身大脑为核心,同时自研机器人本体,目的是加快技术验证和场景交付,同时保持大脑能力的开放性,持续适配不同类型的机器人。”

资料显示,中科第五纪的自研机器人“纪灵”已在中石化等真实场景中投入应用,模型迭代速度与场景交付质量均得到直接验证。需要指出的是,全栈并不意味着封闭,对于中科第五纪而言,本体是手段,大脑才是产品。

中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图4

跳出模型内卷

物理AI的破局逻辑

数据的解法既已清晰,下一程的分野便落在训练范式本身:走哪条路线,才能让具身模型以更少数据、更低成本完成任务?

刚刚落幕的2026世界机器人大会(WRC 2026)恰好提供了一个观察切口:物理AI已成落地主战场,但训练路线明显分化为两派——传统强化学习与“机器人幼儿园”式的自主泛化探索。

谁更接近终点?黄岩没有急于站队,而是回到第一性原理,先厘清问题本质。在他看来,物理AI正从“看懂世界”走向“在真实世界中完成任务”,但主要问题在于真实物理数据采集成本高,无法覆盖不断变化的任务和场景,需要解决数据数量和采集效率问题,同时在模型方面,要进一步提升模型的数据利用效率

黄岩指出,传统强化学习的优势是目标明确、结果可量化,在边界清晰的任务中能够获得稳定性能,致命短板是真机试错成本高,仿真能力不能可靠地迁移到真实世界;而“机器人幼儿园”强调自主探索和能力泛化,理论上具有更高上限,但当前最大问题是数据少、探索成本高。

回看两条路线,其短板便不再是孤立的技术缺陷,而是对同一道“数据命题”给出的两种不同答案——各自的取舍,也意味着各自必须缴纳的“学费”。

那么,未来会不会一条路线通吃?黄岩给出了明确的判断:“中长期不会是哪条路线单独胜出。”在他看来,最优解是一套组合方案:以通用预训练形成基础能力,以少量真机示范完成场景适配,再通过人在环路学习持续纠错。

然而,即便数据与路线问题得以厘清,另一重矛盾正在浮出水面:面对机器人毫秒级实时响应,以及模型规模持续膨胀,两头正逼近冲突的极限。端侧算力已从具身智能工程化问题转变为产业化卡点。

如何破局?常规思路是压缩模型、做量化裁剪。但黄岩的解法颇为反直觉——避免让具身大模型承担所有计算。

让一个超大模型同时承担语言理解、任务规划和高频动作控制,并不现实。他认为,不同环节对算力和实时性的要求完全不同。高层认知允许复杂推理,底层控制则必须保障毫秒级响应、稳定性和安全性。

中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图5

具身智能的

ChatGPT时刻还有多远

至此,黄岩已将通往通用具身智能拐点的三块拼图摆上桌面——数据、路线、算力。拼图集齐,终极问题自然浮现:具身智能的“ChatGPT时刻”何时到来?

黄岩给出的标准很明确:“模型通用性相较上一代发生显著提升,能够帮助普通用户稳定解决真实问题,并形成明确的付费意愿。

他同时判断,拐点不会一步到位,而是分场景先后到来:家庭场景复杂度高,可能还需要5-10年;工业场景任务边界更清晰、价值更容易验证,3年左右更有可能率先出现阶段性拐点。

从具身智能技术路线到落地哲学,可最终收敛于黄岩的一个“朴素”思考:“面对全栈竞争,真正的壁垒不只是模型方面,而是超少样本泛化能力、跨场景迁移效率和规模化交付能力的有机体现。”

当模型层面的差距逐渐收窄,真正的胜负手将落在泛化、迁移与交付这三个维度上。这道考题,目前还没有玩家交出满分答卷。

拐点何时点亮,无人能给出确切日期。可以确定的是,答案不在评测榜单上,而在真实世界的每一次稳定运行、每一位愿意付费的用户之中。

中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图6


智潮专题



具身智能



低空经济




鲸奇智慧 Explore
中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图7
中科第五纪黄岩:具身大脑核心竞争力是少样本泛化与规模化交付 | 智潮No.04图8
*编者申明:原创不易,请尊重作者;如需转载,请与我们联系。


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
开源Editable-Design,让AI生图终于能改字、拖图层
智谱ZCode陷“偷传代码”风波,官方致歉并承诺开源
开源还是闭源?AI创业者的“生死抉择”将在TechCrunch Disrupt 2026揭晓
清微智能开源全球首个 3D 算力软件底座
Tiwaz分体键盘开源:双摇杆加持,单手操控新范式
15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了
通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
开源Top2!实测阶跃Step 5 Preview,真有点猛啊…
NVIDIA 扩展开源 CUDA-Q 平台,助力容错量子计算
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号