点击下方卡片,关注“具身智能之心”公众号
刚结束不久的2026世界机器人大会上,王兴兴说了一句话:
现在人形机器人最大的瓶颈,已经是大脑和软件了。
然后,六天后。
一家2024年底才成立、由两名前Meta FAIR研究员创办的美国创业公司Perceptron,扔出来了一个很有意思的模型:
Isaac 0.5。
36B参数、动态稀疏MoE、100万小时通用视频、37.5万小时第一视角视频、37.5万小时UMI视频、10万小时机器人经验,覆盖35种以上机器人配置。
而且开源权重。

这个模型真正值得关注的点在于成本。它提出了一个问题:机器人数据,到底还需要采多少?
过去两年,行业默认的Scaling路线非常直接。
缺数据?
那就建数采厂、招操作员、上遥操作设备,再采几十万小时。
Isaac 0.5给出了另一条很值得认真看的路线:
真正稀缺的机器人数据,也许不用承担“教会模型认识整个世界”这件事。
它只需要负责其中最昂贵、也最不可替代的一部分——把模型对世界的理解,接到机器人动作上。
这件事如果成立,影响的可就不止一个VLA模型了。
它会一路向上游,重新影响数采、Ego、UMI、仿真;一路向下游,影响机器人本体、模型适配和集成部署。
Isaac 0.5真正搅动的,是整个具身智能产业链的数据经济账。
01.
大家都在抢机器人数据,Isaac 0.5先问了一个问题:真的需要那么多吗?
先看Isaac 0.5到底“吃”了什么。
它的完整训练数据来自529条source stream。
其中包括:
100万小时通用无动作视频
37.5万小时第一视角Ego视频
37.5万小时UMI手持夹爪视频
10万小时机器人相关数据
3万亿多模态token
35+种机器人配置

10万小时机器人数据再往里拆:1万小时是高质量遥操作示范;4万小时是更广泛的机器人交互轨迹;另外5万小时来自游戏与仿真。
这套配方很有意思。
因为过去具身行业聊“数据”,经常把所有数据都折算成一个小时数。10万小时、50万小时、100万小时。
但Isaac 0.5实际上在强调:不同数据干的活根本不一样。
普通互联网视频的优势是便宜、广。
它能告诉机器人,抽屉打开以后是什么样,杯子被拿起以后场景会发生什么变化,一个东西掉下去大概率往哪里运动。
Ego视频离操作更近。
摄像头跟着人的身体运动,手、物体、接触关系和任务过程都更清晰。
UMI再往机器人靠近一步。它开始携带夹爪的运动轨迹和时序信息。
最后才是真机数据。
它最贵,却拥有前面三类数据最缺的东西:真正的机器人状态和动作监督。
Isaac 0.5则指出:机器人轨迹提供了最强的action grounding,但它昂贵,而且天然和具体本体绑定。
所以Isaac 0.5没有要求一份数据解决所有问题。它做的是分工。
通用视频负责把世界看广,Ego和UMI负责把观察拉近到交互,真机数据负责完成最后那层动作接地。

然后,最关键的实验来了。
当通用视频从1000小时扩大到100万小时,为达到action loss=2.50这个阈值,遥操作数据需求从5884小时下降到28小时。
约210倍。

这里需要注意下:视频并不是无条件替代机器人数据。
当机器人遥操作数据只有1小时时,继续增加视频,收益曲线几乎是平的;大约从100小时真机数据开始,视频Scaling的收益才逐渐稳定。
这就很有意思了。
机器人数据依然得有。而且得先有。只是当模型完成了一定程度的动作grounding之后,大规模视频才开始发挥杠杆作用。
我们更愿意把Isaac 0.5的数据结论理解成一句话:
昂贵的真机数据可能正在从“主粮”,变成“引子”。
量未必需要无限增加,但质量、覆盖范围和动作grounding能力会越来越重要。
这对今天正在疯狂建设数采场的行业来说,显然不是个小信号。
02.
“看懂世界”和“控制机器人”之间的隔阂,
是怎么消除的?
问题来了。
普通视频又没有机器人的关节角、力矩和action。看一百万小时YouTube,机器人为什么就会抓东西?
Isaac 0.5在模型结构上做的核心工作,就是让视频里学到的东西,真的能一路传到动作输出。

它用了一个统一的36B稀疏backbone。
视频理解、空间定位、具身推理、任务进度判断,以及最后的机器人控制,都从同一套共享表示里读取信息。
简单来说就是:
过去很多系统像是先请一个人“看懂”,再把结果交给另一个人“干活”。
Isaac 0.5希望负责看世界的那套神经网络,本身就参与动作学习。
这样一来,模型从大量视频里学会的“抽屉已经打开”“杯子马上会掉”“机器人接近物体了”,才有机会直接影响后面的控制。
这里面有一个很关键的概念:Percept。
Perceptron没有要求模型预测未来每一帧的全部像素,而是训练它预测未来画面里和任务有关的“可见状态变化”。
比如:
物体已经被抓住;抽屉已经打开;马上要发生接触。
可以把它理解成一种更任务导向的未来状态预测。
这也是Isaac 0.5与很多纯VLA路线有区别的地方:
它不满足于从“看到什么”直接映射到“下一步动作是什么”,中间增加了对于状态变化与未来结果的学习。
03.
36B的模型看着很大,
但每个Token只激活约2.5B
另一个容易被数字吓到的地方,是36B参数。
机器人上跑36B?Jetson看了都沉默。。。
Isaac 0.5用了动态稀疏MoE。
整个模型有256个路由专家,一个token最多可以选择8个,但这里增加了一类很特殊的Null Expert。
顾名思义:这个专家啥也不干。
如果模型判断当前token没必要调用那么多计算,就把部分路由分给Null Expert,直接跳过对应MLP。
结果是,虽然整个模型总参数量达到36B,但论文披露的超稀疏配置里,平均每个token实际激活约2.5B参数。
这非常符合机器人的实际需求。
一张复杂场景图片、一句任务指令、一个本体状态,以及连续动作token,本身需要的计算量就不一样。
何必所有token都统一“满血跑8个专家”?
动作端,Isaac 0.5又留了两个接口。
离散动作走2048个FAST token。
连续控制则交给一个Flow expert和36层DiT生成action chunk。
所以它的目标非常明确:
一个共享大脑,把感知、推理和动作接到一起;真正到了不同机器人身上,再通过不同控制接口往下适配。
这也解释了为什么Isaac 0.5训练时会覆盖35种以上机器人配置。
它押的是跨本体基础模型。

04.
把Isaac 0.5和主流模型
横向对比后的一些发现。
到了2026年,具身基础模型已经明显进入“神仙打架”。
但大家focus的东西并不完全一样。
1)π0.7:模型能力路线的标杆
Physical Intelligence基本是这一轮通用机器人基础模型最绕不开的公司之一。
π0.5已经验证了异构机器人数据、Web数据和语义任务联合训练对开放世界泛化的价值;今年4月推出的π0.7,则继续向可控、长程和泛化推进。
如果把两者放在一起看:
π系列更像是在持续证明“一套机器人基础模型的能力上限到底能多高”。
Isaac 0.5则还把另一个问题看的非常重:
能力之外,这套模型的数据账怎么算?
Isaac论文甚至直接拿π0.5做了跨模型适配实验对照。
在LIBERO-Long上,Isaac 0.5零样本成功率只有6%;但更新Flow/DiT动作专家后达到91%,进一步加入接口投影达到92.5%,全量微调为93%。

所谓通用基础模型,目前还远没有到“模型下载下来,随便接个机器人就能干活”的阶段。
Base Model提供的是更好的起点,适配仍然是必修课。
2)Google Gemini Robotics 2:闭源前沿能力越来越接近完整机器人“大脑”
今年7月底,Google DeepMind刚刚更新Gemini Robotics 2。
它已经从机械臂控制进一步走向全身控制、精细操作和多机器人协作;On-Device 2则专门解决端侧部署,并声称新本体通常使用不到200个样本、几小时训练即可完成适配。Google的优势很明显:
Gemini本身拥有极强的多模态理解和推理底座,再把这些能力往物理世界延伸。
但它目前仍主要面向受信任测试者,并非一套开发者可以完整拿走训练和改造的开放底座。
所以在Isaac 0.5面前,两边的竞争点很清楚:
Google想做最强闭源通用智能,Perceptron押开放模型+规模化数据方法。
3)NVIDIA GR00T N1.7:真正的重量级对手,其实在产业链
名字上还有个很容易搞混的地方。
Perceptron的Isaac 0.5,和NVIDIA用了很多年的Isaac机器人平台没有关系。
但竞争关系反而因此更有意思了。
NVIDIA今年推出的GR00T N1.7同样是开放、跨本体VLA,而且已经加入约2万小时EgoScale人类第一视角视频。它背后还有Isaac Sim、Isaac Lab、遥操作、合成数据、TensorRT、Jetson Thor一路连到部署的完整栈。
这意味着,Isaac 0.5如果只比“模型分数”,其实还没碰到NVIDIA真正厚的地方。
NVIDIA卖的是一整条机器人开发流水线。
数据怎么采、仿真怎么跑、模型怎么训、推理怎么加速、最后用什么计算平台部署,全都能接。
Perceptron则更像是在模型这一层往上下游同时撕口子。
它接入LeRobot,公开机器人配置,再用视频Scaling降低开发者自己采真机数据的压力。
谁能把开发门槛压得更低,可能比一张benchmark上的几个点更重要。

4)DM0.5、ACE-Brain、HY-Embodied:中国团队已经开始从多个方向包围
国内也不是在旁边看。
原力灵机DM0.5已经把开放世界控制、长程任务、动态干扰和跨本体作为主要方向,并开放基础模型、训练推理代码以及LIBERO、RoboTwin等适配checkpoint。
ACE-Brain-0.5更偏“Physical Agentic AI”,试图把空间感知、决策、交互、自我监控、自我改进放入一个8B统一模型。
腾讯HY-Embodied-0.5则沿着具身理解和推理走,提供2B端侧版本和32B复杂推理版本。
所以你看,2026年的竞争边界其实已经非常清楚:
以前大家争的是“谁的VLA动作做得更好”。
现在开始争:
谁能把视觉理解、物理推理、记忆、规划、动作控制、跨本体适配和端侧效率,收进同一个可以Scaling的系统。
Isaac 0.5只是这个变化里,非常典型的一块拼图。
05.
Isaac 0.5留下的最大悬念:机器人Scaling,可能终于开始算“投入产出比”了
之前,具身行业特别喜欢谈Scaling Law。
模型多大。数据多少小时。机器人多少台。数采厂多少平方米。
这些数字都很直观,也最容易比较。
在Isaac 0.5里,第一次把问题换了一个问法:
为了获得同样一份动作学习效果,我到底需要付出多少昂贵的机器人数据?
从这个角度看,具身智能的数据竞赛可能正在进入第二阶段。
第一阶段拼资产规模:
谁机器人多,谁采得多。
第二阶段开始拼数据转化效率:
谁能用最便宜、最容易扩张的数据,换出最多真实机器人能力。
这对产业链的影响会很深。
数采公司得重新考虑什么数据真正值钱;
仿真公司要证明自己的数据能在哪一层提供增益;
模型公司要证明不同模态能够真正汇入动作能力;
本体厂会越来越希望“换身体不用换脑子”;
而下游客户最终只关心一件很朴素的事情:
为了让机器人学会一个新任务,我还要花多少钱?
Isaac 0.5显然还没有给出最终答案。
它甚至把最关键的Percept目标构造和loss留在了闭源部分;210倍也是离线action-loss意义下的测量,不等于真实部署成本已经下降210倍。外部团队接下来能否复现,这件事很重要。