PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限

Xbotics具身智能实验室 2026-09-16 17:00

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



导语
GPT-6 在机械臂上一成一败的两个结果,说明了同一件事:模型能走多远,取决于它对物理世界理解到什么程度。深度机智把基座当作主线做了近两年,PhysBrain 1.5 是阶段性成果。


PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图1
PhysBrain 1.5-8B 在 28 项具身评测上的综合得分:开源第一,紧随 GPT-6 Astra 与 Gemini 3.6 Flash

GPT-6 的发布,把大语言模型的能力边界又推高了一截。推理、编程、多模态理解接连突破,通用智能的演进还在提速。但模型在数字世界里越能干,一个问题就越难绕开:一个足够理解世界的模型,能不能在真实世界里动手?

机器人评测机构 Robocurve 做过一组机械臂测试,两个任务,结果一成一败。

第一个任务,让 GPT-6 Astra 把一块积木放进碗里,20 次成功了 19 次。整个过程没有用任何针对该任务采集的真机数据,方法也相当朴素:模型只充当高层策略,读摄像头画面与机器人状态,把「手该往哪儿去、夹爪什么时候合上」写成一段指令,交给现成的控制器执行是把大模型接到机器人上最直接的一种接法。

一个通用基座模型,仅凭自身能力的提升,就把一件物理世界里的活干成了。这给行业的启示是:具身智能的泛化可以来自基座模型本身。

第二个任务,把一块圆形拼图按进对应的凹槽,GPT-6 Astra 20 次只成功 2 次,每次都够到槽口就停在那里。粗抓放做得了,毫米级的对位做不了。

两个任务的差别不在执行层——接法一样,控制器一样,摄像头一样。差别在基座模型本身,它能理解到粗抓放这一层,再往上的空间、接触与后果,它还没有建模能力。

所以基座模型的能力上限,就是物理智能的上限。

这个判断,行业里真正当主线做的团队并不多。多数人还是按老路子走:针对场景收数据、针对任务调策略,基座能用就行。深度机智是少数把它当成主线的一家,从海淀中关村走出来,由中关村两院孵化,是中国物理 AI 赛道上的一匹黑马。深度机智的路线很清楚,以“人类学习”的技术路线,从人类经验中先立住物理世界的基座,再用本体验证,进而考虑场景任务的落地。

前段时间开源的 PhysBrain 1.5,是这条主线上的阶段性成果:8B 参数,在 28 项具身空间智能与规划的公开评测上综合得分 72.5,在参评的开源模型中排名第一,整体表现已接近得分 73.3 的 GPT-6 Astra 和 73.0 的 Gemini 3.6 Flash 等头部闭源模型。

01|8B 拿下开源第一,紧随闭源前沿

深度机智使用了 28 个各自独立的学术基准——RoboSpatial-Home 考察空间理解、Part-Affordance 考察可操作部位识别、RoboRefIt 考察视觉指代……深度机智把它们按五类能力编成一份统一成绩单,并把跑分工具包一并开源,谁都可以复算。

这些能力在一件真实任务里是连着用的:先看清环境里各个物体的关系,再识别哪个位置可以下手,然后形成一条合理的运动路径 —— 模型从「认识物体」走到「使用物体」,靠的就是这一串。

成绩单上有三个数。

第一个是 0.8 分。 PhysBrain 1.5-8B 综合得分 72.5,GPT-6 Astra 是 73.3,差距就这 0.8 分。在开源模型中排名第一,整体位次仅次于 GPT-6 Astra 与 Gemini 3.6 Flash 两个闭源前沿,排在得分 67.9 的 Claude Opus 5 之前。一个 8B 的开源模型,挤进了闭源前沿。

PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图2

第二个是 24。 28 项里有 24 项进入开源模型前二 —— 14 项拿到开源最佳,另有 10 项位列第二。感知、空间、规划、指向、轨迹,五类能力都进了开源前二。不是靠某一类偏科拉分,是五类一起顶上去的。

第三个是 66.6。 深度机智同时开源了一个 2B 版本,综合得分 66.6,高过参与对比的每一个开源模型 —— 包括一个总参数达 30B 的混合专家模型。以约十五分之一的参数规模胜出,说明这套能力并不依赖堆参数,而是来自训练方式本身。

两个尺寸的定位是分开的:8B 追求性能极致,用来探明这条路线的能力边界;2B 面向轻量部署,能不能在端侧有限的算力与功耗里跑起来,决定了这套能力能不能跟着机器人一起出厂。

更关键的是开放的彻底程度:两个尺寸的权重、完整的技术报告、以及这套评测所用的工具包,三样同步公开。这在当下的物理基座模型里并不多见 —— 多数团队公开的是结论,而深度机智把得出结论的整条路径一并交了出来,任何人都可以照着把这张成绩单重算一遍。

两个权重上线 HuggingFace 三天,下载使用已超过三千次。

  • Project: deepcybo-physai.github.io/PhysBrain-1.5
  • HF: hf.co/collections/DeepCybo/physbrain-15
  • Eval: github.com/DeepCybo-PhysAI/PhysBrainEvalKit

02|把理解、动作、预测收进同一个闭环

从公开的技术路线看,PhysBrain 1.5 首先要解决的,是一个比跑分更重要的问题:物理智能到底在解决什么。

深度机智的答案是「循环」——Physical Loop:观察世界、理解眼前的空间和任务、判断动作会带来什么后果、动手、再依据新看到的东西修正下一步。人就是靠无数次「看—想—做—再看」,把物理常识、空间感和动手能力一起练出来的。

这个循环难在连续。杯子会滑动,工具会被遮挡,物体位置和预期对不上,机器人要把一件事从头做到尾,就得在整个过程里维持住对世界的理解,并根据反馈自己纠错。现实里的任务一直在变,循环一旦断掉,后面就接不上。

而今天构成这个循环的能力是散的。语义理解、空间感知、物体识别、画面生成,各由一个模型解决,各自都能做好自己那一段,但彼此之间没有共同的世界表征,没有共同的行动目标,也没有一条把执行结果收回来的通路。拼在一起,循环还是转不起来。

要做出一个能在世界里行动、还能自我修正的底座,就得回到闭环本身,把这几段能力接回同一个模型,让它们共用一套世界表征。PhysBrain 1.5 就是这么重建的:把 Physical Loop 拆成三段能力,在同一个模型、同一个训练目标下一起训练。

PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图3
Physical Loop 在模型内部闭合:理解、动作、预测三段共用同一套参数与同一个训练目标

第一段是具身理解,对应循环里的「看懂与判断」。 模型沿用通用视觉语言模型的接口,再以具身监督加以强化,覆盖五类能力 —— 基础的视觉空间感知、三维与多视角理解、具身认知与规划、空间指向与可供性,以及视觉轨迹推理。它不只是认出画面里有什么,而是带着空间结构与物理常识去理解一个场景,哪里能下手、够不够得着、动作该沿什么路径组织。

PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图4
具身理解的五类能力:看清场景、建立空间关系、规划动作、定位目标点,最后画出轨迹

第二段是动作生成,对应循环里的「动手」。 给定任务指令、当前观测与近期动作,模型直接输出下一拍末端执行器的动作块。关键在于表达方式:单臂、左腕、右腕共用同一套动作词表与码本,因此一份通用的模型权重就能驱动不同形态的机器人,不必为每种构型单独训一版。这是「理解」能够落地为「行动」的关键一跃。

PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图5
同一套动作词表驱动不同形态的机器人:一份权重给出的轨迹在多个场景中复用

第三段是未来状态预测,对应循环里的「预判后果」。 三件事中,预判最难。给模型一帧当前画面和一句任务指令,它需要生成约一秒后的画面:场景会发生什么变化,物体之间的远近和深度关系如何,机器人本体会出现在什么位置。动作尚未执行,结果已被预演 ,也正是这种能力,让模型在闭环中获得了前瞻与纠错的依据,不必等撞上了才知道错。

PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图6
动作尚未执行,结果已被预演:模型生成约一秒后的画面、深度与机器人所在位置

三段合起来,Physical Loop 才第一次在一个模型内部闭合:「理解」把「判断」交给「动作」,「动作」把「改变后的世界」交给「预测」,「预测」再把「预演出的结果」交回「理解」。

PhysBrain 1.5 能让它闭合,靠的是把动作提前放进了训练。多数视觉语言模型先把世界看懂,再外接控制器执行,动作始终是最后一步;PhysBrain 1.5 让模型在学「看到什么」的同时也学「怎么动」。视觉和动作在同一套表达里互相牵引:看得更准,动作就更准;动作数据多了,对场景的理解也会更细。

03|这个循环要学的,是完整的人类经验

模型能把这个循环转到什么程度,取决于它学到什么经验。Ego360 解决的就是经验从哪来。

机器人轨迹里只有动作。人做事的过程里带着意图、上下文和纠错:为什么伸手、为什么换姿势、出错之后怎么调,全在同一段连续的经验里。Physical Loop 要学的正是这些环节之间的因果关系,而完整的人类经验是这种关系的最佳来源。

在今年7月,WAIC具身智能交互论坛上深度机智创始人陈凯博士首次对外发布Ego 360人类全景真实数据体系。Ego360 能够更加完整地记录人类交互动作,同时留下环境、身体姿态、手部交互与注视四路信息,尽量保住行动前后的因果链条,让模型学到的是一段连续经验,而不是一堆孤立动作。这套体系目前每月增长万小时级。

PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图7
Ego360 记录完整人类经验,同时留下环境、身体姿态、手部交互与注视四路信息

用人类数据值不值,PhysBrain 1.0 已经答过一次:千小时量级的人类数据训出来的能力,超过万小时量级真机数据训出来的水平。同样一小时,人类经验能教给模型的东西更多。

PhysBrain 1.5 负责把这些连续经验训进一个能看懂场景、能给出动作、还能预判后果的基座。

Human-as-Humanoid 负责最后一段:人类经验绕过遥操作,直接变成机器人能执行的动作。同步采集的第一视角与外部视角人类视频,可直接转成适配自家本体的动作训练数据,原始示范吞吐量是遥操作的 4.8 到 7.2 倍。部分任务不需要针对该任务的机器人示范,就完成了从人类数据到真机执行的迁移。

PhysBrain 1.5 登顶全球开源:基座模型的上限,就是物理智能的上限图8
人做事的视频经人体重建与关节换算,直接转成机器人能执行的动作

04|2024年押下的路,从少数派走到领跑者

深度机智创始人陈凯的判断做得很早。2022 年底 ChatGPT 爆发前,他就认定人工智能的终极形态是具身智能,而中国不能只造本体,更要有自己的「大脑」。

2024 年 11 月,他提出一条当时并不主流的路线:回到人自己做事的过程里去学,用人类第一视角的数据构建基座模型。

这条路线当时没人跟。用陈凯自己的话说,「这条差异化技术路线并未受到认可,团队一度陷入技术方向孤立、不被外界看好的艰难时刻」。

但深度机智选择把路走下去,并把它写进公司发展的战略路线。2025年10月10日,公司正式发布《源于人,超越人》技术路线图,明确三大战略:以人类数据为起点、以动作为中心建模、身体为AI设计。

路线图发布后,成果开始沿着它一一落地。

2025 年 12 月,第一视角人类多模态数据集DeepAct与 PhysBrain 论文同期放出,积累的人类数据有了进入模型训练的转化通路;2026 年 3 月的中关村论坛上,PhysBrain 1.0 与全尺寸拟人体机器人 Prime 一起亮相,全球首个基于人类学习范式的基座模型达成多项SOTA,模型能力也有了承接的载体。从数据基建,到模型研发,再到硬件本体,路线图上的每一环都在逐步兑现。当初那条不被看好的路,正一步步走通。

全球的路线正在收敛。英伟达在 GTC 之后确认了同一个方向;今年 4 月,估值 110 亿美元的 Physical Intelligence 发布 π0.7,把机器人数据、人类数据与自主执行数据混在一起训练;7 月,Google DeepMind 发布 Gemini Robotics 2。

8 月更密集:Generalist 用 50 万小时以上的真实物理交互数据做预训练;Figure 推出众包应用,花钱买全球用户拍摄的日常操作视频,承诺未来 12 个月投入 10 亿美元以上。

人类经验数据、空间与交互能力、基础模型训练,全球头部正在殊途同归。这三件事,在深度机智一年前那份路线图里就已经是并列的三条主线

支撑这条路线的是一支不大但很硬的队伍。创始人陈凯出自中科大少年班、微软亚洲研究院联培博士,深耕人工智能领域15年,是深度机智基座模型研发的核心引领者;联合创始人兼 CEO 张翼博同样出自少年班,应用物理学背景,为物理智能研发提供重要支撑;首席机器人专家何旭国深耕机器人领域10余年,是多届世界机器人奥运会青少年国家队的总教练,主导深度机智Prime系列本体的研发,为模型能力验证提供载体。。核心团队汇聚了来自微软亚研院、北京中关村学院,以及清华、北大、中科大、伯克利等全球顶尖学府的博士及核心骨干,覆盖计算机、人工智能、机器人工程、精密制造等方向。

05|结语

回到开头那组测试。GPT-6 Astra 能把积木放进碗里,却在毫米级插接上失手。这说明通用大模型的能力再往上走一步,碰到的就是物理世界的边界——空间、接触、后果,这些它还无法掌握。

这道边界,现在还没有解。它指向一个更根本的判断:物理智能需要自己的基座模型。通用大模型的能力可以溢出到物理世界,但物理世界的智能,终究要从物理世界本身长出来。

而以基座模型的路径解具身问题,是深度机智从成立之初就定下的战略路线。PhysBrain 1.5 正是其长期坚持该方向的阶段性成果。

它在28项评测上拿下开源第一,靠的就是将物理世界操作的连续过程收束进了同一个基座。看到、判断、行动、观察结果、修正下一步,,物理闭环第一次在同一个模型内部形成。

物理智能的终局,会是一个能在真实世界里感知、行动、不断自我修正的闭环。而今天,这个闭环刚刚开始转动。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源
more
通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究
ICML 2026开源 | PointDiT:一张图、一步扩散,直接生成3D点云!
A社“AI末日”资本黑手被揪出,炒作焦虑为IPO圈钱!难怪仇视DeepSeek开源
端侧模型太夯了!面壁智能开源2B「小钢炮」,通用Agent杀到端侧
868亿,黄仁勋官宣收购Hugging Face,全球最大AI开源平台一夜易主
15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了
刚刚,国产2B小钢炮开源!逼近人类水平,跑出端侧通用Agent雏形
399美元的开源鸭火了,我们也“造”了一只!
英伟达震撼开源Harness!AI自己爆改AI
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号