中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱

量子位 2026-09-13 17:14
允中 发自 凹非寺
量子位 | 公众号QbitAI

物理AI,正在成为2026年全球人工智能最关键的赛道,也是未来之争。

大模型用了三年时间把“会说话、会思考、会工作推到极致,但当行业开始追问“模型能不能走进真实世界、能不能动手”时,一扇新的大门被推开。

Google DeepMind于2026年7月30日发布Gemini Robotics 2,基于Gemini 3.5 Flash的“具身推理”大脑ER 2,试图让机器人“边看视频边想下一步”。近期,OpenAI GPT-6引发行业热议,推理、编程与多模态理解能力再度突破,把通用智能的天花板又推高了一截。

Robocurve的一次实验,又将“大语言模型是否能在真实世界中行动”这个问题摆在了台前。该实验将GPT-6 Astra部署在真实机械臂上,在20次“积木放入碗”任务里,GPT-6 Astra完成19次,而Claude Fable 5.1仅完成8次。

这次实验表明,基座模型能力大幅提升之后,也可以在具身任务上取得可观的表现。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图1

但顶尖大语言模型在具身操作上仍有鸿沟。Robocurve同一套测试的另一面很说明问题:在“蓝色拼图块对位插入凹槽”这种毫米级精细任务上,GPT-6 Astra的成功率从95%掉到10%。

大模型积累的通用理解,可以跨越“看懂”到“粗动作”的鸿沟,却仍在“精细接触、精准插入”面前止步。

这正是全行业共同的瓶颈,也是后来者真正的机会窗口。

就在这个关口,一家从北京海淀中关村走出来的中国公司——深度机智,交出了自己的答卷。

2026年9月9日,深度机智正式发布物理基座模型PhysBrain 1.5在28项公开基准上取得72.5的综合均分位居参评开源模型首位,与头部闭源模型GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距,已收窄到1分以内

它没有去和巨头比拼参数规模,也没有去追逐各类技术热点,而是用一条“人类学习”的技术路线,把物理智能基础模型能力作为核心战略方向持续深耕。

GPT-6 Astra的机械臂实验恰恰印证了,把基础模型做扎实,才是决定物理智能上限的关键变量,这正是深度机智长期践行的方向。

PhysBrain 1.5是深度机智在这一战略方向上持续投入的阶段性成果。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图2

在28项基准测评中,PhysBrain 1.5取得14项开源第一,10项位列开源第二。

它不是在某一个单项上刷出了高分,而是在空间理解、动作生成、未来状态预测的完整能力链条上,全线跻身开源模型前列。

这意味着PhysBrain 1.5提供的不只是“更聪明的感知”,而是机器人从理解环境到执行任务的系统性基础能力

PhysBrain 1.5全面开源,技术报告、2B与8B模型权重、评测工具包,全部向社区开放,让更多全球开发者基于同一套基座,共同探索物理智能的下一步。

Project Page: https://deepcybo-physai.github.io/PhysBrain-1.5
Hugging Face: https://huggingface.co/collections/DeepCybo/physbrain-15
Evaluation Kit: https://github.com/DeepCybo-PhysAI/PhysBrainEvalKit

开源第一,比肩顶尖闭源:中国物理AI基座模型站上全球前沿

物理基座模型的评测向来是件难事。评估PhysBrain 1.5的,是一组28项公开基准,按五大能力维度组织——视觉空间感知、空间与多视角理解、具身认知与规划、空间指向与可供性、视觉轨迹推理。

在这套多维测试中,PhysBrain 1.5-8B拿下72.5的综合均分,排开源阵营第一

从结果上看,PhysBrain 1.5-8B以72.5的综合均分拿下开源模型榜首,并在28项中的14项取得开源最佳,10项位列开源模型第二;相较当前最强开源对手Hy-Embodied-VLM-1.0(66.0)高出约6.5分,较RynnBrain 1.1(63.1)高出9.4分。

更受关注的是其整体水位:72.5分这一成绩,与GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距已收窄到1分以内。在具身智能的核心能力上,深度机智已经与全球最前沿的闭源模型站在同一水位线上。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图3

分项成绩同样能说明问题。

在RoboSpatial-Home空间理解取得73.9分,意味着模型能够在真实场景中准确理解物体之间的空间关系,这是机器人在真实环境中操作的前提。

Part-Affordance可操作部位识别拿下84.0分,说明模型不仅能理解“物体是什么”,更理解“这个物体的哪个部位可以被操作、应该怎么操作”,这是从“识别”走向“交互”的关键一步。

RoboRefit视觉目标定位获得89.8分,则表示模型能够在复杂场景中精准找到并锁定目标物体,为后续动作执行提供了可靠的视觉锚点。

这些成绩说明了PhysBrain 1.5的领先并非局部优势,而是一种覆盖感知、空间、推理、规划与定位的系统性能力领先。这也标志着具身基座模型的竞争,正在从单项能力的较量,进入系统能力的对决。

比8B榜首成绩更值得注意的,是PhysBrain 1.5并没有只做一个“大版本”。

深度机智同步开放了PhysBrain 1.5-2B与PhysBrain 1.5-8B两档参数规模。在项目页最新公布的同一套28项测试中,PhysBrain 1.5-2B取得66.6分。

按照官方评测规则,2B版本仅作为参考,不参与开源排名;但如果只比较数值,它的综合得分已经超过表中所有其他非PhysBrain开源参评模型,包括30A3B规模的Hy-Embodied-VLM-1.0(66.0)、8B的Embodied-R1.5(64.9)和9B的RynnBrain 1.1(63.1)。

这让2B版本呈现出另一种价值:它不是8B模型的“展示性缩小版”,而是在显著降低参数规模之后,仍然保留了相当完整的具身理解能力。

对于开发者而言,这意味着更低的试用、部署和二次开发门槛;对于PhysBrain而言,则意味着同一技术路线开始同时覆盖“性能上限”和“轻量可用”两个方向

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图4
HF社区用户在线进行模型demo测试,
demo网址:https://huggingface.co/spaces/hugging-apps/physbrain1-5-8b-demo

两个版本现均已上线Hugging Face,为社区验证与下游部署提供入口(https://huggingface.co/collections/DeepCybo/physbrain-15)。

在上线仅3天时间内,PhysBrian 1.5就获得了超过3k的下载量,为全球开发者社区提供了媲美顶尖闭源模型的物理智能基座能力。

从人类经验到物理智能循环:Ego360与Physical Loop的理念闭环

72.5分是一个数字成绩,但在数字之外更值得讨论的,是PhysBrain 1.5选择的“路径”——被深度机智称为“Physical Loop”物理智能循环的统一架构

深度机智把物理智能的本质归纳为一个循环:观察世界、理解空间与任务、判断动作后果、执行、再依据新的观察修正下一步,即Physical Loop

真正的物理智能,不是单点能力的堆砌,而是这个闭环能够连续、稳定地运转,并根据反馈自我修正。

因此PhysBrain 1.5将“观察世界—理解空间与任务—判断动作后果—执行—反馈修正”这五步原本分散在不同模型里的能力,重新组织进了同一个基座模型。

过去,物理AI系统普遍是“理解模型+动作模型+预测模型”拼接,拼接意味着每个子模型都要单独训练、单独调优。

深度机智的判断是:要做出能“在世界中行动并自我修正”的底座,必须先回到这个闭环本身,把能力重新组织起来。PhysBrain 1.5,正是围绕这一闭环重建模型本身。

模型如何学会这个循环?如果训练数据只告诉模型“世界长什么样”,却没有保留下“人在什么情境下采取什么动作,以及动作之后世界发生了什么变化”,那么再统一的模型,也很难真正学到物理交互的规律。

这正是深度机智把“人类经验”放在数据起点上的原因。

深度机智认为,人类经验天然地嵌入这一循环:个体在真实世界里不断感知情境、产生意图、采取行动,并根据结果调整后续行为;人类的智能,正是在这种反复交互与修正中逐步生长出来的。

团队在论文中写得很直白:“物理感知的预训练监督,完全来自人类交互视频”。在深度机智的技术路线里,人类经是物理智能循环的第一性来源

支撑这一技术判断的,是深度机智构建的Ego360人类全景真实数据体系

它通过全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音,使一段交互不再只是孤立的“动作片段”,同时还具有更连续的任务、动作与状态变化上下文。

这种连续性很重要。模型不需要学习“手应该往哪里动”,还需要知道当前处于什么情境、为什么要执行这一步,以及任务推进后环境如何变化

这也是人类交互视频相对于碎片化操作数据更核心的价值。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图5

前不久在WAIC 2026(2026世界人工智能大会暨人工智能全球治理高级别会议)的具身智能空间交互论坛上,深度机智创始人陈凯博士就以《人类学习范式:物理通用智能远征的起点》为题,公开系统阐述了以人类真实交互经验支撑物理通用智能的技术判断,并展示了围绕全景人类数据展开的实践进展

9月10日,国家数据局党组书记、局长刘烈宏主持召开具身智能座谈会。深度机智受邀出席,并展示了人类全景真实数据与情境数采(In Context Data Collection)范式。

能够参与这场闭门座谈,既是对深度机智数据路径的认可,也意味着一家企业的技术选择,上升为行业基础设施层面的参考坐标。

从2025年12月提出情境数采范式,到2026年7月全景数采范式的迭代,深度机智在半年多时间里完成了数据采集能力的迭代,并同步推进大规模人类真实数据采集与模型驱动的全自动标注管线。

PhysBrain 1.5进一步将人类交互视频真正纳入Physical Loop的预训练框架,这条路线开始从判断和理念,变为大规模数据运营和模型能力

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图6
2026年7月,深度机智创始人陈凯在WAIC论坛发布全景数采方案

理解、动作、预测:一个基座里的三大能力

如果说Physical Loop回答的是“物理智能应该如何运转”,那么PhysBrain 1.5接下来解决的,就是“这些能力如何在一个模型里被共同学习”。

具体来说,它基于开源基础模型,将语言回答、空间坐标、动作轨迹、未来画面与深度预测,全部纳入同一套训练框架,不需要为每种能力单独搭建模块或设计专门的输出层,让模型在“看懂世界”“生成动作”和“预判结果”之间形成内在一致性,而非松散拼接

由此,具身理解、动作生成与未来状态预测,不再是三个彼此独立的模型,而能够在Physical Loop中彼此约束、协同演进。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图7

一是具身理解:知道“此刻发生了什么”

PhysBrain 1.5保留了VLM图像与视频理解的接口,通过具身监督为其注入物理感知能力。训练数据覆盖基础视觉空间感知、3D与多视角空间理解、具身认知推理与规划、空间指向与可供性,以及视觉轨迹推理,五大能力。

这意味着模型不仅“看到”画面,还带着空间结构、物理常识和任务意图去理解场景。它输出的不只是语言描述,还包括结构化的空间坐标与轨迹目标,这些正是后续动作生成所需的关键锚点。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图8

二是动作生成,指向的是“接下来该怎么做”

PhysBrain 1.5模型通过Human-as-Humanoid管线,从人类视频中学习手腕的运动方式,将其转化为机器人可以执行的动作。给定当前画面、任务指令和之前的动作历史,模型能够直接生成接下来一系列的动作步骤。

更重要的是,这套动作能力不绑定特定机器人,同一份模型可以适配不同形态、不同控制频率的机器人,无需为每台机器单独训练。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图9

三是未来状态预测:预见“做完之后会发生什么”

PhysBrain 1.5在给定当前画面与任务指令后,可以预测1秒后的物理状态,并同时输出三种模态:RGB图像、深度图和机器人掩码。

这三者空间对齐、彼此关联,共同描述一个完整的未来场景。这种“先想象结果、再采取行动”的能力,让模型在闭环中拥有了前瞻与纠错的依据,动作尚未执行,它已能预判环境将如何变化。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图10

三项能力被纳入同一个模型、同一套训练框架,不再各自独立。理解提供场景证据,动作生成延续物理交互,未来预测给出前瞻信号,三者互为输入、互相约束,共同支撑Physical Loop的连续运转。

这也标志着物理智能的构建方式,正在从“拼装专用模块”走向“训练统一基座”。

Human-as-Humanoid:人类动作进入模型,再走向机器人

PhysBrain 1.5还有一个很容易被忽略的关键问题:人类视频中的动作,究竟如何变成模型能够学习、机器人能够使用的动作表示?

这里连接人类数据与动作模型的,正是深度机智此前提出的Human-as-Humanoid框架

在PhysBrain 1.5的训练过程中,团队通过Human-as-Humanoid的转换框架,实现人类行为数据从“可观看的记录”到“可训练的资源”的转化,让人类行为数据成为动作建模可持续、可规模化的燃料来源。

这正是human-centric data进入action modeling的关键桥梁。

而在此前的Human-as-Humanoid研究中,这条转换链路已经进一步延伸到自研的60自由度拟人体机器人Prime U上,对“人的动作经验能否迁移到机器人”进行了真机验证。

在研究中,其原始示范吞吐量达到传统遥操作的4.8至7.2倍,并在部分任务上实现了从人类数据到真机执行的零样本迁移,模型不必看到特定机器人本体的示范,就能在该本体上执行相应任务。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图11

从这里再回看深度机智的全栈布局,它的逻辑就变得清晰:Ego360持续积累人类经验,PhysBrain基座模型以这些数据不断拓展能力边界,Human-as-Humanoid承担人类动作与机器人动作空间之间的转换,Prime系列本体则在真实交互中提供验证与反馈。

数据、大脑与本体,被组织在同一条主线上持续演进。这意味着深度机智已经独立完成了“从模型能力到本体验证”的完整闭环。

这种全栈能力,不仅意味着更快的迭代速度和更低的协同成本,更意味着一种系统性的壁垒。

提前一年的路线定力:当全球共识追上深度机智的判断

回看这场竞赛,多数参与者默认了一个隐含前提:物理智能是“大模型顺手能做好的延伸”,先把语言能力推到极致,再给模型接上动作输出,问题便解决了。

GPT-6 Astra的机械臂实验让我们看到了通用基础模型的提升,可以转化为物理行动能力,但其在精细操作上的局限同样说明仅靠语言模型的通用能力并不足够,物理智能需要专门的基础模型。

这侧面印证了深度机智一直以来的战略判断:物理基座模型不是短期风口,而是一项需要长期投入的布局,先想清楚“物理智能究竟该从哪里长出来”,再让数据、模型与本体围绕这一长期目标持续组织、协同推进

把时间线往回拨一年。2025年10月10日,深度机智就发布了《源于人,超越人》技术路线图,明确把“人类学习”作为物理通用智能的核心研发路径,并围绕“以人类数据为起点、以动作为中心建模、身体为AI设计”三大战略,开展数据、模型、本体全栈布局。

在深度机智的逻辑里,物理智能不可能靠把互联网文本“翻译”成动作获得。人是在真实世界里,通过一遍遍“看见—尝试—被反馈修正”长出操作能力的,人类是物理智能最好的老师。

当时,行业对“用人类第一视角数据训基座模型”远未形成共识;而2026年PI、NVIDIA、Dyna乃至学术界的集体转向,恰恰在一年后验证了深度机智一年前的判断“人类经验是物理智能的第一性来源”。深度机智不是这一趋势的追随者,而是它的先发者。

这种先发,不只是判断上的领先,更是工程上的积累。回看PhysBrain的迭代节奏,2026年3月27日PhysBrain 1.0在中关村论坛发布,2026年9月9日PhysBrain 1.5跟进,半年一次的高频迭代,意味着这家公司正一步步把路线图走实,建立起稳定的研发闭环与工程能力。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱图12

Google DeepMind的Gemini Robotics、Physical Intelligence的π系列、Figure AI、NVIDIA Cosmos 3……全球头部机构正沿不同路径加速布局,物理智能的研发投入显著提速。

深度机智在人类学习路线上的早期布局所形成的先发积累,与数据、模型、本体全栈协同的系统能力相结合,正在成为全球物理智能竞争中一项难以复制的关键优势。

扛起行业发展重任的“黑马”

全球开源第一,只是PhysBrain 1.5在这一时间点上交出的成绩单。背后更值得关注的,是它在物理AI这一仍处早期的赛道上展示出来的三种能力:

一是架构的统一性

深度机智把“理解、动作、预测”收进同一个自回归主干,让物理智能循环真正在模型内部闭环,而不是靠多个子模型拼接;

二是数据路线的差异化

深度机智率先以大模型方法论,把人类第一视角数据作为物理常识来源,在行业里推进了稀缺的数据基建;

三是工程落地的全栈性

深度机智从Ego360数采、PhysBrain基座、Prime系列本体到Human-as-Humanoid转换框架,每一环都自己把控。

物理智能的终局,不是一个会回答的模型,而是一个能在真实世界里感知、行动并不断自我修正的闭环

PhysBrain 1.5清晰地标志着:在全球物理AI基础模型的竞争中,中国团队已经凭借人类学习路线与全栈布局,走到了全球竞争的第一梯队

对行业而言,这是一个全面推动中国物理AI进步的里程碑。

*本文系量子位获授权刊载,观点仅为原作者所有。


一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源
more
微信偷偷改版!这是在为AI铺路?
腾讯研究院AI速递 20260914
算力之后,存储成为AI应用落地的“胜负手”
AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey
AI巨头罕见“踩刹车”:当能力增速超越安全防线,竞争逻辑正在重构
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
一文看懂 AIDC 产业链:从算力芯片到液冷系统
15999元!绿联发布旗舰AI NAS,AI Agent等来「新家」
不缺钱,缺人!四位CEO通过36氪发出亲笔招贤信:把AI与机器人,送进真实世界|人才留言板
Anthropic 舞剑,意在国模|CEO 万字长文疯狂 打压 中国 AI,满是偏见
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号