8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测

机智流 2026-09-16 22:25

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图1

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图2

在日常的机器人操作场景中,无论是机械臂组装电子元件、人形机器人整理家居,还是服务机器人为用户递取物品,都需要同时完成三项核心任务:先准确感知周围环境的空间结构与语义信息,再结合任务目标生成合理的动作序列,最后还要预判动作执行后环境的变化。此前的相关模型往往只能覆盖其中一到两项能力,或是通过多模块拼接的方式实现全流程,模块间的适配成本高,也难以做到信息的充分联动。

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图3

论文标题:PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models

论文链接:https://arxiv.org/pdf/2609.14973.pdf

项目主页:https://deepcybo-physai.github.io/PhysBrain-1.5

HuggingFace地址:https://huggingface.co/collections/DeepCybo/physbrain-15

评估套件地址:https://github.com/DeepCybo-PhysAI/PhysBrainEvalKit

研究背景

物理智能的核心是智能体与环境的交互循环:智能体观测周边环境,解读空间关系与任务目标,预判动作执行的结果后向环境施加动作,变化后的环境又会提供新的观测信息,支撑后续的理解与行为决策。一个成熟的物理基础模型,需要为这个循环的每个环节提供可复用的能力支撑。

此前相关研究沿着两个方向推进:

  • 通用视觉语言模型具备较强的视觉理解、语义知识储备和指令遵循能力,但缺乏空间推理、动作生成等面向物理交互的能力;
  • 专用机器人模型虽然可以完成特定的动作生成或规划任务,但语义理解能力薄弱,泛化性有限。

近年出现的具身基础模型开始尝试整合多类能力,但很少能将环境理解、动作生成、未来状态预测三类核心任务纳入同一个统一的学习框架,实现信息的充分联动和联合优化。

针对这一现状,DeepCybo团队推出了PhysBrain 1.5,这是一款统一的物理基础模型,能够同时支持物理环境理解、动作生成和未来状态预测三类核心能力,在小参数规模下实现了与头部闭源模型相当的性能表现。

核心设计思路

PhysBrain 1.5基于Qwen3-VL Instruct 8B版本构建,核心设计思路是将语言回答、末端执行器运动、稠密视觉目标全部编码为离散序列,通过统一的自回归接口完成三类任务的联合学习。三类输出共享大语言模型的backbone、词元嵌入和输出头,团队在原有语言词表的基础上,额外扩展了专门的动作词元和视觉词元,形成统一的多模态词表。

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图4
图 2:PhysBrain 1.5 模型架构图,展示了基于预训练视觉语言模型,通过统一的语言-动作-视觉词表、共享的 backbone、词嵌入和输出头,联合学习具身理解、动作生成和视觉状态预测的整体框架

具身理解能力的实现没有新增独立的感知头,而是保留了基础视觉语言模型的通用图像、视频理解接口,通过具身相关的监督数据增强相关能力,根据任务的不同,同一个自回归解码器可以输出自然语言回答或者结构化的空间目标,语义识别、空间定位、时序推理能力都通过统一的接口输出,可以为动作生成和未来状态预测提供场景层面的信息支撑。

动作生成方面,团队将人类和机器人的动作都统一表示为末端执行器的短轨迹,每个轨迹包含未来16步的动作,用相对位置和6D旋转表示空间位姿,再通过ActionPiece分词器将连续的轨迹编码为离散的动作词元。针对不同数据源动作坐标系、控制频率不一致的问题,团队没有强行将所有动作转换到统一的全局坐标系,而是保留各数据源的原生坐标系,将当前观测之前的16步动作作为局部运动上下文输入模型,让模型自动推断当前本体的动作规则,实现动作轨迹的自然延续,大幅降低了跨数据源的处理成本。

未来状态预测方面,模型将未来的物理状态表示为空间对齐的RGB图像、深度图和机器人掩码组合,三个模态的输入都通过共享的VQ-VAE编码为离散视觉词元,再按照空间位置交错排列为序列,保证三个模态的空间对应关系。推理阶段生成的视觉词元序列可以解码为对应的三类输出,完整呈现未来的场景外观、空间结构和机器人位姿。

三类任务使用同一个掩码下一词元预测目标进行优化,不同任务通过掩码选择需要监督的目标词元,实现共享参数的联合更新,三类任务的监督信号可以形成互补,感知类任务提供语义和空间上下文,动作类任务引入运动先验,未来预测类任务强化物理变化规律的学习。

两阶段数据构建方案

PhysBrain 1.5的训练分为物理感知预训练和具身监督微调两个阶段,两个阶段都同时覆盖感知、动作、未来预测三类任务的监督数据。

物理感知预训练阶段的所有具身监督数据都来自人类交互视频,团队整合了公开的Ego4D、EgoExo4D、Xperience-10M等数据集,以及自研的PhysBrain-Human、PhysBrain-Ego360数据集,覆盖第一视角、第三视角、全景视角下的日常活动、工具使用、人机交互等场景,总时长约3万小时。团队将长视频按任务边界分割为独立的任务片段,从中构建三类训练数据:2430万条物理感知数据,包含结构化标注、描述、问答对;3120万条人类动作数据,包含从视频中恢复的手腕末端执行器轨迹;2680万条未来状态数据,包含交互前后的场景RGB、深度图和人体掩码。此外预训练阶段还加入了1490万条通用语言和视觉语言指令数据,保证模型保留通用多模态能力。

具身监督微调阶段混合了高质量人类交互数据、真实机器人轨迹和仿真交互数据,覆盖单臂、双臂、仿真等多种平台的操作任务。其中包含661万条具身理解数据,覆盖空间感知、多视图理解、推理规划、空间定位等能力;540万条动作数据,总时长约3114小时;120万条未来状态数据,对应机器人场景下的交互后状态。此外微调阶段也加入了100万条通用多模态指令数据,避免模型在适配具身任务的过程中丢失通用能力。

评估结果与性能表现

团队从四个维度对PhysBrain 1.5进行了全面评估,分别是具身理解能力、通用多模态能力、动作轨迹生成能力和未来状态预测能力。

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图5
图 1:PhysBrain 1.5 在具身基准集上的整体性能表现,8B参数版本整体得分72.5,在所有开源模型中排名第一,性能与头部闭源系统相当

具身理解能力评估覆盖了28个主流基准,分为视觉空间感知、空间与多视图理解、具身认知与规划、空间定位与可供性、视觉轨迹推理五个类别。结果显示,PhysBrain 1.5的平均得分为72.5,是目前开源模型中的最高水平,比此前最强的开源基线高出6.5分,在14个基准上拿到开源第一,24个基准进入开源前两名。值得注意的是,8B参数的PhysBrain 1.5整体性能已经非常接近头部闭源模型,仅比Gemini 3.6 Flash低0.5分,比GPT-6 Astra低0.8分,比Claude Opus 5高出4.6分,具备很强的竞争力。

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图6
图 3:PhysBrain 1.5 具身理解的定性示例,覆盖视觉空间感知、3D与多视图理解、具身推理规划、空间 grounding 与可供性、视觉轨迹与推理等场景,输出包括语言回答、空间坐标、路径点序列等形式

通用多模态能力评估覆盖了12个主流的图文、视频理解基准,结果显示PhysBrain 1.5的整体表现与底座模型Qwen3-VL Instruct 8B相当,在图表理解、细粒度识别等任务上还有小幅提升,说明具身训练没有损失模型的通用能力,反而强化了部分推理相关的能力。

超越理解的物理交互能力

除了理解类任务之外,PhysBrain 1.5还具备动作轨迹生成和未来视觉预测的能力,覆盖了物理交互循环的全环节。

动作生成方面,给定当前RGB观测、任务指令和前序16步的真值动作序列,模型可以自回归生成接下来16步的动作词元,解码后即可得到末端执行器的轨迹。在训练分布内的场景中,模型预测的轨迹和真值轨迹的方向、形状高度吻合;在训练未覆盖的分布外场景中,模型也能预测出符合任务逻辑的大致运动趋势,不需要针对特定机器人做额外的微调。

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图7
图 4:动作轨迹预测的图像平面可视化,实线为真值轨迹,虚线为模型预测轨迹,所有示例均来自训练未见过的测试集
8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图8
图 5:动作轨迹预测的3D可视化,蓝色为真值轨迹,橙色为模型预测轨迹,上半部分为分布内示例,下半部分为训练未覆盖的分布外场景示例

未来状态预测方面,给定当前RGB观测和任务指令,模型可以预测1秒后的场景状态,输出空间对齐的RGB图像、深度图和机器人掩码。预测结果可以保留原场景的整体布局,同时呈现符合任务逻辑的场景变化,三个模态的输出空间一致性较高,能够完整呈现未来的场景外观、 workspace几何结构和机器人位姿。

8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测图9
图 6:未来视觉预测的定性结果,每一行从左到右分别为当前RGB输入、预测的未来RGB图像、预测深度图、预测机器人掩码,预测跨度为1秒

总结与展望

PhysBrain 1.5验证了将具身理解、动作生成、未来状态预测纳入统一自回归框架的可行性,通过从大规模人类交互视频中学习物理先验,再结合多来源的机器人数据微调,可以在小参数规模下实现与头部闭源模型相当的具身能力,同时保留通用多模态能力。这一研究也证明了从人类交互经验中学习,是发展物理智能的有效路径。

后续团队将继续扩大训练数据的规模,扩展模态覆盖范围,加入更多真实交互的经验,进一步提升模型的物理智能水平,支撑更复杂的机器人交互场景落地。


> 本文由 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 通感
more
打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了
绍兴移动:将携【5G-A通感一体基站】,亮相2026国际低空经济博览会
《山东省低空信息基础设施专项规划》印发,构建“空天地一体、通感算智融合”的低空通信网络数字基础设施
【报告】低空经济专题三:2025年智能低空通感网络白皮书(附PDF下载)
8B参数物理基础模型PhysBrain 1.5:打通感知、动作与预测
通感交织拓展AIoT智能边界,一体化融合加速万物智联演进
通感一体爆发!高精度定位市场大洗牌
福建:以应用场景拓展为核心,加快探索通感融合等技术在低空经济领域的应用;浙江宁波:到2027年,低空飞行量达到20万小时/年
WRC 2026现场直击|不只让机器人“摸得到”,帕西尼想打通感知、数据与执行
中国移动通信联合会《通感一体低空网络 参考架构》等团体标准参编单位征集
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号