具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案

具身智能之心 2026-08-21 20:58

点击下方卡片,关注“具身智能之心”公众号


WRC上,极佳举办了一个论坛,主要是讲通用世界模型。

关于WM在物理世界中理解、生成、预测和行动等。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图1

期间,提出了一个很有意思的L1-L5分级。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图2

看到这里,我们也想问,世界模型现在发展的到底怎么样了?

而这个,可以从他们近日发布的GigaBrain-0.7来看。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图3
在 GigaBrain-0.7 中,世界模型进化为具身系统的预判器,成为模型性能提升至关重要的 System-3;同时 GigaBrain-0.7 也在回答:具身基础模型,究竟能不能 Scaling 起来?
不过要想给出合格的答案,需要先弄清具身 Scaling 的两项要求:一端是足够大、足够多样的数据,另一端是能把这些经验转化为理解、规划、动作和纠错能力的模型。行业一直在等待的“具身 GPT-3 时刻”,也绕不开这两件事。

今年二季度,极佳视界就已经把自己的答案收敛为一套“双金字塔”框架:五层数据金字塔,解决模型从哪里获得足够多的物理世界经验;三层算法金字塔,解决这些经验如何被理解、对齐并持续强化。

这次,GigaBrain-0.7 是这套框架第一次比较完整的真机验证。

据极佳视界披露,在相同真机评估基准下,GigaBrain-0.7 取得了领先于多款全球头部开源模型的结果。


01.

GigaBrain-0.7 这次给的结果


  1. System-3 进入决策回路:把世界模型放进机器人的实时决策回路,让机器人“先预演判断,再执行动作”

  2. 基模开箱即用:“双塔”体系驱动预训练模型实现“One Model, Many Tasks”的基模能力。

  3. 横向评测优势明显:不仅在“具身原生的自研本体Maker H01”上任务成功率展现出明显优势,而且在仿真和真机高度一致的RoboColiseum平台 4 项评测中均排名第一。

  4. 真机任务一镜到底:据官方材料,完成了超 20 分钟、超 10 个任务的长程复杂精细操作一镜到底。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图4

真机评测优势明显

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图5

仿真评测均排名第一

模型即将开源,感兴趣的读者可以留意项目页。

  • 项目主页:https://gigaai.cc/blog/gigabrain07

  • 技术报告:https://arxiv.org/abs/2608.15875

  • 代码仓库: https://github.com/open-gigaai/giga-brain-0 (Coming soon)

  • 模型地址:https://huggingface.co/open-gigaai/models (Coming soon)




02.

从双金字塔到真机结果


GigaBrain-0.7对“双金字塔”架构每一层做了系统验证,并在相同真机评估基准下,取得了领先于多款全球头部开源模型的结果。

相比单纯的版本迭代,极佳正在把“数据+算法”的双金字塔框架推向大规模工程实践和真机泛化验证。


03.

先看算法:GigaBrain-0.7 的三层金字塔


GigaBrain-0.7把三层算法金字塔放进同一个系统,在模型架构层面覆盖了从物理常识理解和预判、到高精度连续动作控制、再到闭环经验强化的完整链路。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图6

GigaBrain-0.7架构图


第一层


世界模拟(World Simulation)——让 VLA 具备物理常识和预判能力


VLM物理常识理解和规划:


以大规模视觉语言模型VLM(System-2)为大脑主干,深度理解物理世界的常识规律、因果逻辑与高层任务规划。同时通过原生时空交互注意力机制(Temporal-Spatial Block),在空间视觉Token中引入了相对位置编码与相对时间编码,尝试补上具身任务中的长程时序推理短板。

根据高层指令,自主推理规划执行

同一个任务,根据高层指令不同,得到不同的自主推理规划和执行结果

GigaBrain-0.7 任务规划效果

时序训练前:状态有重复的任务会陷入死循环

时序训练后:状态有重复的任务能够顺利退出

GigaBrain-0.7 时序训练前后对比


World Model 未来变化预测和判断:


极佳视界把这一层称为 System-3:用此前发布的 GigaWorld-1 预测物理世界接下来可能发生什么,补上传统 VLA 缺少预判能力的问题。

基于GigaWorld-1的System-3可同步生成当前动作的未来价值评估(Action Value Feedback)和未来关键进展的视觉图像预测,这些未来表征被编码并即时补充至GigaBrain-0.7的输入prompt中,为机器人提供了“预演未来”的能力,提升了高难度、长程长尾任务的真机执行成功率和完成速度。

World Model 预测与困难任务执行真机视频


第二层


动作对齐(Action Alignment)——基于MoT和Flow Matching的多本体动作生成


跨本体参数共享(Shared Action Expert):


System-1基于MoT架构,采用Flow Matching范式生成高质量连续动作。在Action Expert模块中,不同机械本体共享绝大部分Transformer核心参数,仅通过本体类型ID(Robot ID)路由至对应的输入/输出投影层,推动了异构本体间的操作知识迁移与共享。


软知识隔离(Soft Knowledge Insulation):


在Action Expert与VLM视觉主干之间设计了Soft Knowledge Insulation机制,既保障了VLM主干强泛化的通用任务理解与规划能力,又尽量提升专用机器人操纵的精度。


端到端联合预训练(Unified End-to-End Pretraining):


引入随机Prompt动态改写机制,配合细粒度的Subtask与VQA标注,在统一架构内实现Subtask语言规划、VQA视觉理解、离散动作桥接与连续动作生成的一次性端到端联合预训练,提升预训练效率和动作对齐能力,也增强了模型在未知场景中的泛化性与指令遵循能力。


第三层


经验强化(Experience Reinforcement)——从离线经验学习到在线持续强化


GigaBrain-0.7的经验强化管线分为三个步骤:

  • 在监督微调阶段,团队使用少量专家数据训练,让预训练模型在复杂域外任务上具备一定的成功率;

  • 进入离线训练后,上一阶段模型自主 Rollout 采样的数据和人类在环数据被加入训练,让模型具备错误恢复能力、提升成功率的同时,还能够对任务的完成进度和质量进行评估;

  • 到在线训练阶段,团队基于模型评估能力构建稠密奖励,并通过人类在环的方式进行在线强化学习,进一步提高模型在精细操作上的成功率。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图7

GigaBrain-0.7-RL流程图


离线经验学习:


模型执行真机任务时,团队会实时记录 Rollout 数据,并人工标注轨迹成败、进度快慢、质量高低。基于这些人类经验,模型再同步进行 Value 估计和 Policy 更新。这样既让模型具备错误恢复能力,也能评估任务的完成进度和质量,进而更高效地提升大部分任务的完成能力。


在线持续强化:


对于高难度精细复杂操作任务,经过离线强化学习后的模型,也未必能稳定达到 100% 成功率,因此还可以进一步通过人类在环的方式进行在线持续强化学习,通过边执行、边修正、边更新的方式,使得动作轨迹越来越精细、任务完成度越来越高,直到稳定达到 100% 成功率。


04.

再看数据:五层数据金字塔怎么落地


如果说算法决定模型怎么学,数据决定的是它能学到多大边界。GigaBrain-0.7背后是庞大、高质量的跨模态数据集。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图8


海量互联网数据


针对机器人操作场景,据悉,极佳自研了GigaData Platform数据平台,对互联网海量数据进行深度清洗与细粒度结构化标注。不仅构建了近3亿对“图像-语言”数据集,强化了 System-2 在空间理解、目标定位、交互预测及轨迹推理的底层能力;同时还构建了数万小时的视频数据,成为训练 System-3 的数据支撑。


传感器同构的真人数据


同构采集硬件全栈自研:极佳还自研了与双臂人形本体Maker H01传感器完全同构的UMI(手柄示教)与EGO(第一视角头戴)采集设备。

全流程质量闭环:为了保证真人数据质量,团队在硬件设计、数据采集、数据清洗和训练数据构建环节做了多重控制,最终清洗得到近11200小时高质量真人数据。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图9

UMI数据处理流程

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图10

EGO数据处理流程

数据效率也值得看:在数据一致性和数据质量足够高的前提下,仅需300条UMI数据进行后训练,即可让Maker H01人形本体在全新任务中实现自主操作。

真人采集

自主运行


生成与仿真数据


依托GigaData Platform,结合视频生成与高保真物理仿真,极佳构建了超5000小时清晰的高质量长尾场景数据,缓解真机采集的安全和成本压力。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图11

GigaData Platform数据生产流程图


真机数据


具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图12

基于轮臂人形机器人Maker H01与轮臂机器人Maker M01,以及部分开源真机数据,最终清洗得到20500小时的高质量真机数据。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图13

真机数据处理流程


05.

真机表现:和头部开源模型拉开差距


“数据+算法”双金字塔的深度融合,赋予了GigaBrain-0.7较强的具身操控能力。


Data Scaling验证具身Scaling Laws


能否 Scaling,是具身智能绕不开的问题。它关系到具身能不能复刻大语言模型那条增长曲线,也关系到物理 AGI 叙事到底有没有工程支点。

GigaBrain-0.7从多个角度给出了一个倾向性答案:具身智能可以被 Scaling。

先看图一:从预训练规模和域外任务预测误差的关系来看,少量数据随着预训练的进行存在过拟合现象,但随着数据量的不断提升,过拟合不仅逐渐缓解,且当数据量到达一定量级时,模型涌现出越来越强的泛化性。

再看图二:从预训练数据类型和真机成功率的关系来看,增加UMI和Ego等数据可以直接提升真机效果,表明无本体数据是可以被Scaling的。

第三个信号来自图三:预训练数据量和基模真机成功率的关系显示,我们对GigaBrain-0.7全量数据预训练的不同阶段的模型进行测试,发现随着预训练的不断进行,真机成功率也不断提升,且最终无须单任务后训练微调,一个预训练基模便可实现多任务的百分之百成功率。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图14
具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图15
具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图16


System-3 提升任务完成能力


传统VLA在做动作之前,不具备对物理世界未来变化的预测和判断能力,导致任务完成度和泛化性存在瓶颈。GigaBrain-0.7引入System-3的概念,基于World Model实现World Value Model,让VLA在做具体动作之前先对未来动作做推演和判断,不仅提升了执行任务的成功率,而且任务完成得分和完成速度也明显提升。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图17


开箱即用的基模能力


GigaBrain-0.7的基模,做了完整的评测,包括分能力评测(语言跟随能力、复杂操作能力)、分机型评测(AgileX PiPER双臂机器人、Maker H01人形机器人)、分范围评测(域内、域外)、分任务评测(24个任务全面评估)。

GigaBrain-0.7的基模展现出了比较突出的通用性,并涌现出了不错的泛化性,开始呈现出“One Model,Many Tasks”的具身基模应该具备的“开箱即用”的能力。


基模语言跟随能力:

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图18

基模复杂操作能力:

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图19

Benchmark 结果领先

真机评测:

在相同真机评估基准(AgileX PiPER & Maker H01)下,GigaBrain-0.7 与国际主流及行业头部模型进行了横向后训练对比,真机效果取得领先。特别是在“具身原生的自研本体Maker H01”上任务成功率展现出明显优势。

  • 后训练语言跟随能力

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图20
具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图21
  • 后训练复杂操作能力

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图22
具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图23

仿真评测:

这里挑选了仿真评测和实机部署相关性高度一致的RoboColiseum平台进行了评测。经过平台 4 个方面评估,领先于全球头部开源模型和闭源方法,并在 4 个分项中均排名第一。

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图24


06.

更多真实场景演示


家庭场景长程复杂任务一镜到底展示

工业场景精细操作全流程一镜到底展示


END

 推荐阅读 :

具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案图25

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
摩尔线程全功能GPU打通具身智能训练闭环,张建中详解“一体化AI工厂”布局
数据标注狂飙:Micro1年营收激增五倍,AI训练数据的“军备竞赛”与地缘隐忧
AI智能体如何真正落地?AGNTCon + MCPCon China揭晓九大技术路径
联想ThinkPad E14 Gen 8北美上市,锐龙AI 7加持起售约7500元
“AI焚书”,其实是个误解
2499元!雷鸟iO AI眼镜发布:没摄像头和扬声器,但更可能卖爆
DeepSeek 上线多模态,我用它做了《牛来》小游戏|AI 上新
直击 WRC:当具身智能遇上 AI Infra
看完阿里财报才发现,AI烧越猛,越「养肥」卖铲人
具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号