极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系

机器之心 2026-08-21 19:13
极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图1
机器之心发布

在 2026 世界机器人大会(WRC)的 C326 展台前,最拥挤的地方之一是一张乒乓球台,这里站着一台人形机器人和观众对打。


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图2


对一家以世界模型起家的公司来说,把展台做成体验区并非只为热闹。从世界模型、具身基模,到原生本体与泛化场景,极佳视界这次想在现场铺开的是一条完整链路,而不是几个孤立的 demo。大会期间,多项互动演示吸引了大量观众和行业人士驻足体验。


这条链路上最新的一块拼图,是 8 月 19 日发布的新一代具身基础模型 GigaBrain-0.7,它也在世界模型展区同步展出。发布之后,该模型直接登顶智元 RoboColiseum 排行榜


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图3

榜单地址:https://robocoliseum.ai/leaderboard


RoboColiseum 于 8 月 14 日上线,主打与真机表现高度一致的仿真评测,目前设有 4 类能力子榜、78 个仿真评测任务,海内外已有 40 多支队伍在上面打擂。换句话说,GigaBrain-0.7 在平台开放的第五天,就把四个分项第一全部拿下。


GigaBrain-0.7 成功不止于榜单,其还首次提出 System-3 的概念,把世界模型放进机器人的实时决策回路,让机器人先预演判断、再执行动作;其背后是极佳视界从今年二季度起就在推进的“数据金字塔+算法金字塔”双轮驱动范式。这套做法能否真正把具身智能的 Scaling 走通,是眼下行业最关心的问题之一。


以下为 GigaBrain-0.7 的详细介绍。


贯通“5层数据金字塔”与“3层算法金字塔”体系范式,刷新长程复杂任务 SOTA


机器人学干活,算法重要还是数据重要?什么样的算法和数据配方,能够最高效带来具身智能的GPT-3时刻?


今年二季度,极佳视界率先提出了这个行业核心命题——如何构建可扩展(Scalable)的身基——并给出了“数据金字塔+算法金字塔”双轮驱动的答案。


8月19日新一代具身基础模型GigaBrain-0.7正式发布:系统论证“双金字塔”每一层的价值,在相同真机评估基准下,效果全面领先全球头部开源模型。


GigaBrain-0.7 亮点速览:


  1. 首次提出 System-3:把世界模型放进机器人的实时决策回路,让机器人“先预演判断,再执行动作

  2. 基模开箱即用:“双塔”体系驱动预训练模型实现“One Model, Many Tasks”的基模能力

  3. 横向评测断档领先:不仅在“具身原生的自研本体Maker H01”上任务成功率展现出“断档领先”的突出优势,而且在仿真和真机高度一致的RoboColiseum平台4项全方位评测上包揽第一

  4. 真机任务一镜到底:行业首次实现超20分钟超10个任务的长程复杂精细操作一镜到底


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图4

真机评测断档领先


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图5

仿真评测包揽第一

据了解,模型和相关代码将在不久后开源。


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图6


  • 项目主页:https://gigaai.cc/blog/gigabrain07

  • 技术报告:https://arxiv.org/abs/2608.15875

  • 代码仓库: https://github.com/open-gigaai/giga-brain-0 (Coming soon)

  • 模型地址:https://huggingface.co/open-gigaai/models (Coming soon)



01 从“理论共识”到“范式落地”


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图7


极佳视界在今年二季度率先提出了“如何构建可扩展(Scalable)的具身基础模型”这一行业核心命题,并确立了数据金字塔”与“算法金字塔的双轮驱动战略。


极佳视界现已正式推出新一代具身基础模型——GigaBrain-0.7。GigaBrain-0.7系统论证了“双金字塔”架构每一层的价值,并在相同真机评估基准下,效果全面领先全球头部开源模型。这不仅是一次版本的迭代,更是极佳视界将“数据+算法”双金字塔理论转化为大规模工程实践与真机泛化能力的飞跃。


02

核心架构创新

GigaBrain-0.7 的三层算法金字塔


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图8


GigaBrain-0.7深度融合了三层算法金字塔,基于全栈算法能力完成了全新的架构设计,在模型架构层面实现了从理常识理解和预判高精度连续动作控制再到闭环经验强化的完整进化。


极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图9

GigaBrain-0.7架构图


「第一层」

世界模拟(World Simulation)—— 赋予VLA物理常识理解和预判能力


VLM物理常识理解和规划


以大规模视觉语言模型VLM(System-2)为大脑主干,深度理解物理世界的常识规律、因果逻辑与高层任务规划。同时通过原生时空交互注意力机制(Temporal-Spatial Block)在空间视觉Token中引入了相对位置编码与相对时间编码,解决了具身任务中的长程时序推理难题。


GigaBrain-0.7 任务规划效果


GigaBrain-0.7 时序训练前后对比


World Model 未来变化预测和判断

GigaBrain-0.7首次提出System-3的定义,使用之前发布的GigaWorld-1实现对物理世界未来变化的预测和判断,补齐了当前VLA不具备预判能力的短板。

具体来说,基于GigaWorld-1的System-3可同步生成当前动作的未来价值评估(Action Value  Feedback)和未来关键进展的视觉图像预测这些未来表征被编码并即时补充至GigaBrain-0.7的输入prompt中,为机器人提供了“预演未来”的能力,显著提升了高难度、长程长尾任务的真机执行成功率和完成速度。


World Model 预测与困难任务执行真机视频


「第二层」

动作对齐(Action Alignment)—— 基于MoT和Flow Matching的多本体动作生成


跨本体参数共享(Shared Action Expert)


System-1基于MoT架构,采用Flow Matching范式生成高质量连续动作。在Action Expert模块中,不同机械本体共享绝大部分Transformer核心参数,仅通过本体类型ID(Robot ID)路由至对应的输入/输出投影层,成功实现了异构本体间的操作知识迁移与共享。


软知识隔离(Soft Knowledge Insulation)


在Action Expert与VLM视觉主干之间设计了Soft Knowledge Insulation机制,既保障了VLM主干强泛化的通用任务理解与规划能力,又最大限度提升了专用机器人操纵的精度。 


端到端联合预训练(Unified End-to-End Pretraining)


引入随机Prompt动态改写机制,配合细粒度的Subtask与VQA标注,在统一架构内实现Subtask语言规划、VQA视觉理解、离散动作桥接与连续动作生成的一次性端到端联合预训练,大幅提升预训练效率和动作对齐能力,极大地增强了模型在未知场景中的泛化性与指令严格遵循能力。 


「第三层」

经验强化(Experience Reinforcement)—— 从离线经验学习到在线持续强化


GgaBrain0.7的经验强化管线分为三个步骤:


    • 首先监督微调阶段极佳视界使用少量专家数据进行训练,使得预训练模型在复杂域外任务上具备一定的成功率;

    • 然后离线训练阶段,一些基于上一阶段模型自主Rollout采样的数据和人类在环数据被加入,使得模型具备错误恢复能力、提升成功率的同时,还能够对任务的完成进度和质量进行评估;

    • 最后在线训练阶段极佳视界的方法是基于模型评估能力构建稠密奖励,并通过人类在环的方式进行在线强化学习,进一步增加模型在精细操作上的成功率。


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图10

    GigaBrain-0.7-RL流程图


    离线经验学习


    模型在执行真机任务的同时,会将Rollout数据进行实时记录,并人工进行轨迹成功与失败、进度快与慢、质量高与低的标记,基于这些人类经验同步进行Value估计和Policy更新的离线强化学习训练,在使得模型具备错误恢复能力的同时,能够对任务的完成进度和质量进行评估,进而高效的提升大部分任务的完成能力。


    在线持续强化


    对于高难度精细复杂操作任务,经过离线强化学习训练完的模型也未必能稳定达到100%成功率,因此可以进一步通过人类在环的方式进行在线持续强化学习,通过边执行、边修正、边更新的方式,使得动作轨迹越来越精细、任务完成性越来越高,直到稳定达到100%成功率。


    03

    全阶数据基建

    五层数据金字塔的工程化落地


    数据是具身智能Scaling的基石。GigaBrain-0.7背后是极佳视界构建的庞大、高质量、跨模态数据集。

    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图11


    海量互联网数据


    针对机器人操作场景,基于自研GigaData Platform数据平台,对互联网海量数据进行深度清洗与细粒度结构化标注。极佳视界不仅构建了近 3 亿对“图像-语言”数据集,极大强化了 System-2 在空间理解、目标定位、交互预测及轨迹推理的底层能力;同时还构建了数万小时的视频数据,成为训练 System-3 的强大数据基石。


    传感器同构的真人数据


    同构采集硬件全栈自研:自研了与极佳双臂人形本体Maker H01传感器完全同构的UMI(手柄示教)与EGO(第一视角头戴)采集设备。


    全流质量:为了得到高质量的真人数据,极佳视界对硬件设计、数据采集、数据清洗、训练数据构建,做了多重保障,最终清洗得到11200小时高质量真人数据


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图12

    UMI数据处理流程


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图13

    EGO数据处理流程


    极高的数据效率:得益于极高的数据一致性和数据质量,仅需300条UMI数据进行后训练,即可让Maker H01人形本体在全新任务中实现自主操作。



    生成与仿真数据


    依托自研的数据生成平台GigaData Platform,结视频生成与高保真物理仿真,构建了超5000小时清晰的高质量长尾场景数据,破解真机采集安全与成本痛点。


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图14

    GigaData Platform数据生产流程图


    真机数据


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图15

    基于极佳视界自研的轮臂人形机器人MakeH01与轮臂机器人Maker M01,以及部分开源真机数据,最终清洗得到20500小时的高质量真机数据。


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图16

    真机数据处理流程


    04 真机性能表现

    全面超越全球头部开源模型


    数据+算法”双金字塔的深度融合,赋予了GigaBrain-0.7行业顶尖的具身操控能力。


    Data Scaling验证具身Scaling Laws 


    能否Scaling是具身智能最重要的问题之一,因为这直接决定了具身能否复刻大语言模型的成功,进而影响着物理AGI的进程。


    GigaBrain-0.7从多个角度验证出了具身智能可以被Scaling的这一趋势。


    首先,从图一的预训练规模和域外任务预测误差来看,少量数据随着预训练的进行存在过拟合现象,但随着数据量的不断提升,过拟合不仅逐渐缓解,且当数据量到达一定量级时,模型涌现出越来越强的泛化性。


    其次,从图二的预训练数据类型和真机成功率关系来看,增加UMI和Ego等数据可以直接提升真机效果,表明无本体数据是可以被Scaling的。


    最后,如图三预训练数据量和基模真机成功率关系所示,极佳视界对GigaBrain-0.7全量数据预训练的不同阶段的模型进行测试,发现随着预训练的不断进行,真机成功率也不断提升,且最终无须单任务后训练微调,一个预训练基模便可实现多任务的百分之百成功率。


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图17
    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图18
    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图19
    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图20
    左右滑动查看


    System-3 显著提升任务完成能力


    传统VLA在做动作之前,不具备对物理世界未来变化的预测和判断能力,导致任务完成性和泛化性存在瓶颈。GigaBrain-0.7首次提出System-3的概念,基于World Model实现World Value Model,让VLA在做具体动作之前先对未来动作做了很好的推演和判断,不仅显著提升了执行任务的成功率,而且任务完成得分和完成速度也明显提升。


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图21


    开箱即用的基模能力」


    极佳视界对GigaBrain-0.7的基模做了全方位的评测,包括分能力评测(语言跟随能力、复杂操作能力)、分机型评测(AgileX PiPER双臂机器人、Maker H01人形机器人)、分范围评测(域内、域外)、分任务评测(24个任务全面评估)。


    结果表明,GigaBrain-0.7的基模展现出了极其突出的通用性,并涌现出了令人惊喜的泛化性,真正做到了“One Model,Many Tasks”的具身基模应该具备的“开箱即用”的能力。


    模语跟随能


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图22


    基模复杂操作能


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图23


    Benchmark 全面领先


    真机评测


    在相同真机评估基准(AgileX PiPER & Maker H01)下,GigaBrain-0.7 与国际主流及行业头部模型进行了全面横向后训练对比,真机效果全面领先。特别是在“具身原生的自研本体Maker H01”上任务成功率展现出“断档领先”的突出优势。

    后训练语言跟随


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图24
    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图25


    后训练复杂操作能力

    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图26
    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图27


    仿真评测


    为了方便大家验证模型能力和横向对比,极佳视界特意挑选了仿真评测和实机部署相关性高度一致的RoboColiseum平台进行了评测。经过平台4个方面的全方位评估,结果同样全面领先全球头部开源模型和闭源方法,取得4个分项全部第一的成绩,轻松登顶榜首。这进一步证明了GigaBrain-0.7的超强基模能力和任务泛化能力。


    极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系图28


    05 一镜到底

    真实场景演示


    GigaBrain-0.7家庭场景长程复杂任务一镜到底展示



    GigaBrain-0.7工业场景精细操作全流程一镜到底展示



    © THE END

    转载请联系本公众号获得授权

    投稿或寻求报道:liyazhou@jiqizhixin.com

    关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
    声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
    AI 开源
    more
    GOAI世界人工智能开源大赛【报名公告】
    3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26
    Meshy T2重磅开源|6秒直出高精度Mesh,还能控制表面数量!
    开源、开放权重、闭源 大模型之争
    KAIST开源dToF深度补全:跨6数据集零样本泛化!
    OpenAI补齐最后一块拼图:ChatGPT桌面版正式登陆Linux,开源开发者终获“原生”支持
    小扎拼了,刚遭 1.4 万亿索赔,连夜开源 AI 小钢炮刷好感
    浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
    港大&腾讯重磅开源:用相机射线重构Attention位置编码,给世界模型换上「3D坐标系」!单图WASD复杂轨迹漫游,FVD降43%
    Meta开源Muse Glimmer模型:扎克伯格“个人超智能”愿景的落地试探
    Copyright © 2025-成都区角科技有限公司
    蜀ICP备2025143415号-1
      
    川公网安备51015602001305号