阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”

具身智能之心 2026-07-21 12:14

点击下方卡片,关注“具身智能之心”公众号


编辑丨具身智能之心

本文只做学术分享,如有侵权,联系删文



>>

更多干货,欢迎加入国内首个具身智能全栈学习社区(戳我)这里包含所有你想要的。

具身大模型真正难的,并不是再多答对几道视觉问答题,而是让“看懂”最终落到机器人动作上:目标物体在哪里、与机器人相距多远、应该从哪个位置接触,以及不同形态的机器人如何共享同一套策略。

今日,阿里巴巴达摩院发布最新的 RynnBrain 1.1,正是沿着这条路线推进。

前半部分,它是一组覆盖 2B、9B 和 122B-A10B 的具身视觉语言基础模型;后半部分,它又通过 RynnBrain-VLA 接入 Unitree G1、Astribot-S1 和 Tianji-Wuji 三类真机平台。

  • 论文标题:RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
  • 项目主页:https://alibaba-damo-academy.github.io/RynnBrain
  • 论文链接:https://arxiv.org/abs/2607.17977
  • GitHub:https://github.com/alibaba-damo-academy/RynnBrain

先把 VLM 做成“具身基础模型”

RynnBrain 1.1 延续 decoder-only 视觉语言架构,以 Qwen3.5 为底座构建 2B、9B 和 122B-A10B 三档模型。它接收单图、多视角图像与视频,并把输出空间从纯文本扩展到区域、轨迹、指向、3D 感知和接触点等结构化信号。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图1
论文 Figure 2:RynnBrain 1.1 的统一输入、输出与能力框架。

这套能力定义围绕四类具身需求展开:第一人称理解、时空定位、物理世界推理和细粒度动作规划。它们并不是独立 benchmark 的简单拼接,而是共同服务于后续机器人操作:识别目标、理解空间关系、定位可交互区域,并把任务拆成可以执行的步骤。

认知与定位:具身基模的“基本功”先做到高分

在 RynnBrain 1.1 的评测体系里,VLM 能力并不只看通用问答,而是拆成两类更接近机器人需求的能力:一类是具身认知,包括多视角空间理解、视频时序推理、物体与场景关系判断;另一类是具身定位,包括指向、区域定位、affordance grounding 与轨迹预测。

换句话说,模型不仅要知道“这是什么”,还要回答“它在哪里、哪一部分可以操作、机器人应该沿什么路径接近”。从 2B 开始,RynnBrain 1.1 的绝对指标已经进入可用区间。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图2
Table 3(节选):RynnBrain 1.1-2B 与 RynnBrain、Cosmos 3-Edge 的具身认知与定位结果。
  • 仅 2B 参数,RynnBrain 1.1 已达到 VSI-Bench 72.9、RynnBrain-Object 74.6、RynnBrain-Spatial 63.8、RynnBrain-Grounding 84.1 和 RynnBrain-Affordance 90.2。
  • 在 Cosmos 3-Edge 有公开结果的 10 项共同指标上,RynnBrain 1.1-2B 实现 10/10 全部领先;其中 Object 为 74.6 vs. 24.0,Spatial 为 63.8 vs. 22.6,Grounding 为 84.1 vs. 51.6。

模型扩大到 9B 后,提升最明显的是需要多视角、空间记忆和关系推理的任务。MindCube 从 2B 的 61.7 提升到 86.9,RefSpatial-Bench 从 58.5 提升到 67.2,RynnBrain-Grounding 进一步达到 85.4。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图3
Table 4(节选):RynnBrain 1.1-9B 与 RynnBrain、Cosmos 3-Nano 的比较。
  • RynnBrain 1.1-9B 的绝对指标包括 MindCube 86.9、EmbSpatial 81.9、RynnBrain-Grounding 85.4、RynnBrain-Affordance 90.7 和 RynnBrain-Trajectory 70.0。
  • 对比 Cosmos 3-Nano,RynnBrain 1.1-9B 在 15 项指标中领先 14 项;MindCube 为 86.9 vs. 40.5,RoboSpatial-Pointing 为 69.7 vs. 33.0,RynnBrain-Spatial 为 67.9 vs. 26.1。

大模型对比:在具身任务上压过多款闭源通用模型

到 122B-A10B 规模,RynnBrain 1.1 开始与 Cosmos 3 Super、Qwen3.5,以及 Gemini 3 Pro、GPT 5.4、Claude Sonnet 4.6 等通用大模型直接比较。这里更值得关注的,不只是胜负数量,而是模型在高难度空间任务上的绝对分数。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图4
Table 5:RynnBrain 1.1-122B-A10B 与大规模开源、闭源模型的具身认知与定位结果。
  • RynnBrain 1.1-122B-A10B 在 VSI-Bench 达到 75.0,高于 Cosmos 3 Super 的 60.9、GPT 5.4 的 49.2、Gemini 3 Pro 的 48.8 和 Claude Sonnet 4.6 的 44.4。
  • MindCube 达到 89.6:Cosmos 3 Super 为 40.2,Gemini 3 Pro 为 70.8,GPT 5.4 为 10.4,Claude Sonnet 4.6 为 21.0。
  • 具身定位方面,RefSpatial-Bench 达到 79.1、RynnBrain-Grounding 达到 86.6、RynnBrain-Affordance 达到 91.3;三项均高于 Cosmos 3 Super、Gemini 3 Pro、GPT 5.4 与 Claude Sonnet 4.6。
  • 按 15 项共同指标统计,RynnBrain 1.1-122B-A10B 对 Cosmos 3 Super 和 GPT 5.4 均为 13/15 领先,对 Gemini 3 Pro 为 12/15,对 Claude Sonnet 4.6 为 15/15。

这组结果说明,RynnBrain 的优势并不是只集中在自建指标上。VSI-Bench、MMSI、MindCube、EmbSpatial、RefSpatial-Bench 等公开任务同时覆盖视频、空间、多视角和定位能力,而 RynnBrain 1.1 在这些任务上保持了较高的绝对分数。对于具身系统,这些能力正是后续目标定位、动作规划和真机执行的基础。

两项新增 feature:原生 3D grounding 与接触点预测

RynnBrain 1.1 相比上一版最直接的变化,是把模型输出进一步推向真实物理空间。2B 和 9B 模型加入大规模 3D supervision:给定单张图像、语言描述与相机内参,模型直接预测相机坐标系中的三维中心、尺寸和朝向。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图5
Figure 5:RynnBrain 1.1 在 SUN RGB-D 与 WildDet3D-Bench 上的 3D grounding 结果。
  • SUN RGB-D 上,RynnBrain 1.1-2B 达到 34.28 AP@15,超过 Seed1.5-VL 的 33.5 与 Gemini 2.0 Pro 的 32.5;9B 进一步达到 41.12。
  • WildDet3D-Bench 上,RynnBrain 1.1-9B 达到 23.44 AP3D,高于使用额外域内数据训练的专用 WildDet3D 检测器 22.6。
阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图6
Figure 6:语言条件下的单图 3D 包围盒预测示例。

另一项新增能力是接触点预测。传统 grasp rectangle 需要生成四个角点,但同一物体通常存在多组功能等价的抓取方式,矩形尺寸也容易受到夹爪形态和数据标注习惯影响。RynnBrain 1.1 将输出压缩为一个抓取中心和一个平面旋转角,让模型更直接地回答“从哪里、以什么方向接触”。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图7
Figure 7:针对不同物体、姿态和指令生成的接触点与抓取方向。

规模扩大之后,具身能力是否真的增长?

RynnBrain 1.1 的另一个重点,是在统一能力框架下观察从 2B 到 122B-A10B 的规模变化。结果显示,通用具身认知、推理密集型认知和具身定位三类能力整体随模型规模提升,但不同能力的增长方式并不相同。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图8
Figure 4:RynnBrain 1.1 与原始 Qwen3.5 从 2B 到 122B-A10B 的能力变化。
  • 推理密集型具身任务上,RynnBrain 1.1 的平均分从 51.1 提升到 70.8,增长 38.6%;对应的原始 Qwen3.5 则从 32.9 降到 20.0。
  • 对比同规模 Cosmos 3:2B 在 10 项共同报告指标上全部领先;9B 在 15 项中领先 14 项;122B-A10B 在 15 项中领先 13 项。

这组结果指向一个重要结论:多视角、时序和空间推理不会仅靠参数规模自动出现。先通过具身数据和结构化空间监督建立“物理地基”,更大的模型容量才更容易转化为机器人真正需要的能力。

从 VLM 到 VLA:把理解能力接到动作上

团队进一步开发了更鲁棒的 RynnBrain-VLA 使用 flow matching 预测动作 chunk,输入包括语言指令、多相机观测、机器人状态和带噪动作序列;模型迭代去噪后输出未来动作。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图9
Figure 3:RynnBrain-VLA 架构与统一 81 维动作空间。

跨机器人训练的核心,是一套 81 维统一动作空间。它被拆分为 Arm-Joint、Arm-EEF、Gripper、Hand、Torso 和 Head 六组,每台机器人只激活自己具备的动作维度,其余维度通过 embodiment-specific mask 屏蔽。

  • Tianji-Wuji:激活 14D Arm-Joint 与 40D Hand,共 54 个动作维度。
  • Astribot-S1:激活 14D Arm-Joint、2D Gripper、3D Head 和 4D Torso。
  • Unitree G1:在统一空间中激活 14D Hand,并结合 SONIC whole-body controller 完成人形全身控制。

这意味着模型不需要把三种机器人完全不同的底层控制接口硬对齐,而是让多个本体在共享动作分组上共同训练,再由各自的 embodiment layer 完成最终执行。

真机结果:同一底座,覆盖人形、双臂和灵巧手

主要定量评测覆盖三项长程任务:Astribot 上的 Sprinkle the Petals、Pour the Wine,以及 Tianji-Wuji 上的 Grab the Spatulas。每项任务进行 20 次随机初始位置试验,同时统计最终成功率与中间阶段完成情况对应的 process score。

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图10
论文 Table 6:RynnBrain-VLA 与 Qwen-Based-VLA、GR00T N1.7、π0.5 的真机结果。
  • 在完全相同的 VLA 后训练配置下,Qwen-Based-VLA 的平均 process score / 成功率为 68.33% / 60.00%;换成 RynnBrain 底座后提升到 91.28% / 86.67%。
  • 联合多任务、多本体训练的 RynnBrain-VLA-Generalist 达到 94.14% process score 和 91.67% 最终成功率,高于 GR00T N1.7 的 83.31% 和 73.33%。
  • Grab the Spatulas 任务上,RynnBrain-VLA 成功率达到 95%,Qwen-Based-VLA 为 50%。
  • Unitree G1 的 Pull the Chair 任务上,RynnBrain-VLA 成功率为 90%,使用相同 SONIC 控制器的 GR00T N1.7 为 75%。

这些结果把前半部分的 VLM 能力与后半部分的动作表现连接起来:物体理解负责识别操作对象,空间与 3D grounding 提供真实位置关系,接触点给出动作相关的交互锚点,最后再由统一动作空间生成连续控制。

尤其是在多阶段任务中,更强的基础模型不仅提高最终成功率,也明显减少了中间步骤的失败。换言之,VLA 的上限不只取决于动作头和后训练数据,底座是否真正理解物体、空间与交互,同样会直接反映在真机执行上。

从“刷榜”到“上真机”,RynnBrain 1.1 想打通的是完整链路

RynnBrain 1.1 的特点,不是单独做一个更大的 VLM,也不是只训练一套机器人策略,而是把两部分放进同一条技术链路:先通过多尺度具身预训练获得可扩展的认知、定位和物理推理能力,再用 3D grounding 与接触点预测把输出推向操作空间,最后通过统一动作表示迁移到不同机器人。

对具身大模型而言,这比单纯追求参数量更关键。一个真正有价值的 foundation model,不只要在视觉语言任务上得分更高,还要让机器人在真实环境里更少失败几次。RynnBrain 1.1 给出的答案,是让 VLM 与真机能力各占一半,但最终服务于同一个目标:从理解物理世界走向可靠行动。

最后把关键指标 Highlight

  • 具身认知绝对指标:VSI-Bench 75.0、MindCube 89.6、RynnBrain-Object 77.0、RynnBrain-Spatial 70.0。
  • 具身定位绝对指标:RefSpatial-Bench 79.1、RynnBrain-Grounding 86.6、RynnBrain-Affordance 91.3。
  • Cosmos 3 对比:2B 共同指标 10/10 领先,9B 为 14/15,122B-A10B 为 13/15。
  • 闭源模型对比:122B-A10B 对 GPT 5.4 为 13/15 领先,对 Gemini 3 Pro 为 12/15,对 Claude Sonnet 4.6 为 15/15。
  • 3D grounding:SUN RGB-D 最高 41.12 AP@15;WildDet3D-Bench 最高 23.44 AP3D。
  • RynnBrain-VLA vs. Qwen-Based-VLA:平均成功率 86.67% vs. 60.00%。
  • RynnBrain-VLA-Generalist:平均 process score 94.14%,最终成功率 91.67%。
  • Unitree G1 Pull the Chair:90% vs. GR00T N1.7 75%。


END

 推荐阅读 :

阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”图11

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI 定位 阿里
more
为了教大伙用AI,这家公司写了40万字的攻略。
2026工业AI实战的广度、深度与力度
AI圈最神秘的一家公司,终于公开了它的“豪赌”
AI影视的胜负手,不止于工具
WAIC 2026上的国产边缘AI芯片:架构演进与具身智能技术深度解析
王祖贤息影22年后授权AI形象,网易《天下》合作短片上线
OPPO Bubble体验:后摄自拍很有创意,特别适合AI时代?
腾讯AI最大黑马!WorkBuddy行业第一,超过字节阿里
业内首款超算+智算的大规模计算底座,在WAIC上我们找到了
王晓刚WAIC首提行动代价法则:大晓如何用第一性原理重写具身世界模型底层逻辑
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号