WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化

Xbotics具身智能实验室 2026-08-25 20:37

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图1
Pelican-Unify 1.0:一套权重,看、想、预演、动手四件事同时在线

8 月 20 日上午,北人亦创国际会展中心 S203 会议室。2026 世界机器人大会期间的“具身觉醒·慧生万象”具身智能应用创新主题活动上,北京人形机器人创新中心把两件东西摆上了台面:一个大一统具身智能模型,和一套已经开门做生意的具身大脑服务。

两年前的展台上,人形机器人大多还挂在移位机上不能动;今天它们能站、能走、能在布置好的场景里把一件事从头做到尾。但几乎所有稳定的演示,都是一个任务一个任务地稳定的。

会插网线的模型不会做防水,会做防水的模型不会拧螺丝。每一项技能都可以被单独练到很高的成功率,可是把两项已经练熟的技能连起来做一遍,中间那一步常常就断了。

机器人为什么“会做 A、也会做 B,却不会做 A+B”?

带着这个问题,我们完整听完了这场发布,也把 Pelican-Unify 1.0 的技术细节逐条对了一遍。在“统一”这件几乎被全行业同时押注的事情上,北京人形提供了一个值得观察的样本:

它是国内首个把具身大脑基座模型和具身世界模型都做完备案的公司,也是权威评测 WorldArena 上唯一在两大核心赛道同时登顶的团队。

先把这次出现的三个名字分清楚Pelican-VL是负责看懂场景、拆解任务的那颗大脑,已经在对外商用;WoW是负责预演未来画面的世界模型;Pelican-Unify是这次新发布的模型,Pelican-VL侧重的场景理解与任务拆解、WoW侧重的未来预测,以及动作生成,都建立在同一套表征之上。


01|技能有,缺的是“接下来该发生什么”

今天的具身智能,是被切成几块分头做的。

视觉语言模型(VLM)懂“意思”。它能看懂一张配电柜的照片、知道红线接在哪个端子上,也能听懂“把网线插进 3 号口”。但它不能动手,说错了也没人纠正它。

视觉语言动作模型(VLA)能动手。它把画面和指令直接变成关节动作,可它心里没有“未来”——动作是照着示范学来的,它并不知道这一下推过去,桌上会变成什么样。所以遇到没练过的组合、很长的任务、要一直贴着东西干的活,就容易失手。

世界模型会想象。它能顺着眼前的画面往下画出接着几秒会发生什么,可这份想象常常只是“画得像”,很难听任务的话——画面越来越漂亮,跟活儿干成没干成关系不大。

三块各自都在快速变强,问题出在把它们串起来的那一刻。北京人形的判断是:这几块之间传的只是消息,没有一份共用的底稿。上游把一句话交给下游,下游并不知道上游脑子里那个“未来”长什么样;世界模型画出一段视频,负责动手的那部分也读不到。误差在接口上一层层攒,任务越长跑得越偏。

这件事在同一个咖啡壶场景上看得很清楚:只会看的那个模型,能准确框出咖啡壶、眼神也盯在壶上;照常规办法把它训练成会动手之后,框歪了、眼神也散了——能动了,代价是看得不如以前准。Pelican-Unify 1.0 学会动手的同时,框得还准、眼神也还在壶上。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图2
同一个咖啡壶场景下的三种模型:只会看的、能动手但看得糙了的、既能动手又看得准的

把四种能力分开训练,损失不只在接口上,每一块自己也在掉。所以缺的从来不是技能,是这些能力没有一起长起来。

02|真正的统一,是让看、想、动说同一种语言

所谓“说同一种语言”,是指画面、指令、动作、身体姿态都被换算成同一套内部编码,模型读它们就像读同一种文字。北京人形对“统一”的要求很严:画面、语言、未来状态与动作需要进入同一套表征体系,在共同的训练目标下协同学习并持续影响彼此的能力形成。具体拆成三层。

1、统一理解:机器人看到的画面、听到的指令、刚做过的动作、自己胳膊现在的姿态,先各自翻译成同一种“内部语言”,再一起交给同一个模型去读。“我看到了什么、我要完成什么、我已经做了什么、世界现在什么状态”,它是一次读懂的,不用在几个模块之间来回传话。

2、统一推理:模型会把想法用人话写出来,而且写两条——一条讲画面会怎么变:哪个东西要动、手会在哪儿碰上去;另一条讲自己该怎么动:先做哪一步、手要走到哪几个位置。两条写在同一段话里,逼着它把“接下来会发生什么”和“我该做什么”一次想清楚。

3、统一生成:想完之后,这段思考被压成一张内部便条 z(用大白话说,z是一串数字,模型写给自己看:这一步要发生什么、接下来该怎么动)——全模型只靠这一张便条往下对接。预演器(统一未来生成器 UFG)拿着这张便条,在同一次生成里同时画出接下来几秒的画面、和要发出去的一串动作。画面和动作是一起出来的,不是先画完再想怎么动。

这套设计里有三处最吃劲的地方。

第一,翻译器是共用的。

预演器给画面和动作做翻译的那两个部件,跟前面读输入用的是同一套。也就是说,预演器要动手的那份稿纸,正是模型早就会读的那一份。如果一个系统还要额外加个“转接头”,把上游的话翻译给下游,那它的“统一”只做到了接线级别。

第二,画面和动作在同一个房间里,彼此看得见。

两路信息进的是同一个生成主干(在 Wan2.2 视频生成模型上改的),生成全程互相看得见,那张便条也一直在旁边提着“这次任务要干什么”;只有最外面的入口和出口各管一路,中间最重的计算完全共用。动作要对想象出的后果负责,想象也得服从任务推理。

第三,三份对错算到同一处。

说得对不对、画得像不像、动作准不准,这三笔账最后都记在同一张便条和同一套翻译器上。看懂、想清楚、预演、动手,这四件事之间流动的是训练信号,不再是模块之间的传话。

画面这一路还有个小设计:已经看到的那几帧被锁住不许改,只让“未来”那一段从模糊里长出来——所以它的想象是接着眼前这一帧往下长的,不是另起一段。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图3
给它一串动作,它能画出照着这串动作做下去、画面会变成什么样

到这一步,四种能力共用的是同一份内部底稿。 原先它们之间只有一根传话的线,现在是同一张被反复修改的便条,谁都躲不开。

03|同一套权重,三门考试同时拿高分

当看懂、想清楚、预演和动手在同一个框架中共同学习,它们能否保持各自的能力表现?北京人形的答法是:同一套权重(不是三个模型),拆成三个身份分别去考试,每一门只回答一个问题。

第一问:学会动手之后,理解能力会不会掉? 看它当视觉语言模型时的成绩:8 项公开测试平均 64.7 分,同级别第一。分项更能说明问题:通用题目与基座打平或略高,涨分集中在跟身体有关的两门——“东西该放哪儿”涨 28.2 分,“物理常识”涨 20.6 分。学会动手没让它变笨,反而更懂空间和物理。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图4
八项公开测试成绩:平均 64.7 分,跟身体有关的两门涨得最多

第二问:四件事一起训,手上的成功率还保得住吗? 看它当干活策略时的成绩:50 项双臂任务平均成功率 93.5% (摆放规整时 93.6%、换了摆放 93.3%),和目前最强的专用模型同一档。50 项里有 31 项不低于 95%、15 项一次没失手,涵盖按、摇、堆、递、开合这些动作。统一训练没有让手变笨。

第三问:预演出来的未来,能不能真的帮上执行? 先看它当世界模型时的成绩:在 WorldArena 上综合得分 66.03,排名第一;其中“空间距离判断得准不准”拿到 98.12、“动得像不像真的”拿到 62.69,两项都是第一,其余几项也都均衡。

这张榜由清华联合普林斯顿、新加坡国立、北大、港大、中科院等 8 所机构发起,6 个维度 16 项指标,头部世界模型基本都在上面。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图5
WorldArena 综合榜:综合得分 66.03 排名第一,空间距离判断 98.12

这一问的答案藏在一轮人工盲评里,也是整篇里最值得看的一组数字。 机器打分有个毛病:会给“画面很干净、任务却没做成”的片段打高分。所以团队请人来盲评,对每段预演打 0 到 2 分:活儿干成了吗、听不听指挥、画面稳不稳、物理上说不说得通。Pelican-Unify 1.0 总均分 1.76 第一,其中“活儿干成了”1.81、“听指挥”2.00 满分。同一轮里还有模型画面稳到满分、任务却几乎全丢。画面流畅和把活干成是两件事。把动作和想象放在一起生成,治的就是这个。

三个问题,三个答案:没掉、保住了、帮得上。一套权重同时干这三件事,没有哪一门被拖下来。

04|换个背景、换个物品、换台机器人,它还行不行

所谓泛化,就是换个条件它还灵不灵。北京人形把「换什么条件」掰成了五样,再按一次变几样排出等级。

五样分别是:背景(同一件事挪到别的房间)、物品(换成没见过的杯子)、动作(换一种做法)、视角(相机位置挪了)、本体(换一台机器人)。等级就按一次变几样来排:L1 只换背景L2 换组合——把学过的零碎技能串成一条长任务;L3 同时换好几样;再往上,是完全没见过的场面。

各条路线站在哪一级也标得很清楚:只会“看图出动作”的 VLA 到 L1–L2;会预演的世界动作模型能上到 L3,但语言那一头偏弱;Pelican-Unify 1.0 目前站在 L1 到 L3,再往上那一级是房间、物品、机器人全都没见过,还要第一次就做对——这是他们接下来要攻的。

L2 这一级是怎么测的,最能说明问题。一台机械臂上,“插网线”和“做防水”分别单独教过,但从没教过把这两件事连着做。 测试时只给它一句话——把网线插进 3 号口,再做好防水——它得一口气做完两段,中途还要把“刚插好的样子”重新当成下一段的起点。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图6
训练时只教过单个动作,考试要求把它们连成一条没教过的长任务

它做成了。这件事光靠“背下更多动作”是做不成的:训练时它已经把每个动作学成了“做完之后画面会变成什么样”,所以能先把“网线插好之后的桌面”预演出来,再照着这个画面接着往下动。

把它预演的画面和真机实际执行的画面摆在一起看,防水件、网线、USB 三种插接都对得上——它的想象是照着真实物理走的,不是编一个看着合理的场面。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图7
上排是模型自己预演的画面,下排是真机实际执行,三种插接任务对着看

能站上 L3,靠的是数据翻了一个量级:数据池从 9 万小时拉到 145 万小时,背后是一套自动筛数据的流水线;这也是第一次把世界模型合成的数据用进预训练,真机采的数据占比已经很小。团队还做了个对照:同一个模型,一边喂世界模型生成的数据、一边喂传统仿真器生成的数据,结果打平——等于多了一条便宜得多的数据来源,还能顺手换机位、换成完全没见过的背景。

真机那边,它已经在轮臂人形机器人天轶 2.0 上跑通了全流程,部署的模型 14B——9B 负责看和想,5B 负责预演和出动作——能应付比较长、接触比较多的活。

换了条件还能干活的本事,正沿着这五级一级一级往上走。

05|光有大一统还不够,能干活的那一半已经在卖了

大一统模型指向的是终局,而机器人今天就要干活。所以同一场发布里还有另一件东西:一个已经在对外卖服务、能立刻接活的大脑模型。

Pelican-VL 2.0 是他们给机器人当“大脑”的基座模型,从去年的 720 亿参数升到了千亿参数的 MoE 架构(参数总量上千亿,但每次只调用其中一部分,省算力)。这一代主攻的是“能不能自己把一件长活干完”:拆任务、调工具、查资料、多步推理。这些场景上它已能对标国内外头部商用模型;7 项能力测试平均 66.57分,同图里作对照的国内外头部商用大模型是 57.06 和 63.30。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图8
北京人形大模型负责人鞠笑竹在 WRC 2026 现场发布千亿参数具身大脑 Pelican-VL 2.0,左图为 7 个智能体能力评测集的平均分对照

模型能力之外,还有两件更实际的事。国内的大模型想对外提供服务,得先过网信办备案。北京人形是全国首个完成生成式人工智能服务备案的具身大脑基座模型与具身世界模型的持有方,也是行业唯一两个底层核心模型一次性同步完成备案的公司;备案号下来之后,6 到 7 月间大模型访问量接近 13 万次。有了备案号,模型才能合规地对外提供服务,不再只是在实验室里跑分。目前 Pelican-VL 2.0 已面向社会全面开放服务。

模型要变成产品,中间还缺一层“外壳”。北京人形的做法是给它配两个助手,也就是双 Agent:一个对着人,把你的话拆成任务往下派;一个对着机器人,负责把这些任务在机器人身上执行出来。两个助手外面再套一层 Harness,补上大模型本身没有的东西——它偶尔会说错做错,就加个沙箱兜住;它记不住这个房间长什么样、也记不住你的习惯,就在这一层替它记着。这套架构 2024 年就开始搭,一路穿过了 Agent 开发的整轮迭代。

一起长这件事也从模型里面延伸到了外面: 里面四种能力共用同一张便条,外面两个助手加一层外壳,让大脑、小脑和真实业务在同一套流程里协同起来。

WRC 2026|北京人形 Pelican-Unify 1.0:让看懂、推理、预测未来与动作协同进化图9

放到行业里看,这件事眼下有三种做法:一种专练“预判”,一种尝试对文字、图像、视频、声音和动作进行统一建模,另一种进一步推动理解、推理、预测与动作在共享表征中协同学习。行业关注的重点也逐渐从视频生成质量,转向未来预测与动作生成能否在同一框架中共同形成,并真正服务于任务执行。Pelican-Unify 1.0 选的是离机器人最近的那条。

对开发者,这件事很实在:一个大脑驱动多种机型与场景,不必从零搭建多模型联动体系,算法可以跨本体复用;它是底层开放底座,具体的应用创新靠生态里的人接着做。

回到开头那个问题:会做 A、会做 B,为什么不会 A+B。Pelican-Unify 的答案是让模型在动手之前先把“A 做完之后的样子”想出来,再拿这张想象当成 B 的起点,中间那步衔接不用人再写一遍。顺着这条路往下,要解决的是背景、物品、视角、本体同时变的场面,以及把预演的时间拉得更长——到那一步,技能就不用一条条教,可以一层层长出来。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC
more
广州十方尺科技亮相ICDIA 2026:以AI驱动模拟与射频EDA创新,共筑“智创芯未来”
335通道、1Tbps、1pJ/bit:Avicena扔出Micro LED光互连的“深水炸弹”
Anthropic招揽谷歌芯片老将,组建芯片团队
IDAS 2026分论坛预告之半导体AI技术及应用论坛(二)Agentic EDA智能体赋能
史上最大IPO将易主?传Anthropic募资额或超SpaceX
荣耀机器人破人类400米纪录,技术反哺Magic9系列
【功能更新】IC Coder支持调用Vivado完成全流程AI自主FPGA研发
英特尔推DRM Fabric提案,Linux内核GPU互联迎来标准化契机
Shmoo Plot:IC 测试界的"黑魔法"——数字芯片的模拟灵魂
AI巨头“失控”预案缺失?独立评估揭示OpenAI领先,Meta与Anthropic垫底
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号