刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一

新智元 2026-09-16 12:32

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图1

  新智元报道  

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图2


10B参数以内,空间具身能力同档第一的通用多模态大模型来了!

就在昨天,紫东太初正式开源ZDTaichu5.0-9B,新一代面向物理世界的通用多模态大模型。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图3

一出手,就横扫九大国际权威空间基准,拿下8项同参数通用组别全球第一。

最拉开差距的,是复杂空间推演。

MindCube-tiny上,它拿到78.27分,甩开Qwen3.5-9B整整20.67个百分点,比STEP3-VL-10B也高出15.46个百分点。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图4

而且,它把空间能力拉上来的同时,图文、OCR、数学、代码这些通用能力,也没落下。

到了真实任务里,这两头还真缺一不可。工单得读懂,工位也得看明白。

读懂「把东西放过去」只是开始。AI还得继续判断:换个位置该往哪走,伸手之前哪里能放,做完一步之后接下来怎么办。

这个9B模型,要补上的就是AI走进物理世界时,最容易掉链子的那一段。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图5
奥特曼要造「大脑」,难在哪里?


这颗「大脑」有多难造?奥特曼的一番话,点中了关键。

9月初,一场播客中,他直接把话挑明,「OpenAI肯定会做人形机器人」!

在他看来,比机身形态更重要的,是搞定让机器人真正干活的那个「大脑」。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图6

这句话,恰恰点中了具身智能最难啃的部分。

一副机械臂可以反复执行写好的动作。可工位换了,零件挪了,任务做到一半被打断了,接下来怎么办?

总不能每变一次,就让工程师重新教一遍。

这就把问题推到了空间理解上,指令听懂了,还得判断眼前的东西在哪、怎么摆、能不能操作。

认出画面里有个杯子,只回答了「是什么」;判断杯柄朝哪、旁边能不能放东西,才开始接近「能做什么」。

任务一旦拉长,这些判断还得接上。

东西拿起来了,身份得记住;容器打开了,状态要更新。前面一个判断没跟上,后面就可能越做越偏。

ZDTaichu5.0-9B这颗大脑,到底能不能应对这些变化?

接下来,直接看三道对比题。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图7
三题连过,同级全翻车


以下三道题的难度是递进的,正好对应机器人从「看见」到「动手」要过的三关。

第一题:换个位置,柜子还找得着吗?

给到的要求是,移动到绿框窗帘的位置,面向蓝框沙发,判断红框柜子相对自己的方位。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图8

窗帘、沙发、柜子,全在画面里。难点在于,题目要求换一个地方站,再转一个方向看。

原图里的「左」,未必还是新位置上的「左」。

看起来像一道找方向的小题,实际要求模型连续处理两次变化:先改变站位,再改变朝向。

人会在脑子里转一下房间。模型也得完成同样的参照系转换:先把自己「搬」到窗帘前,再把视线对准沙发,最后重新推算柜子落在新坐标系的哪个方向。三步里任何一步串了,答案就反了。

这背后是参照系变换(frame of reference transformation) 问题。

模型必须同时维护三套坐标:世界坐标系、本体坐标系、相机坐标系,并在视角切换时完成三者之间的映射。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图9

多数模型的做法是把每帧图像独立编码成视觉Token,再靠语言先验「猜」方位——一旦相机位姿变了,视觉Token 之间的空间拓扑关系没有显式建模,关系就断了。

ZDTaichu5.0‑9B给出正确答案「右前方」。Qwen3.5‑9B和STEP3‑VL‑10B都发生了参照系错乱,给出「右、上、后方」这类错误答案。

它考的,恰恰是移动机器人绕不开的能力。摄像头一转,物体在画面里的坐标就变了。

绝大多数多模态模型在这一刻会丢掉空间拓扑:刚才还记得柜子在沙发左边,机器人挪两步,关系就散了。如果每换一个视角就把空间关系认错,后面规划得再漂亮,也可能走反方向。

第二题:方位算清了,目标能选对吗?

指令很短:找到「从左到右第二个银色盒子」。

短,不代表简单。

模型要同时干三件事:认出哪些是银色的(属性),把它们按从左到右排好(顺序),还要能真正给出目标的位置。

三件事缺一件,抓错的就是隔壁那个盒子。

技术上,这是一道属性绑定+空间排序+位置输出的复合题。

模型需要把「银色」这个视觉属性、「第二个」这个序数关系、「从左到右」这个空间方向,绑定到同一个目标实例上,并精准输出目标物体的位置坐标。

序数关系尤其棘手:它依赖对整排物体的完整枚举和相对位置排序,而不是孤立地识别某一个盒子。

ZDTaichu5.0‑9B输出归一化坐标 [237,226],精准命中数据集真值。

Qwen3.5‑9B给的是 [360,280],STEP3‑VL‑10B 给的是 [327,220],都指错了盒子。同级通用开源模型里,只有它选对了目标。

放到车间里,这道题有个更熟悉的名字:密集货架上一排外观几乎一样的料盒,工单说「取第三排第二个」。机器人抓取的第一步不是伸手,而是选对目标。

目标选错,后面的抓取再精准也是白忙。

第三题:目标找到了,旁边真能放东西吗?

前两题解决了方位和目标,这次要进一步判断操作条件:找出杯柄那一侧的空闲区域,给出一个能放东西的点。

这道题的门槛在于,模型不能只回答「杯子在哪」,还得回答「杯子怎么摆的」「它旁边哪块是空的」。

拆开看是三步:先识别目标杯子,再解析它的姿态、确定杯柄朝向,最后校验邻近区域有没有被别的物体占着,才能输出一个可用点位。

这本质上是可供性推理(affordance reasoning) 加空间约束校验。

模型要输出的是一个连续空间中的合法点位,而不是一个类别标签。

这意味着它必须理解物体的三维姿态(杯柄朝哪边)、理解「空闲」的物理含义(没有被其他物体占据)、并把这两者合成为一个可执行的坐标。

很多模型能识别杯子,却给不出「杯柄侧旁边那块空地」的坐标,因为它缺的是从语义识别到空间决策的最后一跳。

ZDTaichu5.0‑9B给出坐标 [650,720],完全落在合理空闲区域。Qwen3.5‑9B和STEP3‑VL‑10B给出的坐标,全部落进了不合要求的区域。

换句话说,机器人真按它们的答案放下去,东西会压在别的物体上。

识别是「知道有什么」,交互是「知道能做什么」。 前者只是看图,后者才是动手前的最后一道判断。市面上不少模型在前一层表现不错,到这一层就开始给出不可执行的答案。

三道题,正好是一条递进的链:空间感知、复杂三维推理、具身条件判断,最后落到物理交互决策。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图10

不过,空间判断做对了,还不足以接下完整任务。

机器人要知道往哪里放,也得先读懂工单、理解规则,必要时调用工具。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图11

空间能力上去了,通用能力一分没掉


这就带来另一个问题——

把模型往空间和具身方向训练,原本擅长的图文理解、OCR、数学和代码能力,还能不能保住?

如果连工单都读不明白,方位算得再准,也不知道该干什么。再配一个通用模型?两个模型怎么分工、怎么传信息,又是一摊要解决的事。

所以,ZDTaichu5.0-9B要的很明确:空间能力练上去,通用本事也得留住。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图12

先看读图、算题、认字这些基本功:AI2D拿到91.48分,WeMath为75.9分,MathVista Mini为84.5分,OCRBench为85.5分。

看懂示意图、读出工单文字、算清图里的数量关系,都得靠这些基本功。

在多项空间能力基准测试上,ZDTaichu5.0-9B胜过了多模态模型Gemini 3 Pro,比如ViewSpatial、MindCube-tiny、VSI-Bench成绩领先7%以上。

同时在文本智能体与代码能力上,IFEval(93.7)、AIME2026(89.2)以及LiveCodeBench v6(73.4)表现完备,真正实现了「通用能力不衰减,空间具身能力越级突破」。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图13
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图14
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图15


空间能力往上冲,通用能力也守住了第一梯队。

开发者看重的正是这一点:同一个模型,既能读懂任务,也能看懂现场。

那么,这两类能力是怎么一起练出来的?


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图16
难题多想几轮
大脑内部也能「三思而后行」


一头在训练,一头在推理。平时学没学扎实,临场能不能想明白,两件事都得解决。

ZDTaichu5.0-9B做了两件相互配合的事:训练时把空间关系和任务约束教扎实,碰上难题时,再给模型多一点计算的余地。

这次推理的核心设计,叫「自适应循环推理」。

直白地说,模型一边生成,一边判断:下一步拿得准吗,要不要再算几轮?

这一片段,细到每一个Token。

模型先完成一轮标准计算,得到下一个Token的概率分布和当前的隐层状态,再由「熵门控机制」判断预测的不确定性。

概率分布越分散,就意味着它越拿不准。

此时,门控机制会决定是否触发额外计算,让模型在当前Token位置循环执行部分层块计算,逐轮修正内部表征,再继续输出。

确定性高的位置,则直接输出,不追加循环。

也就是说,算力具体加在那里,要看生成过程中哪个位置拿不准。

这个循环发生在模型前向传播内部,无需为循环调用外部工具。

这波操作,很难不让人想到传闻中GPT-6 Astra,内部也采用了「循环Transformer」的机制,让其推理能力大涨。

如今,紫东太初直接把这套机制装入了9B模型。

从这个角度看,恰恰体现了团队极高的技术前瞻性,踩中的架构直接对齐前沿巨头。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图17

哪个Token拿不准,就在那里多花点算力。目标是让复杂空间判断更准,平均推理成本又不至于涨太多。

不过,多想也可能越想越偏,团队为此还加入三道稳定机制。

首先是「阻尼更新」:控制每轮修正幅度,并以原始表征为参照,避免内部特征一路漂移。允许调整,但不能改着改着,把原来的视觉证据丢了。

接着是双重停止判据,同时监测输出分布和隐状态的变化,对应KL散度与隐状态残差,帮助判断迭代是否趋于稳定。

还有轨迹读出与状态回滚,保留中间状态,从多轮结果中选择风险较低的表征,必要时回退。

最后一轮并不天然比前几轮更好。多算几轮,要算出有用的修正,也要知道何时停、何时退。

这三道机制,就是给内部循环装上约束。至于具体耗时和成本,以及每项机制贡献多大,还要看完整测试。

还要分清,模型内部循环解决的是当前这一步的推理。抽屉打开了没有、东西是否真的放进去,得靠新的画面和执行反馈确认。

脑子里多转几圈,不能代替抬头再看一眼。内部循环和外部任务循环各司其职,才能支撑更长的连续操作。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图18

数据怎么教,决定「大脑」学会了什么


不过,再会琢磨的模型,也得先学过靠谱的东西。

ZDTaichu5.0-9B的整个训练过程采用「渐进式数据课程」,像上学一样一级一级往上教。

预训练阶段,先打基础。

这里,先接触开源图文、结构化网页、多视角视频及三维仿真场景,学习视觉、语言、时序和空间概念之间的联系。

原始数据不会直接倒进去。感知哈希和URL双重去重,减少重复内容;画质、图文相关性及隐私安全过滤,拦下问题样本。随后进行重描述、视频抽帧与样本打包。

这些工序不抢眼,却决定了模型学到什么。关键细节糊了,说明还配错,再好的学生也经不起这么教。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图19

监督微调阶段,训练数据开始像「真正的工作」。

喂的东西换成了大规模任务轨迹,真实业务问答、空间具身案例、Agent完整的工具调用记录。

具身样本尤其需要检查图像、对象关系与操作约束是否一致。抽屉明明关着,答案却教模型直接往里放,这种样本必须拦下来。

长推理也不能只看篇幅。团队通过拒绝采样、格式检查和一致性校验筛掉问题内容,再组织多轮对话、多图与视频序列等训练输入。

后续以「能力域—难度—质量」三维标签查漏补缺,根据反馈定位短板,筛选更有信息量的样本。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图20

高质量退火阶段使用长推理样本,GRPO强化学习则引入可自动校验的奖励:答案正确性、空间框选坐标命中、输出格式合规,都能成为反馈。

比如,让模型选一块可放置区域,解释写得再漂亮,点落在障碍物上,也过不了关。

反馈要能指向操作所需的判断,模型才有机会把这些能力练得更扎实。

更关键的是,这整套数据生产与训练方案是随权重一起开放的。

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图21


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图22
真正的考场,表现同样不俗


本事讲了,原理也拆了。真搬到实验台和车间里,能不能干成活?

真实物理世界的长程任务,是一串相互依赖的链式操作:

认出目标、处理遮挡、挪到合适的观测位置、打开容器、调用工具、搬运物体,最后校验有没有完成。

每一步都依赖上一步的结果,模型得一直记着整件事进行到哪了,而不是每来一张图就独立生成一个动作。

ZDTaichu5.0-9B做了两类实体Demo验证,分工很清楚——

它当高层规划的大脑,负责看懂环境、记住对象、拆步骤; 


底层的抓取、导航、开合交给机器人的控制系统,设备安全逻辑也留在硬件那边。


先看科研,它打通了仿真计算和湿实验。

给它一个自然语言的科学问题,比如一个阻尼振子怎么运动,它自己调Python和SciPy,同时算解析解和数值解,两边交叉核对,再画出相空间图、位移和速度的时序曲线,一份分析报告就出来了。

整个科学分析的工作流,走了个完整。

到了实验台上,让它按顺序把两支试管放进架子,规矩是先放画面右边那支,再放左边那支。

中途抓取、交接会让试管在画面里的位置不停变,它得一直记住哪支是哪支。看到「一支在架子里、一支还在桌上」,它知道任务没完,输出下一步:把桌上那支拿进去。

多样品操作里最容易出的两个错,认错样品和搞乱顺序,就是靠这份「身份记忆」压住的。

滴管转移液体也一样,滴管、源烧杯、目标烧杯三者的空间关系绑在一起,滴管悬在目标烧杯上方时,它知道该继续滴。样品身份、空间位置、任务进度三样东西绑着跟踪,这正是自动化实验平台缺的那层上层编排。

再来看制造,更接地气。

测试中,选的是备料配送、机台上下料检测、工位整理三类最常见的业务,面对的也是工业现场最真实的麻烦:

货架密集、零件长得一样、东西被挡住、目标跑出视野、操作有严格的前置条件。

工单一句话:「把红架上的篮筐放到传送带上。」它要从密集货架里认出红色料架、白色篮筐,判断抓哪、双臂怎么配合,放到绿色传送带上之后还要回头检查有没有放对位置。

机台上料也是同一套逻辑,长工件怎么避障、夹哪里、放到工作台哪个点,全靠它做判断。

长程任务真正难的,是每一步判断要连得上。

刀从架子上拿出来了,它还得记得这是同一把刀;抽屉没开,就不能算满足放置条件;刀悬在盒子口上方,不等于已经放进去了。

目标被挡住,先判断要不要挪开遮挡物;容器没开,先满足开合前提;还没站到能交互的位置,直接放置大概率失败。

从三道空间题,到实验台和生产线,这些案例把前面的能力接了起来:通用能力读懂要求,空间能力判断现场,再靠持续反馈推进下一步。

这些任务已经在真机上跑了起来。接下来换设备、换工位,还得一关关接着过。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图23
这颗9B的大脑
还能接着往下练


回头看,奥特曼所说的机器人「大脑」,难就难在这里——

语言里的要求要对上眼前的对象,对象会动、视角会变、条件会缺,而任务不能停。


ZDTaichu5.0-9B这次,把几块关键能力装进了同一颗9B的「大脑」。

空间榜单上冲到同档前列,通用本事没落下,实验台和车间里的连续任务也开始跑起来了。

权重和数据生产、训练过程方案一起交到开发者手里,这件事就还能继续往下做。换成自己的数据、自己的设备,继续练、继续试,让模型一点点熟悉自己的现场。

ZDTaichu5.0-9B开源地址:

Blog:https://taichu-ai.github.io/ZDTaichu5.0-9B

Huggingface:https://huggingface.co/TaichuAI/ZDTaichu5.0-9B

Modelscope:https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

Github:GitHub - Taichu-AI/ZDTaichu5.0-9B

下一步,紫东太初团队要把这颗「大脑」继续往前推,打造面向物理世界的具身基础模型。

看懂眼前的场景之后,还要能预判:这一步做下去,环境会怎么变?再把判断接上连续动作,根据执行反馈调整下一步。

这意味着,要把多模态推理、世界状态预测和连续动作生成连起来,形成「感知—认知—预测—行动—反馈」的自主闭环。

让AI从理解数字世界,进一步走向理解、预测并改变物理世界。

编辑:桃子 大卫


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图24

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图25

刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一图26

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究
ECOS团队出征星火会!全开源芯片,展位等你来!
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一
开源模型不再免费,月之暗面、阿里开始要分成,“大模型税”能落地吗?
说话就能生成芯片时序图的开源 Skill,效率提高1000%
英伟达129.3亿美元吞下Hugging Face:开源生态的“特洛伊木马”还是算力霸权的终极闭环?
端侧模型太夯了!面壁智能开源2B「小钢炮」,通用Agent杀到端侧
868 亿!黄仁勋官宣收购 Hugging Face,全球最大 AI 开源平台一夜易主
全新的世界地图要来了,阿里千问开源自动驾驶模型,豪威CIS市占率全球第二,CHINA GT发布比赛事故情况声明,这就是今天的其他大新闻!
868亿,黄仁勋官宣收购Hugging Face,全球最大AI开源平台一夜易主
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号