做了三年游戏世界后,他们决定让AI走进物理世界

36氪 2026-07-20 18:58
做了三年游戏世界后,他们决定让AI走进物理世界图1

做了三年游戏世界后,他们决定让AI走进物理世界图2

游戏模型团队转战具身智能,

用虚拟经验造物理世界的大脑。

做了三年游戏世界后,他们决定让AI走进物理世界图3

做了三年游戏世界后,他们决定让AI走进物理世界图4

封面来源视觉中国

2026年的具身智能赛道,已经拥挤到令人窒息。

特斯拉Optimus计划在2026年量产5万至10万台;Figure AI刚刚完成了7亿美元A轮融资,投后估值达到60亿美元;国内具身赛道一样火热,动辄百亿估值起步。业内流传一个未必精确但足够形象的判断:每天至少有5亿元砸向具身智能。

但黎曼动力几乎是压哨出现在这场竞赛名单里。

2026年7月19日,WAIC 2026现场,昆仑万维主办的“世界模型与多模态范式跃迁”论坛上,一款名为Riemann-1.0的机器人模型首次亮相。其技术支撑就出自黎曼动力之手。

做了三年游戏世界后,他们决定让AI走进物理世界图5

同一时间,机器人圈公认极难的“家务大考”RoboCasa-365榜单刷新——Riemann-1.0以62.6%的成绩登顶,比此前的SOTA高出8.4个百分点。这个榜单上,大部分模型还在50%以下挣扎。

亮眼的成绩之下,人们开始回过头来细究黎曼动力本身,其前身是昆仑万维内部的天工Matrix团队。黎曼动力的低调与他们的技术执念有关,过去三年,他们一直在做另一件事——训练AI生成一个可以实时交互的游戏世界。从Matrix-Game 2.0到3.5,他们解决了世界模型在实时性、交互控制和长时序记忆上的几个关键技术问题,技术方案甚至被DiT作者谢赛宁团队沿用。

直到2026年初,这个团队突然转向了机器人。

倒不是为追风口。团队发现,机器人领域正在讨论的技术框架——action/world model——和他们过去三年解决的核心问题几乎一致:看到环境、接收动作、预测未来世界。游戏是虚拟的,机器人在物理世界,但底层的数学问题收敛到了一起。

这是一个微妙的节点。2026年恰好是具身智能从“Demo阶段”走向“产品阶段”的分水岭。英伟达发布Cosmos 3,小米验证了机器人Scaling Law,行业第一次有足够的数据和算力去认真讨论“通用机器人大脑”的可能性。而黎曼动力带着一套从游戏世界模型迁移过来的技术体系,在这个时间窗口选择进入家庭场景——这个机器人公司普遍回避、却又极能检验通用智能的场景。

他们花了三年教模型生成和理解一个虚拟世界,却没有找到足够有价值的产品出口;直到机器人技术路线开始与他们收敛,团队才意识到,过去为游戏建立的能力,真正的终点可能是物理世界。

游戏曾是团队学习物理世界的训练场,机器人则把这套技术从生成世界,推向改造世界。

更关键的是,这可不仅仅是具身智能的事情,更是AI走向物理世界的关键转折点。

做了三年游戏世界后,他们决定让AI走进物理世界图6

从游戏到机器人,复用的技术框架

在WAIC的曝光之后,黎曼动力的故事逐渐揭开面纱。36氪了解到,过去三年,黎曼动力一直在训练AI生成一个可以被人控制的世界。用户按下方向键,模型需要实时预测下一帧会发生什么:人物向前走,视角如何变化;撞上障碍物,身体应该如何停下来;离开一条街后再次返回,建筑是否还在原来的位置。

到2026年,他们决定把同样的问题交给一台机器人。

区别是,在游戏里预测错了,最多是一段画面失真;在现实世界里,机器人可能打碎一个杯子,撞倒一把椅子,或者根本无法完成任务。

从虚拟世界到物理世界,看似只差一个机器人本体,实际上是从“生成看起来合理的未来”,跨到“生成真正可以执行的未来”。

为什么选择游戏,而不是一开始就做机器人?

对黎曼动力来说,游戏是理解世界颇为容易获得的“最小实验场”:有空间、有角色、有动作输入、有重力、碰撞等物理规则;用户的每一次操作都会改变未来状态;数据规模和实验成本远低于真实世界。

Matrix-Game做的也不只是视频生成,而是让模型根据人的动作实时生成后续世界。用户可以前进、跳跃、攻击、移动视角,模型需要理解动作如何改变场景,并保持视觉、时序和物理的一致性。

团队过去三年真正解决了三个问题:世界能不能被实时生成;人的动作能不能准确改变世界;世界能不能记住此前发生过什么。

2025年8月,昆仑万维发布Matrix-Game 2.0,实现了单卡25FPS的实时长序列交互式生成。这是业内领军的在通用场景上实现实时长序列交互式生成的世界模型开源方案。到2026年7月,Matrix-Game 3.5进一步升级,从游戏场景向真实场景全面扩展,引入NPC交互能力并全新升级长时记忆能力。

对一个模型团队来说,技术被同行采用,往往比榜单成绩更能说明问题。

2026年3月,DiT作者、纽约大学助理教授谢赛宁团队发布了全球领军的多人视频世界模型Solaris。该模型以Matrix-Game 2.0为技术底座,通过引入多人自注意力层实现玩家间信息交换,在《我的世界》中成功验证了多玩家协同感知能力。近期,谢赛宁担任联合创始人兼首席科学官的AMI公司完成了10.3亿美元种子轮融资。

团队后来才意识到,他们看似在训练一个游戏生成模型,实际上一直在训练模型理解“动作如何改变世界”。这是未来游戏转机器人的技术桥梁。

做了三年游戏世界后,他们决定让AI走进物理世界图7

模型越来越强,

但游戏产品接不住了

就在黎曼动力的模型能力一路向前的过程中,团队突然间意识到一个关键的问题,产品形态越来越模糊了。

黎曼动力创始人刘扬告诉36氪,游戏世界模型本质上更像一个navigation-based的探索空间——没有NPC、没有剧情逻辑、没有多人系统。团队做出了技术,却没有找到同样清晰的产品承接。

"我们其实没有真正的游戏产品同学,没有人帮我们定义产品,也没有前后端工程同学去push这个事情。所谓的产品的尝试也是我们自己内部同学讨论。”

团队尝试过加游戏逻辑——吃金币、奖励机制、神秘关卡、NPC对话。但做着做着发现,游戏和机器人想要的东西不一样。“机器人需要你对空间的理解,但不需要画面特别好看。游戏不一样,游戏需要画面不崩坏、非常一致、非常好看,还要有逻辑。”

他们甚至尝试过黑神话悟空级别的3A游戏场景,但遇到了很大阻力。“游戏更关注的是交互和规则,那个事儿我们当时觉得世界模型是不ready的。”

Matrix的能力在持续向前,但“它究竟应该成为一个什么产品”越来越难回答。团队能够生成和探索一个虚拟空间,但距离一个完整的、可玩性足够的游戏,还有很远。

2025年秋天,团队做了一个关键转向。

这个转向也不是凭空起意。早在2025年上半年,团队就已经在游戏数据之外混入了大量真实场景数据进行训练——那些场景已不再是游戏。团队一直有个猜想:既然能预测下一帧长什么样,那通过下一帧和上一帧的差值,就应该能反推出中间应该做什么动作。

直到看到英伟达等团队关于World Action Model的论文,他们发现机器人领域讨论的技术框架和自己过去三年解决的核心问题几乎一致——看到环境、接收动作、预测未来世界。

游戏世界模型需要解决:看到当前环境+接收用户动作→预测未来世界。机器人模型需要解决:看到当前环境+理解任务→预测合理动作及动作后的未来世界。二者的底层问题高度相似:空间理解、物理规律、动作条件生成、长时序记忆、未来状态预测、实时交互。

“我们的训练框架都不需要改变特别多,唯一的变化是对动作的处理。”刘扬说。

做了三年游戏世界后,他们决定让AI走进物理世界图8

2025年8月,团队下单购买了宇树G1人形机器人、天机机械臂等设备,9月到货后在办公区测试,还一度因为噪音被投诉,但他们很快搬到附近产业园区继续实验。到2026年,黎曼动力正式从昆仑万维独立运营。

这是一个微妙的时间节点,具身智能赛道已经拥挤到令人窒息。据IT桔子统计,截至2026年6月,国内具身智能赛道融资总金额达到了935亿元,较2025上半年提升了5倍,其中超过一半资金流向了聚焦基础模型、世界模型等智能层的“大脑派”公司。黎曼动力几乎是压哨出现在这场竞赛名单里的玩家。

一场新的竞逐开始了。

做了三年游戏世界后,他们决定让AI走进物理世界图9

当技术信仰遇到非共识

从游戏转向到机器人后,团队面临的问题发生了根本变化。

在游戏中,模型主要生成未来画面;机器人则必须同时生成:未来视觉状态、机器人动作、本体状态变化、环境动力学反馈。

因此,黎曼动力不是简单把Matrix-Game接到机械臂上,而是将“世界生成”和“动作生成”统一到同一个模型中,形成Riemann-1.0 World Action Model。模型通过视觉、机器人状态、历史动作和任务指令,共同预测机器人下一步该做什么,以及执行后世界会变成什么。

做了三年游戏世界后,他们决定让AI走进物理世界图10

这是一个技术选择,背后却是一个更根本的信仰。

当前具身智能还没有足够多的数据,许多架构优劣其实尚未被真正验证。与其在几千小时数据上宣布某种路线胜出,黎曼动力选择先把数据规模推到十万、百万小时,再看模型能力是否出现跃迁。

“我们团队几个都是坚定的scaling信徒。文本模型这么过来的,图片生成也这么过来的,视频生成也这么过来的。具身如果没人去验证scaling,那就得有人去验证。”

这个判断直接影响了团队的数据策略。Riemann-1.0的训练数据构成颇为反直觉:23.2万小时数据中,占大头的不是机器人数据,而是人类的第一视角视频。

“以前大家不用这种纯裸手的人类第一视角数据,都要戴数据手套,或者上真机数据。”刘扬说,“但这种视频数据在第一阶段做预训练以后,对模型的泛化能力提升非常非常大。”

用人类视频做预训练,让模型先看遍人类怎么和物理世界打交道;再用少量真实机器人数据做动作对齐。这条路线正在被越来越多团队验证——ICML 2026上,包括LeCun团队在内的多篇论文也在往同一方向推进。

做了三年游戏世界后,他们决定让AI走进物理世界图11

家庭的复杂,

才是通用智能的真正试炼场

在当前的行业趋势里,机器人更容易进入的地方是工厂,但黎曼动力认为,工厂未必最需要一颗通用大脑。

在一条流水线上,机器人可能每五秒拧一次螺丝,每十秒完成一次固定动作。环境、对象和流程都高度标准化。一旦任务能够被写死,真正决定产品效果的往往不是模型能否泛化,而是机械精度是否足够高、节拍是否稳定、硬件成本能否低于人工。

换句话说:越标准化的场景,越容易自动化,也越不需要通用智能。

况且,工厂场景对于训练出优秀的大脑也没有太大益处。

“工厂级别的工作,考验的不在于大脑模型,在于小脑模型——要求精准、实时、重复。但重复对泛化性没有帮助。”刘扬说,“你去适配一个工厂是划算的,很多公司也愿意做。但工厂场景没有办法推动模型的最终边界。”

家庭正好相反。每个家庭的空间结构、物品摆放和生活习惯都不同。即使是“收拾房间”这样一个简单指令,在不同环境里,也可能对应完全不同的动作顺序。机器人不仅要识别物体,还要理解人的意图、处理遮挡和杂乱,并持续判断下一步应该做什么,以及这个动作会让环境发生什么变化。

他给我们举了一个例子,叠衣服。实验室里衣服一件件摆好,模型叠得很好。到了真实家庭场景,衣服堆叠在一起,夹爪拎起一件时可能把底下那件也带起来,模型就陷入混乱。“你想象家里不可能说是一件一件摆好、没有重叠地放着让你去整理。”

另一个例子是厨房整理。模型在收拾过程中如果不小心洒出液体,它会停下来先清洁,让人惊喜的是,这项能力不是单独训练出来的,团队推测模型从人类视频中学到了"打翻了要先擦"这个常识。

做了三年游戏世界后,他们决定让AI走进物理世界图12

Riemann-1.0在RoboCasa-365上的成绩或许说明了这条路线目前的有效性。62.6%不算惊艳,但面对365项日常家务任务、2500种不同厨房环境,这个数字本身已经说明模型的泛化能力在起效。

这也是团队最终选择家庭场景的原因。对黎曼动力来说,家庭并不是相对更容易商业化的场景,却是相对更能检验世界模型的场景。只有进入这种无法被完全预设、长尾问题大量存在的环境,才能判断模型学到的究竟是一套针对固定任务的策略,还是能够跨场景泛化的通用能力。

但对黎曼动力而言,这可能是一场更昂贵的实验。

在游戏中,他们可以低成本生成上千个世界;进入现实后,每一小时数据都需要人、设备和空间,每一次模型错误都必须由真实机器承担。

黎曼动力目前构建的是“模型、本体、数据”三位一体的体系:用世界模型驱动自研机器人落地,再让每一台部署设备成为数据节点,持续反哺模型。

三年前,这支团队试图回答的是:AI能不能生成一个人可以进入的世界。

三年后,他们换了一个更难的问题:AI能不能理解人所在的这个世界,并在其中真正完成一项工作。

从游戏到机器人,他们没有离开世界模型,只是把实验场从屏幕里搬到了现实中。这是一场新的竞赛,AGI的上半场在屏幕里,下半场在屏幕外。黎曼动力的漂流,或许只是这场大迁徙中一个不起眼的注脚。但注脚写到现在,已经足够让人多看两眼。

做了三年游戏世界后,他们决定让AI走进物理世界图13

做了三年游戏世界后,他们决定让AI走进物理世界图14

做了三年游戏世界后,他们决定让AI走进物理世界图15

做了三年游戏世界后,他们决定让AI走进物理世界图16

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI
more
WAIC 2026 | 进迭时空:自研 RISC-V 算力,让具身智能装上 “中国芯”
玻璃基板:AI算力时代的“最后拼图”
「百度搭子」,成了 WAIC 镇馆之宝
WAIC 这场青年论坛,把 AI 圈的真话都说了
教育AI「个性化」突围:学而思T6如何让好老师不再稀缺?
日均万步,我在上海 WAIC 的几点真实感受
AI领走埃尔德什100美元赏金!44页顶刊没解的题,它一页纸答出
WAIC 洞察 | 从智身钢镚L2到智身银毅NE01,这家公司想展示的不只是新品
智身科技惊艳首秀WAIC:成立两年半,卖出15000台机器人
Rapidus携手楷登电子引入AI智能体 加速2纳米芯片设计
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号