点击下方卡片,关注“具身智能之心”公众号
大家有没有发现。最近几个星期的行业动态和技术进展,将仿真再次推到具身智能讨论的中心。
起因是 Gemini Robotics 2 发布之后的几天。虽然大部分人的注意力都还在 Demo 所展示的能力上:Apollo 2 拧灯泡、整理货架,双臂协作、全身控制等等,全身智能所展示的想象空间确实很有潜力。
但也有同学注意到,在这一代模型,DeepMind 是基于合成数据训练的模型,出处就在他们自己的视频 Demo 里:Learning from synthetic data。

一两天之后,Google DeepMind 的研究负责人 Nicolas Heess 在 LinkedIn 上的动态也证实了这一点。
Learning without robot data! ...The video shows a Gemini Robotics 2 model post-trained on simulation data only...
这句话更准确的理解是,只覆盖「后训练」的部分。Heess 说:一个已经在混合数据上训好的基座模型,用纯仿真数据完成后训练,拿下了一个汽车套件分拣任务,需要精确的双臂抓取、三维重定向,还有紧配合插入。
无独有偶。
7 月 21 日,李飞飞宣布收购机器人仿真公司 SceniX,并随后在 a16z 进行对话,畅谈仿真对具身智能发展的重要意义;港大MMLab & 伯克利等十余家高校团队联合发布仿真评测基准 RoboDojo,目标是统一仿真与真实环境基准测试;光轮智能和纬钛机器人宣布合作,方向是把触觉模态接入物理 AI 基础设施……
这几件事放在一起看,行业的动向已经相当明确:仿真正在进入一个新的阶段。
01
这句话为什么反常识
先说为什么我们会觉得有些反共识。
拿 tight insertion 任务举例,紧配合插入。简单来说,就是把零件放入余量有限的孔里,公差可能只有零点几毫米。插的过程中零件和孔壁一直在接触、摩擦、微调姿态,稍微偏一点可能就会卡死,力大一点就变形。
人做这件事需要依赖手上的力反馈,机器人做这件事,靠的是模型对接触力的预判。

这类任务是过去两年公认的 Sim2Real 卡点,而且比想象中的更难。它同时考验接触、摩擦、公差三件事,每一件都是仿真里最容易失真的地方。
做算法的人都知道,仿真到真实中间有Gap。
正因为 Sim2Real 的这个Gap,真机数据才那么值钱。据亿欧智库估算,截至 2026 年初,全球高质量具身交互数据总量约 50 万小时;而行业共识是,要训出一个具备通用泛化能力的具身模型,门槛在千万小时量级。
中间还差着一到两个数量级,这个供需关系一直是数采产业链的核心支撑。
学术界的判断也是一致的。今年在攻这条线的大多数工作,思路也都是往真机上靠。
所以 Heess 的「Learning without robot data」,其实是主流真机范式下的反共识。
02
行业对仿真重要性的新共识
但 Gemini Robotics 2 押注仿真并不是个例。把时间轴往前推一推,会有这么几件事。
第一件,7 月 8 日,陈天行牵头十余家高校团队联合发布 Sim-and-Real 评测基准 RoboDojo。
这是一个面向通用机器人操作策略的真机 & 仿真评测基准,港大MMLab、UC伯克利、清华、北大、上交等十余所高校参与共建。基于 Isaac Sim 和 Isaac Lab,官方提供在线评测与公开榜单,仿真与真机两条赛道均在更新。

第二件,World Labs,7 月 21 日。
由李飞飞等人创办的空间智能公司 World Labs 宣布收购机器人仿真公司SceniX。SceniX团队将整体加入World Labs,共同推进空间智能、世界模型与机器人仿真技术的融合。

第三件,光轮智能,7 月 31 日。
光轮智能和纬钛机器人宣布合作,将触觉能力纳入物理AI基础设施核心架构。
两者的分工是:光轮智能出人类行为数据、物理仿真和产业部署,纬钛出视触觉传感、末端执行器和多模态数据采集。两边联合建设触觉仿真,以及真实与仿真的对齐能力。
为什么是触觉。抓取、插拔、装配、旋拧这类工作,本质上都是接触密集型任务,而视觉提供不了物体是否压紧、是否打滑这种信息。
所以触觉传感器是测量端,仿真是求解端,而「对齐」就是这两端之间的连接线。
不同的公司、不同本体做不同任务,共同点全都落在仿真和精密接触上。
但强度得排一下序。World Labs 最激进,是彻底的零真机数据;GR2 相对保守一些,仿真只负责后训练,预训练的数据仍然是各种来源。
可话说回来,即便按最保守的读法,这几件事还是反映出行业对仿真的重要性有了更进一步的共识。
03
物理真实的仿真能力超出了预期
我们的看法是:行业正在聚焦仿真任务边界的拓展,尤其是物理真实的仿真。
先看 GR2 自己的分寸。DeepMind 研究负责人动态的完整逻辑是「高质量真机数据是瓶颈,所以我们探索替代方案」—— 原文用的是 we investigate alternatives。真机成本昂贵,必须通过本体无关的数据去规模化,而此次GR2的后训练,很好说明了仿真数据不只有数量优势,还有物理真实带来的高质量。
前述事件的共同点,是都用了仿真,这只是表面。接着往下分析你就会发现,它们用的是物理参数被测量过、标定过的仿真。
Skild 是最好的验证。hydroelastic 接触建模是什么?传统刚体仿真把接触当成一个点:两个物体碰上了,算一个法向力把它们推开。hydroelastic 的做法是把接触当成一个面,允许物体表面有微小形变,压得越深、接触面积越大、反力越大,力的分布是连续的。
简单来说,前者算的是「碰没碰上」,后者算的是「压了多紧」。对拧螺丝、插接头这类活,「压了多紧」才是真正有用的信息。
而这个能力,是 Newton 到 1.0 GA 才补齐的。同批补进去的还有稳定的铰接与复杂机构仿真、可形变体仿真(线缆、布料、橡胶)。
SceniX 的仿真打法也类似,Real-to-Sim-to-Real。Real 在最前面,流程是先测真实,再建仿真,最后回到真实。
以前的仿真为什么没有现在的能力,就是差在这里——以前用的多半是视觉上做得很逼真、但摩擦系数和接触刚度靠经验值填进去的仿真环境。渲染管线越来越好看,物理参数还是无法保证物理真实。
所以过去我们把仿真当成一个整体在粗线条讨论。用,或者不用,用得多还是用得少。现在真的需要大家再看看:仿真里的那些物理量,到底测没测准——即,谁能做物理真实的仿真?
这就是分水岭。
04
物理真实这件事,
得有人在底层做 infra
既然分水岭出现了,行业便需要回答下一轮问题。
触觉的物理仿真、橡胶的摩擦系数、线缆的弯曲刚度,谁去测量?求解器算出来的接触力和真机传感器读数对不对得上,谁去验证?而这些物理量,如何变成行业能够对调用的资产和标准?把这三问答对,才有资格谈物理真实。
这三问自然不是模型团队的活。模型团队负责理解、推理和动作生成,往下这一层是基础设施。
环顾一圈,国内把物理AI基础设施当成主线在做的,光轮智能无疑是头部。
他们的技术路线叫「求解—测量—生成」三位一体的SimFoundry仿真平台,不仅有全栈自研的求解器,还通过数据、评测和部署反馈做成了闭环。横向对比其他公司,我们的观察是——做单点的很多,能做闭环的极少。

我们也拜托海外的朋友打听了一下,有一个比较靠谱的信源。Gemini Robotics 2 背后用的仿真能力,也有光轮智能的一份子。
更有意思的地方在于,在这个信源之外,光轮智能和 DeepMind 的关系早有显露。
说的就是 Newton。
这个开源 GPU 物理引擎由 NVIDIA、Google DeepMind、Disney Research 三家发起,2025 年 9 月开源 Beta,2026 年 3 月在 GTC 发布 1.0 GA,交由 Linux Foundation 托管。
光轮智能在 2026 年 3 月受邀加入 Newton 技术指导委员会,是除NVIDIA、Google DeepMind、Disney Research、丰田研究院四家之外,唯一的中国公司。所以 Gemini Robotics 2 的发布,使用到了光轮智能的仿真能力也在意料之内。

把这个委员会的分工摆开来看,会发现它其实是一张能力拼图:
NVIDIA出 GPU 原生加速、Warp 框架和 Isaac 生态;
Google DeepMind出 MuJoCo 在高精度接触动力学上的长期积累;
Disney Research出闭链机构与极端工况下的运动求解,来自 Kamino;
丰田研究院出 Drake 的高可信动力学软件底座;
光轮智能出的是求解器的物理验证与系统性标定、SimReady 物理属性规范,以及规模化 SimReady 世界的供给。
四家出的是「怎么算」,光轮智能出的是「算得对不对」。它是牌桌上唯一一家把「和真实世界对齐」做到极致的公司。
所以大家的分工和位置很清楚:Gemini Robotics 2 需要的接触、摩擦、公差和复杂交互能力,正是 Newton 里求解器标定和 SimReady 标准这两块工作对应的东西。

DeepMind 从模型侧往下走,光轮智能从物理侧往上走,两边在同一个引擎里互相赋能。
沿着这个逻辑去看,你就能明白光轮智能到底在做什么了?
想要仿真真的 work,那么物理求解与测量这件事就没法绕过去。但这又是一条很重的路线:要建物理测量的产能,要一种材料一种材料地测,要把测量结果和求解器输出精细对齐。
相比之下,生成式的方法要轻的多,直接用世界模型从海量视频里学物理规律,跳过显式测量这一步。Cosmos 3、Genie 3、Marble 走的都是这个方向。
但就目前生成式方法的进展来看,物理AI的进展还是强依赖物理真实,生成式的方法的下一次突破,可能也需要依赖显式的物理真实建模。
而只要你绕不开物理真实,那么你就绕不开光轮智能。
05
训练之外,评测是模型的另一半
下面,我们还想和大家聊聊评测。
在具身模型的生产过程中,训练只是其中的一半,另一半其实是评测。
在物理真实这件事上,评测的地位可想而知。
道理很简单:训练时物理量标偏了,模型学习不收敛,我们还能多继续优化;评测时物理量如果出错,可能你连错在哪都不知道。
大模型并不存在这个问题,因为LLM本身不依赖物理本体。但具身不一样,训练收敛的再好、仿真操作的再成功,都不能代表模型在真实环境里的综合能力,换个光照或者物理表面模型可能就失败了。而真实世界不能无限重置、不能大规模并行,也很难系统性地构造失败场景。
所以评测正在从工具里独立出来,变成单独的一个重要因素。近两个月的信号也相当密集。
Google 本次发布也在做这件事。他们用了三种方式评测:real VLA, sim VLA, and human tele-op。

国内这边,相关的规范也在推进。六月,工信部批准发布《人工智能关键基础技术具身智能基准测试方法》,规范了在仿真环境和真实环境下开展基准测试的环境设置、任务库构建、测试过程和指标计算方法。
学术界则在尝试解决一个更根本的问题:仿真评测是否可信。
RoboWorld 给出的结果是,用神经仿真器评测出来的策略排名,与 RoboArena 真机盲测榜单在八个策略上高度吻合。
RoboDojo 则基于 Isaac Sim 和 Isaac Lab 做了一套 sim-and-real 统一基准,同时跑能力导向的仿真任务和标准化真机测试。
产业侧也在往细分场景走。7 月 11 日,北京人形机器人创新中心与中科大联合发布 Labimus,面向精密化学实验室的人形灵巧操作仿真评测平台。与此同时,国内具身智能中试基地正在多地布局,建设重点也从提供场地和样机,逐步转向围绕真实任务开展测试、复测和部署验证。
光轮智能在这一层的产品是 RoboFinals,做了 Newton 原生适配,能调用 Newton 在刚体、可变形体和并行化上的能力,闭环覆盖资产、机器人与环境;另外还有和 NVIDIA 联合开源的 Isaac Lab-Arena 策略评测基准框架。

7 月 22 日 SIGGRAPH 2026 的 NVIDIA Physical AI Day 上,光轮智能战略与生态合作副总裁廉和与 经典仿真框架Warp的创造者、NVIDIA 仿真技术高级总监 Miles Macklin 同台,聊的就是面向机器人的前沿物理仿真。两个人在台上讨论的是可变形资产、Real2Sim 和 Newton-native 的评测框架如何搭建。

更重要的是,光轮智能的 RoboFinals 具有强大的仿真场景泛化能力,从而实现工业级、规模化评测。依托这一能力,光轮智能正与地方联合共建具身智能中试基地,在真实的工业场景中构建一套完整的验证体系。
训练、评测乃至落地部署在这里合成了同一件事。都要求仿真里的物理是可信且可真实落地的。
这也再次说明了闭环的重要性,由 RoboFinals 完成模型评测、版本比较和问题诊断,再把中试与部署结果反馈到下一轮场景生成、模型训练和验证中,光轮智能形成了“真实任务—仿真训练—规模化评测—现场验证—反馈迭代”的持续学习闭环。
06
写在最后
最后,还有几个开放性的问题想和大家一起探讨。
1
物理真实,到底要准到什么程度?
摩擦系数、接触刚度、装配公差等物理参数,究竟需要达到怎样的精度,紧配合插入这类任务才能稳定迁移到真实机器人上?目前行业还没有统一答案。缺少明确阈值,就很难判断一个仿真环境是否足够可靠,也难以比较不同团队在物理建模、测量和校准上的能力。
这个问题,可能需要更多一线 Sim2Real 团队用真实任务和长期运行结果共同回答。
2
仿真里的测量与生成方法,未来如何协同?
比如光轮智能关注的就不是单一的物理测量环节,他们围绕物理真实,内层连接求解、测量、生成,外层联通数据、评测和部署反馈。测量适合校准摩擦、接触刚度、公差等依赖精度的环节,生成式方法则可以泛化场景、变化条件。
未来两者将在同一个持续学习闭环中协作:测量提供物理约束,生成扩大数据和场景覆盖,评测与真实部署结果再反过来推动模型和仿真环境迭代。

总而言之,仿真的价值正在从单点生成数据,转向支撑训练、评测、部署和反馈迭代的基础设施。真实世界负责提出问题,仿真负责扩展问题,评测负责判断改进是否成立,部署结果再开启下一轮学习。
仿真的下一阶段,可能就从这里开始。

