智象梅涛万字访谈深度解析:Robot-first or World-model-first ?

Xbot具身知识库 2026-07-27 11:16

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



这次听了梅院士和卫诗婕关于世界模型的访谈,本场访谈长达三小时,涵盖了梅涛从微软亚洲研究院到京东再到创业的完整经历,也展开了他对多模态大模型、架构创新、商业化、具身智能数据合成以及AI产业竞争的深度思考。以下,我将结合我的思考,力图呈现一幅完整的“世界模型路线图”,以及一些行业启示。

By the way,上个文章发出来以后,和灵波深入聊了一下,他们应该算是有不错的硬件研发能力,但不把单独卖本体作为主营业务,后面会约一个单独的访谈深入聊聊。

一、世界模型的三条路线:JEPA、3D重建与视频生成


智象梅涛万字访谈深度解析:Robot-first or World-model-first ?图1

梅涛在访谈中将通往世界模型的路线清晰分为三条:

“杨乐坤的那个JEPA就是predict这个next state……李飞飞他们的路径就是我要做3D的模拟;我们做的以视频模型来出发,从数据里面去学习这个物理规律,这是三条不同的路径。”

“我觉得我是希望能够从世界中学习,把世界进行重构。不是叫创造世界,而是mod这个世界……按照我们的想象去编辑这个世界。”

路线A:JEPA——预测抽象世界状态,不一定生成像素

JEPA的核心思想是:世界模型不需要生成像素级的未来画面,只需要预测抽象世界状态的变化。V-JEPA 2的架构就是Encoder + Predictor,编码器把视频映射成世界状态embedding,预测器预测未来embedding。这种思路的优势在于可以避免像素重建的高昂成本,直接学习本质特征。

路线B:Spatial Intelligence——构建3D空间世界

World Labs(李飞飞)更强调3D几何、空间一致性、持久化环境和可交互性。它们走的是Perception → Spatial Representation → Interaction的路径,希望让AI真正理解三维空间的结构。

路线C:Generative Video World Model——通过生成学习规律

Sora、Genie、Cosmos都属于这一派。其核心信念是:如果一个模型能够非常准确地预测未来视觉状态,本身就必须学习相当一部分世界规律。梅涛的智象也站在这一条线上,但他强调自己与单纯生成视频的公司的不同:智象的目标是从数据中学习物理规律,并最终能对世界进行编辑和控制。

值得注意的是,这三条路线在2025-2026年正在明显融合。 V-JEPA 2已经加入Action条件,Genie在做Video Generation + Action,Cosmos 3则把Reasoning + World Generation + Action统一到一个模型中,World Labs也在向可交互的方向发展。未来更可能不是JEPA vs Video vs 3D的PK,而是Representation + Dynamics + Geometry + Action最终融合成一个统一的Foundation Model

梅涛自己也承认:“将来eventually肯定是要交会的,但是还没有看到这样的一个架构。包括今天的transformer它很强,但明天是不是还有更强的不叫transformer的一个架构出来,这个不好说的。”

二、当前架构的局限与新思路

智象梅涛万字访谈深度解析:Robot-first or World-model-first ?图2

为什么需要新架构?

当前主流的多模态生成架构是DiT(Diffusion Transformer),Sora、SeeDance、可灵等均基于此。但梅涛指出了DiT的一个根本问题:所有模态信号(文字、图片、视频)都需要经过单独的编码器压缩到一个隐空间,再做交叉注意力,最后解码还原。编码-解码过程必然有损,且不同模态的压缩程度不同,导致对齐困难、控制精度不够(尤其在像素级别)。

他举了一个生动的例子:“比如我今天拍了一张照片,我希望你的眼睛再修一修,鼻子再修一修,大概是可以修,但是你要修到细节,修到像素级别就比较难。因为它是在隐空间里面学的,它不是一个在显示的pixel级别去学。”

UIT如何解决?

UIT的核心思想是去掉编码器和解码器,让文字、图片、视频、3D、动作等各种模态的信号以原生Token形式直接进入Transformer,在一个统一的离散空间里做互操作和交叉注意力。这样做的好处是:没有信息压缩损失,天花板更高;可进行像素级别的精准控制;能够支持更多下游任务(生成、编辑、理解等)。

梅涛形容这种理念为“青梅竹马”:“两个人是两小无猜,你长大之后才能有更好的信任感,才能有更好的默契。所以我们就想在信号在原生的层面上,不要经过任何的压缩和编码,就能够进入我们的transformer架构里面。”

但这种架构创新代价巨大。团队为此投入了大半年时间,中间经历了无数失败,因为“没有人趟过,一开始根本不知道这个框架能不能收敛”。这是典型的创业公司用架构创新换效率的打法——梅涛称之为“用1%或1/10的成本,再加上10倍的效率去逼近或者超过大厂的基础模型”。

架构不收敛的历史机遇

梅涛在访谈中做出了一个非常重要的行业判断:多模态和世界模型领域的架构还没有收敛。

“今天大家有个共识,在多模态领域,或者在世界模型领域,架构还没有收敛。没有共识,每一家都有自己的基因。”

对比LLM领域已经高度统一的Transformer + Next Token Prediction架构,Physical AI领域仍在争论:连续动作还是离散动作?隐空间预测还是像素空间预测?自回归还是扩散/流匹配?VLM + action head还是原生action token?世界模型与策略是否统一?

这种不收敛的状态,对于创业公司是难得的窗口期。因为一旦架构确定,行业竞争就会变成单纯的堆算力、堆数据,大厂的资源优势将无可撼动。而当前,架构创新仍然可能带来数量级级别的效率提升。

三、具身智能与世界模型心的争论

视频模型与机器人数据的关系

智象梅涛万字访谈深度解析:Robot-first or World-model-first ?图3

梅涛在谈及具身智能时,

“你只是拿真机数据来做。首先真机数据它没有那么多……如果你没有一个通用性比较强的,或者是基础比较扎实的视频模型的话,你在上面想做通用性好的具身或者什么,我觉得是比较难的,因为它见到东西比较少。”

可以将两条路线简化成:

路线A:Robot-first

大量机器人数据 → VLA → Scaling

代表性信念:Action数据本身最重要。

路线B:World-model-first

互联网视频/世界知识 → Video/World Foundation Model → 少量Embodied Data → Action Grounding

重点在于机器人数据负责告诉模型“怎么行动”,大规模视频负责告诉模型“世界是什么”。

他进一步解释说:“我们在训练视频模型的时候,是各种各样的视频都用在里面了。我们学习的是更加底层的通用的一种智能,或者一种知识……你只有见过这么多的视频,通用性足够好的情况下,你才能够做更多的泛化。”

这个逻辑上是没错的,但具体怎么做呢?

追问1:视频模型到底怎样进入 VLA,而不是停留在“提供更好的视觉表征”?

您说如果没有一个足够通用、基础足够扎实的视频模型,仅靠有限的机器人真机数据,很难做出通用性很好的具身智能。这个判断我认可,但这里最关键的问题其实是:视频模型学到的“世界知识”,到底通过什么技术路径转化为机器人的 Action? 。

可能的答案:
一个比较可能的路线不是让视频模型直接输出机器人动作,而是先让它学习“世界怎样变化”和“什么行为导致世界发生变化”。例如从大量人类操作视频中学会,靠近杯子、建立接触、抓起杯子之后,杯子的位置会随着手运动发生变化,这是一种与具体机器人本体无关的行为知识。然后再通过真实机器人数据完成 Embodiment Grounding:告诉模型同样的“抓起杯子”,在某款机械臂上具体对应什么 TCP 轨迹、关节动作和夹爪控制。这样视频模型负责学习通用 World Prior 和 Action Prior,机器人数据负责把这些知识翻译成具体可执行动作。

追问2:视频模型真正能够替代多少机器人数据?

如果 World-model-first 这条路线成立,那么一个非常关键的问题就是:大规模视频预训练究竟可以替代机器人数据中的哪一部分,又不能替代哪一部分?

可能的答案:
未来的数据结构很可能不是“视频数据替代机器人数据”,而是一个数据金字塔。最底层是规模巨大的互联网视频和图文数据,负责让模型理解世界;再往上是 Ego Video、人类操作视频和机器人视频,负责学习交互和行为模式;再往上是仿真与合成数据,用来扩大任务和状态覆盖;真正数量最少、但价值最高的,是目标机器人本体上的真实数据,用于学习动作尺度、动力学、接触和控制。也就是说,视频 Scaling 的价值可能不是让机器人数据变得不重要,而是让昂贵的机器人数据不再承担“从零认识整个世界”的任务。

追问3:World Model 最终只是 VLA 的预训练模型,还是会直接进入机器人决策?

现在谈视频模型或者 World Model 帮助具身智能,很多时候还是把它理解成一种 Pretraining:那么未来到底是 VLA 吸收 World Model,还是 World Model 本身逐渐变成 Policy?

可能的答案:
两者的边界很可能会越来越模糊。传统 VLA 本质上是 Reactive Policy,输入当前观察直接预测动作;World Model 则多了一步“预测动作后果”。如果进一步加入 Action、Reward 或 Value,模型就可以进行内部 Rollout:尝试多个动作、预测多个未来、评估成功概率,然后再执行其中一个。此时 World Model 不仅负责提供视觉表征,而开始承担 Planning、Value Estimation 甚至 Policy 的一部分功能。长期看,世界模型可能不是 VLA 外面的一个辅助模块,而会逐渐进入整个机器人决策核心。

合成具身数据:不看“像不像真的”,看Policy Gain

梅涛在谈到与机器人公司(如戴若犁的诺伊藤)合作做具身数据合成时,给出了一个新的的评价标准:

智象梅涛万字访谈深度解析:Robot-first or World-model-first ?图4

“数据算真实数据不要紧,重要的是咱们生成的数据对他们在他们训练模型有没有帮助……他给我一份数据,我们通过数据的生成把它变成100份、1万份……我们还要验证它是不是对目前市面上比较好的这些VLA或者是World Action Model,对他们有一些好处,我们这样才能闭环。”

评价合成数据不应该只看“像不像真的”(Realism),而应该看 ΔPolicy Performance——加入这批数据之后,模型成功率到底有没有提升?

NVIDIA对Cosmos Synthetic Data的定位就是“Generate → Train → Evaluate”的闭环,而不是单纯生成内容。未来真正的数据质量指标,最终必须落到Policy Gain上。

梅涛同时透露了一个现实困难:目前的视频模型在做具身数据合成时精度还不够。“一开始我们第一版的时候,我们只是保证它视觉的合理性……但里面有问题,就是它的手指的精度不够,它跟那个物体的交互会有点偏差……还有就是我们的视频模型里面的这些在三维点云上,它是不是一个在xyzt四维上面,它是不是一个毫米精度以及它的自由度上面是不是满足客户的要求。”

这也解释了为什么梅涛说SeeDance这样的通用视频模型“现在还不行”用于具身训练——因为它里面没有真正的物理规律,只是看上去符合物理规律。真正的具身数据合成需要高精度、高可控、满足特定自由度要求,这比生成一段好看的视频难得多。

这个逻辑上也是没错的,但具体怎么做呢?

追问1:能不能优先保留真实 Action,只生成新的 Observation?

既然最大的难点在于生成出来的 Action 不够可靠,那是不是不一定要一开始就追求“从零生成完整机器人轨迹”?一种更保守但可能更实用的路线是:Robot Action 保持真实,只重新生成 Observation。 比如同一条已经真实执行成功的抓取轨迹,生成不同杯子、背景、桌面、光照、遮挡和干扰物,但机械臂动作仍然使用原来的真实轨迹。这种方案是不是比“生成视频以后再通过 IDM 恢复机器人动作”更容易率先产生 Policy Gain?

可能的答案:
这是很现实的一条过渡路线。它相当于固定最难伪造的部分——Robot Action,只对视觉分布进行 Scaling。这样既能够获得大量新物体、新背景和新场景的数据,又不会破坏 Action Label 的准确性。之后生成能力进一步提升,再逐渐从 Appearance Generation 扩展到 Object Geometry、Trajectory Variation,最终才进入完整行为生成。也就是说,合成具身数据可能需要从“低自由度、高可靠性”逐渐走向“高自由度、高创造性”,而不是一步就让视频模型负责生成全部内容。

追问2:合成数据怎么验证 Policy Gain,才能避免“看起来有效”?

生成数据最后一定要放进 VLA 或 World Action Model 中验证,这是非常重要的一点。但 Policy Gain 应该怎么测?如果 Baseline 成功率 60%,加入数据以后变成 65%,这 5 个百分点到底来自哪里?是新物体泛化变好了,还是原有任务训练得更多所以过拟合更严重?是不是应该建立更加细分的 Policy Gain Matrix,而不是只看一个总体成功率?

可能的答案:
比较合理的方法是把测试集拆成多个能力维度,例如 Seen Object、Novel Object、New Scene、Occlusion、Contact-rich、Long-horizon 和 Recovery,然后分别测试不同合成数据带来的增益。例如 Appearance Synthetic Data 可能主要提高 Novel Object 和 New Scene;仿真 Contact Data 主要提高精细操作;Failure-targeted Data 则可能显著提升 Recovery。这样才能真正知道某种数据解决了什么问题,也可以进一步计算每一千条数据带来多少真实机器人成功率提升,而不是单纯比较数据集规模。

追问3:数据生成模型本身是否也应该由 Policy Gain 反向优化?

如果最终判断一批数据有没有价值的标准是 Policy Gain,那么是不是可以更进一步:让 Policy 的训练结果反过来决定下一轮生成什么数据? 现在是人工决定 Prompt,让视频模型生成数据;未来有没有可能让系统自动发现“这一类数据加入以后提升最大”,然后下一轮主动增加这种类型的数据,而对于没有提升甚至产生负收益的数据自动减少生成?

可能的答案:
这很可能是合成数据真正形成飞轮的方式。生成模型先提出数据,Policy 使用这些数据训练,再通过真机或者可信环境评估不同能力上的变化,然后把结果作为 Feedback 返回给数据生成系统。最终优化目标就不再是视频生成质量,而是“怎样的数据分布能够最大化下游 Policy Performance”。这样数据生成器实际上也成为了一个学习系统,它不断寻找当前 Policy 最有价值的训练样本,这和 Active Learning、Curriculum Learning 以及自动化 Data Engine 的思路是相通的。

四、行业观察

智象梅涛万字访谈深度解析:Robot-first or World-model-first ?图5

“多模态领域目前是到GPT-2阶段”

他说:“多模态这边的话还远远没有到GPT所谓的3.5或者4的阶段,它还是停留在GPT-2的阶段。”其论据是:视觉信号的token定义都没有统一,数据量消耗速度还赶不上人类每天产生新数据的速度,且视觉模型目前本质上是“复刻”而非“智能”。

“今天很多视觉模型或者叫DiT这个模型我们其实并不负责产生智能。我们做的事情是一个叫replication,复刻我们看到的世界……很难去产生新的智能。”

“大语言模型单独走向世界模型,这条路已经被公认为不太可能了”

语言数据是高度抽象的,无法直接提供几何、接触、力、状态转移等物理信息。当前主流世界模型(V-JEPA 2、Genie 2、Cosmos)确实越来越依赖Video + 3D + State + Action,而非纯文本。

“公认”说得太重, 因为语言模型实际上没有被排除。恰恰相反,越来越多系统是“Language Reasoning + World Representation + Action”的组合。所以更严谨的表述是:纯语言token单独支撑完整物理世界模型的可能性很低,但语言模型仍是未来世界模型的重要Reasoning与Knowledge组件。

具身智能行业的泡沫

“你意识到,在工业场景里面,要让机器人进厂子干活,这件事情是有点路径有点长的……你看今天的具身智能有哪家公司的机器人能够在工厂里面能够干7×24小时,能够不间断的去干活,这是挺难的一件事情的。”

当前行业“稍微有一点点泡沫了,有些公司它一个月过去什么都没有发生,那故事就要涨了三倍好几倍”。不过我个人(木木)认为行业有泡沫很正常,有可能后面是一鲸落万物生。

开源的优势

“在中国目前情况下,开源也是一种战略性的选择。”他分析道:架构创新只能保持约6个月的领先优势,但开源可以带来品牌、人才、社区反馈,逼迫闭源模型做得更好,也让自己的模型能快速渗透到开发者生态。这与他“用效率换时间,用架构换成本”的创业策略一脉相承。所以做生态是很有意义的。

五、总结

总结来看,世界模型三条路线正在融合,架构尚未收敛——这既是创业公司的窗口期,也意味着今天所有的范式之争都可能只是通向统一世界模型的序章。视频模型之于具身智能,不是简单的“更好的视觉表征”,而是需要构建一条从世界先验到行为先验、再到本体映射的分层转化路径,让昂贵的机器人数据不再承担“从零认识整个世界”的任务。合成数据的价值也绝不取决于它有多像真的,而必须回到最硬核的指标:Policy Gain——能否让机器人在真实任务中成功率提升,并形成“生成-训练-评估-反馈”的闭环飞轮。谁就可能在黎明前最混沌的黑暗中,率先摸到下一个时代的钥匙。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
亚马逊双线推进战锤IP,华纳派拉蒙博弈谢里丹旧作
17.99美元起,苹果在美国推出月租iPhone服务/多家算力厂商适配Kimi K3/安徽卫视播出AI短剧引发争议
早报 | 特朗普称霍尔木兹海峡或周二重开;亚马逊跻身3万亿美元俱乐部;智元回应首席科学家离职传闻;知情人士回应月之暗面港股IPO
苏州模拟芯片“小巨人”,启动IPO
长鑫科技IPO狂欢背后:车企“囤粮”逻辑与供应链安全博弈
苹果联手Klarna推iPhone租赁新政,月租低至17.99美元剑指运营商
CIPM MRA 比对报告现已可在 bipm.org 上直接获取
宇树科技科创板IPO敲定日程,核心员工斥资2.7亿跟投彰显信心
iPhone 20周年特别版曝光:回归玻璃机身,首发台积电2nm芯片
打破内存墙 & 互联墙,国产新锐IP迎来重磅突破
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号