Code-as-World:从一段视频,逆推整个物理世界

机器之心 2026-08-28 12:18
Code-as-World:从一段视频,逆推整个物理世界图1
机器之心发布


像素告诉我们世界如何呈现,物理代码解释世界为何如此运行。



生成一个世界,不等于理解一个世界。


今天的 AI 已经可以生成逼真的视频,也可以用代码搭建复杂的 3D 场景。但无论是像素还是场景,都只是世界的 “表象”。真正的物理智能,需要进一步回答:这个世界由什么构成、处于什么状态、又遵循什么规律?


换句话说,AI 的下一步,不只是预测世界会 “看起来怎样”,而是恢复为什么世界会这样运行 —— 从描述现象,走向发现机制。


近日,MirroS 提出 Code-as-World:让 AI 将观测到的现实主动重建为可执行、可验证、可推理的代码世界,并以此作为理解物理世界的表征。在这套框架下,对象、状态、物理参数与演化规律被显式写入代码,一个关于世界的解释由此不再只是语言描述或隐式特征,而成为一个可以查询、执行、干预和验证的世界假设


如果说从观测直接预测未来,回答的是:接下来会看到什么?


那么 Code-as-World 进一步追问:什么样的世界,能够产生这些观测,并在干预之后继续演化?


Code-as-World 将物理组成、动态演化与视觉外观显式写入可执行代码,并让智能体围绕观测不断提出、运行、检验和修正世界假设。这些经过验证的可执行世界可以转化为可规模化的物理监督,推动视觉语言模型学习物理推理。



Code-as-World:从一段视频,逆推整个物理世界图2


01|生成得像,不等于理解得对


人类理解物理世界,并不是记住每一次具体观测。


面对不同大小的球、不同角度的斜坡和不同材质的地面,人类仍然会使用物体、质量、速度、重力、摩擦等概念进行思考。真正能够迁移的知识,存在于这些紧凑的抽象之中,而不是某一段视频的全部像素。


这也意味着,复现观测,并不等于形成了对世界的理解。只要生成出的未来在视觉上足够合理,像素预测本身并不要求模型显式回答:世界中存在什么、状态如何变化,又是什么机制支配着这些变化。


问题因此进一步落到:什么样的表征,才能真正支撑对物理世界的理解与推理?


现有的几类世界表征,各自保留了世界的一部分信息。


像素保留丰富细节,却把原因隐藏在结果之中;3D 重建恢复几何、深度和视角,却不自动解释物体为何下落、碰撞或停止;自然语言能够紧凑地表达实体、动作和关系,却难以精确承载连续轨迹、接触关系与物理参数。


Code-as-World 希望找到一个新的结合点:


像语言一样具有语义,像 3D 一样具有结构,又像视频一样能够表达连续演化。


Code-as-World:从一段视频,逆推整个物理世界图3


代码恰好提供了这样一种形式。对象、状态、参数与规则可以被显式写出;世界不仅能够被描述,还能够被执行、干预和检验。Code-as-World 因而不追求每一个像素的完全复制,而是优先保持世界组成、约束与演化机制的一致。


真正重要的,不再只是把世界复现得更像,而是找到一种能够显式承载世界结构与机制的表征。 


02|不是更真实的像素,而是一套可执行世界


如果要用代码来抽象一个物理世界,究竟需要写下什么?


Code-as-World 将一个世界拆解为三个相互关联的方面:





三者结合起来,Code-as-World 表达的就不再是一张场景图,也不只是一段轨迹,而是一个可以真正运行起来的世界。


不同组件还可以被独立查看和修改:改变一个物体的速度、质量、运动方向或相机位置,其他结构仍然可以保持不变,世界随后重新执行。这也让 “世界编辑” 从像素层面的重新生成,变成了对底层机制的直接干预。


代码在这里不是最终答案。


它更像一个能够被运行和证伪的世界假设


03|让 Agent 在模拟与验证中发现世界


从一段视频或文字中恢复底层物理世界,本质上是一个复杂的逆问题。


因此,Code-as-World 没有把世界表征视为一次性的代码生成任务,而是将其构造为一个 agentic discovery loop:让 Agent 在不断提出假设、模拟与验证的过程中,逐步逼近能够解释观测的世界。


这一过程借鉴了科学发现中的溯因推理:从不完整、带噪声的证据出发,不断寻找能够最好解释观测、同时保持简洁的机制假设。


首先,不同形式的输入会被转换为相应的证据。


对于文本,系统提取实体、空间关系、物理事件和预期结果;对于真实视频,则进一步提取深度、实例分割、物体轨迹与三维几何,共同约束可执行世界表征。


随后,Agent 进入五个连续阶段:



于是,世界表征不再依赖 “一次猜中”,而成为一个持续循环:


提出 → 实例化 → 执行 → 渲染 → 验证 → 修正。


Code-as-World:从一段视频,逆推整个物理世界图4


每一轮执行都让世界假设产生可观测的后果;每一处差异都在告诉 Agent,究竟是世界组成、动力学过程,还是相机与外观设置出现了问题,把上一轮暴露的问题,转化为下一轮有方向的修改。


它不是重复抽样,而是在利用错误。  


04|世界一旦可执行,物理监督就能规模化


让世界变得可执行,价值并不止于更可控的模拟和生成。


它还解决了物理智能训练中一个长期存在的问题:


真实视频很多,但隐藏在视频背后的物理标签极少。


互联网中存在海量运动、碰撞与交互视频,但它们通常不会告诉模型:物体的真实尺寸是多少,某一时刻速度是多少,运动过程中的加速度如何变化,更不会提供完整的三维状态轨迹和接触事件。


可执行世界则天然拥有这些信息:



Code-as-World 从原始视觉观测出发,恢复其背后的结构化世界,使原本隐藏在像素中的状态与动力学变成可直接使用的训练监督。


基于这些可执行世界,MirroS 训练了 Code-as-World-VL 系列模型。


在李飞飞提出的首个 VLM 物理推理量化评估基准 QuantiPhy 上:


Code-as-World-VL-9B 模型超过 Gemini-3.1 Flash 的 54.8;

Code-as-World-VL-27B Reasoning 模型进一步提升至 58.6。



这意味着,可执行世界不仅是一种外部模拟工具,也可以成为一种新的训练数据形态:


把无法直接标注的物理机制,转化为能够规模化学习的监督。


05|代码只是第一步,结构化语言才是更大的命题


Code-as-World 的技术实现以代码为核心。


但在更大的愿景中,MirroS 提出的并不只是 “用代码代替像素”,而是一类更广义的世界表征:


结构化语言,Structured Language。


Code-as-World:从一段视频,逆推整个物理世界图5
Code-as-World:从一段视频,逆推整个物理世界图6
Code-as-World:从一段视频,逆推整个物理世界图7
Code-as-World:从一段视频,逆推整个物理世界图8


代码与自然语言,是其中两种有力而互补的形式。


代码是一种精确、可执行的形式语言。它能够把变量、状态、约束和规则显式写出,并支持严格计算、模拟执行和证据验证。当一个物理过程能够被明确建模时,代码可以沿着机制精确地推演世界如何变化。


自然语言则提供更广泛的语义与因果抽象。它承载着人类长期积累下来的实体、事件、关系、因果直觉与科学知识,也能够对难以被代码精确模拟的复杂现象,进行定性和更长时间尺度上的推理与预测。


二者因此覆盖了不同但互补的抽象层级:


代码让世界可以被精确执行,自然语言让世界可以被广泛理解与推演。


由更重要的是,它们都与人类已有的知识体系相连。物理智能不必只从感知数据中重新发现一切,而可以继承人类已经形成的概念、规律与推理方式,并在新的物理经验中不断扩展它们。


06|统一的世界表征,重塑物理智能


Code-as-World 的意义,也并不是孤立服务于一项任务的技术。


它试图为物理推理、视频生成和具身交互建立同一个世界底座。



推理不再只是从画面直接输出答案,而是先恢复实体、状态、关系与动力学,在结构化世界中计算,并对结论进行验证。



视频生成不再需要完全依赖跨帧的隐式记忆。模型可以先推进一个持续存在的世界状态,再把它渲染为像素,从而更稳定地保持物体身份、几何关系和历史信息。



具身智能也不必只对当前刺激作出即时反应。Agent 可以先构建内部世界,模拟多种可能结果,再选择行动;同一套抽象还可以连接真实观测、模拟环境和现实交互,使物理知识更容易跨环境迁移。


Code-as-World:从一段视频,逆推整个物理世界图9


换句话说,推理、生成与行动,不再是三个彼此独立的模块。


它们可以被看作围绕同一个世界表征展开的不同操作:


查询世界、演化世界、渲染世界,以及干预世界。


结语|Physical RSI,从可积累的物理经验开始


Code-as-World 更深层的意义,也正在于此:它为 Physical RSI 提供了一种可操作、可积累的经验载体。真实世界中的发现可以被编码、复现、验证和修正,并持续回流,驱动 World Model 与 Agent 协同进化。


当每一次理解世界,都能成为下一次进化的起点,Physical RSI 才真正成立。


语言模型的 Scaling 已经全面展开,而物理智能的 Scaling 才刚刚开始。真正需要被扩展的,不只是更多像素与轨迹,而是可积累、可执行、可修正的结构化物理经验




© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
vivo X500 Pro系列官宣:首发天玑9600Pro 2nm旗舰芯片
拆解谷歌与Marvell号称1200亿美元的芯片交易
利润暴涨 18.5 倍!国产算力和存储芯片厂商赚翻了
8000亿芯片大单,揭开谷歌Marvell的合作真相
M6 Mac mini隐藏细节曝光:内存带宽差异与N1芯片成关键变量
突发,美国要加征芯片关税
存储芯片暴涨致手机市场急转直下,2026年出货量或创历史最大降幅
沁恒CH398X USB3.0千兆网卡芯片,引脚兼容RTL8153B/E
OpenAI 自研「辣椒芯片」首测超英伟达,会让 ChatGPT 更便宜吗?
机票退改新标准或出台,工信部严禁未充分测试验证的汽车入市,千问Qwen3.8-Flash发布,OpenAI推首款芯片,这就是今天的其他大新闻!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号