让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性

机器之心 2026-10-09 17:38
让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图1


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图2

X:https://x.com/NVIDIAAI/status/2105051552029556942


从一块黄油如何融化,到 Physics-IQ Verified 的榜一,视频里的物理细节值得被重新描述一遍。


给视频模型一句「黄油受热融化」,它该生成什么?


一块逐渐变小的黄油、一圈向外扩散的液体,还是一团突然瘫软的黄色物体?这句话点出了事件,却省略了中间的过程。热量如何改变状态,重力如何影响形状,固体缩小与液体铺展怎样同时发生,都需要模型自己补全。


英伟达联合 MIT 和牛津大学的研究团队提出的 Physis-Lang,就从这些经常被省略的细节入手:把物理原因、规律和结果写进语言描述,再让这套描述贯穿数据筛选、模型训练和视频生成。


视频 1|Physis-Lang 完整演示:物理语言表征、描述准则自进化、数据检索及视频生成结果。


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图3

图 1|Physis-Lang 论文标题、作者及研究机构。


在权威榜单 Physics-IQ Verified 上,Physis-Lang 的 Cosmos3-Super 和 Cosmos3-Nano 版本分别以 48.2 和 43.3 的得分,按平均分位列第一、第二。


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图4

图 2|Physics-IQ Verified 榜单对比。Physis-Lang 的 Super 与 Nano 版本按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。



其中,Super 比图中此前最高的 42.7 分高出 5.5 个百分点;16B 大小的 Cosmos3-Nano 加入 Physis-Lang 以后,均分也超过了原始 64B 大小的 Super 模型。一个值得追问的问题是:语言描述究竟改了什么,能把提升传递到生成的视频里?


在训练和推理的 caption 中,细致地注入物理过程


普通视频 caption 往往擅长交代场景:画面里有什么,谁做了什么动作。Physis-Lang 进一步要求描述物体之间的作用,以及这种作用如何推动后续变化。


Physis-Lang 在基础描述之外加入物理推理信息。训练时,它为真实视频重新生成更细致的文本监督;推理时,它扩展用户的简短输入,并补充与当前场景相关的负向描述,约束不合理的物理行为。


还是黄油的例子。更完整的描述可以是:持续加热使黄油逐渐融化,固体部分在重力作用下塌落,体积不断缩小,融化后的液体在周围形成逐渐扩大的浅层液池。


这段话给出了连续的状态变化。生成模型需要表现的,不再只有「黄油」和「融化」两个概念,还有升温对物态的影响,固体与液体之间随时间变化的关系。


但描述更长,也可能意味着编造更多。模型如果把看不见的原因写得头头是道,反而会引入错误监督。因此,这项工作的关键,是让物理描述能够被检查,并据此持续改进。


评价 caption 物理细致程度的 PhysCapBench

& 自进化的 caption prompt


视频 2|描述准则的自进化流程:固定标注模型,根据物理评估反馈迭代共享的 caption prompt,并通过 PhysCapBench 验证。


研究团队为此构建了 PhysCapBench:一个评判视频描述中物理细节是否充分、是否正确的 benchmark。它包含 246 段物理视频,以及 3,794 条经过人工核验的原子断言,平均每段视频约 15.4 条。


所谓原子断言,可以理解为能够单独判断真假的物理陈述。例如,杯子撞上硬物后破裂,评估时会先将碰撞、受力和破裂的整个过程分解为逐条简短的物理陈述,再逐一评判,而不是笼统地给整段文字打一个印象分。


评分分为两个方向:Precision 检查描述说出的内容有没有依据;Recall 检查人工标注的物理信息有没有被覆盖。两者合成 F1,让「写得对」和「写得全」都有了可比较的尺度。


有了这把尺子,自进化才有明确的反馈。系统先在固定的 20 段开发视频上生成描述,由物理评估器指出遗漏和错误,再交给进化智能体修改共用的描述准则。更新后的准则还要在 PhysCapBench 上验证,最后选出表现最好的版本。


这个过程中,标注模型的权重保持不变。每轮修改的是所有视频共用的 caption prompt,而不是逐条给某个视频的答案「打补丁」。


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图5

图 3|描述准则自进化带来的收益。左:PhysCapBench F1 从 78.64 提升至 87.82;右:固定生成模型,仅更新推理描述,PhyGenBench 得分从 64.17 提升至 67.29。


从第 1 轮到第 9 轮,PhysCapBench F1 从 78.64 升至 87.82。改进并非一路向上:第 2 轮一度降至 76.28,论文将其归因于过于谨慎的描述。这也说明,少说虽然可能少犯错,却会丢掉必要的物理信息。


此外,固定预训练 Cosmos3-Nano,仅改变推理时的描述,PhyGenBench 得分就从 64.17 提高到 67.29。caption 端的改进,确实能够传到生成端。仅通过语言的自进化,不仅提升了多模态模型的物理理解能力,也进一步提升了视频模型的物理生成能力。


语言这一表征还能更好地用于数据筛选


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图6

图 4|语言引导的数据检索流程及效果:将模型的物理能力短板转为检索标签,补充相关真实视频并重新标注,用于增强训练数据。


语言的作用还延伸到了数据筛选。假如模型总是在物理形变、碰撞或断裂上出错,继续随机增加视频,未必能补上这些短板。


Physis-Lang 将模型暴露出的不足转成物理领域标签,再据此检索真实视频。检索更关注视频包含什么物理过程:即使画面主体、颜色和背景不同,只要涉及需要补充的物理机制,也可能是有价值的训练样本。


最终的数据集包含 183K 段真实视频。其中,71K 段来自 WISA-80K 数据集,另外 112K 段通过这套检索流程补充。它们再由优化后的描述准则进行重新标注,用于模型训练。


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图7

图 5|检索数据带来的分物理类别收益。横轴为 VideoPhy-2 联合得分的提升幅度(百分点),括号内为各类别样本数。


细分到物理类别,在 VideoPhy-2 上,化学过程和热过程都提升了 8.00 个百分点,断裂力学提升 7.45 个百分点,布料形变提升 7.19 个百分点。这些结果更直接地展示了数据补充对应的能力变化。


这样一来,语言就把几个环节接了起来:先描述物理过程,再用描述发现问题、寻找数据,最后把补充的数据和改进的描述一起用于训练。


四项物理评测开源 SOTA,三项超越 Veo 3.1


Physis-Lang 的优势,直接体现在与领先视频生成模型的对比中。基于 Cosmos3-Nano 的版本,在论文评测的四项物理 benchmark 上,均取得参评开源模型及方法中的最佳表现;其中三项总分超过 Veo 3.1。


这组实验同时覆盖图生视频和文生视频。对手既包括 Veo 3.1、HunyuanVideo-1.5、Wan2.2 等通用生成模型,也包括专门改善物理表现的方法。四张完整结果表如下。


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图8


看看生成的视频里发生了什么


从碰撞的传递,到纸张撕裂、受压形变,下面几段生成样例展示了不同的物理过程。


视频 3|接触与碰撞:基于 Cosmos3-Nano 生成的木块依次倾倒样例,展示接触作用下的运动传递。


视频 4|受力撕裂:基于 Cosmos3-Super 生成的纸张样例,展示向两侧拉动时的形变与裂口扩展。


视频 5|负载下的形变:基于 Wan2.1-14B 生成的壶铃与枕垫样例,展示重物接触后柔软材料的凹陷与形变。


结语


Physis-Lang 把一个容易被忽略的问题摆到了台前:我们交给视频模型的语言,是否充分描述了它需要学习的物理过程?黄油融化、纸张撕裂、枕垫受压,这些看似简单的事件,都包含具体的物理作用关系和状态变化。将它们描述清楚,才能为训练和生成提供更充分的物理信息。


从主实验中的四项开源 SOTA,到最新 Physics-IQ Verified 榜单对比中 Super 达到 48.2 分、Nano 达到 43.3 分,这项工作给出了可以量化的答案。通过描述准则自进化、针对能力短板的数据检索,以及贯穿训练与推理的物理语言,Physis-Lang 让这些细节转化成了生成表现上的提升。


让世界模型更好地理解物理,可以从重新优化语言这一重要表征开始。


让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性图9


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
英伟达
more
8月智能驾驶域控和芯片市场:智驾芯片英伟达居首,地平线不断追近距离
英伟达下场造电脑,128GB内存把传统PC干懵圈了
英伟达豪掷2790亿美元锁定HBM产能,AI芯片成本压力传导至消费端
打破英伟达“黑盒”?Lola Vision以编译器切入边缘AI芯片赛道
英伟达DGX Station登陆Windows,打破AI开发生态壁垒
英伟达组建AI安全联盟,OpenAI为何“缺席”?
清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据
AMD抢跑英伟达,锐龙AI Max Pro 495以192GB统一内存破局
SpaceX巨型星舰火箭首次进入轨道;英伟达市值迈向6万亿美元 | 一周全球公司十大要闻
AI进入资本兑现期,英伟达逼近6万亿的市值,Anthropic即将冲刺的IPO
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号