点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
从「生成像素」到「理解空间」
2026年9月1日,World Labs正式发布了Atlas——一个全新的全能世界模型(omni world model)。
这家由「AI教母」李飞飞联合创立的空间智能公司,正在用Atlas回答一个根本性的问题:机器如何真正理解三维世界?
如果说传统视频生成模型是在「生成像素」,那Atlas做的则是「理解空间」。它不仅仅是一个图像或视频生成器,而是一个能够生成、重建和模拟任意可能世界的统一模型。它的核心能力可以用一句话概括:从一张或几张图片出发,生成一个你可以自由探索的、物理一致的三维世界。
Atlas的出现,标志着世界模型从「能看」走向了「能理解、能想象、能交互」——这是空间智能领域的一次重要跃迁。
四大核心能力:生成、重建、模拟、创作

1. 相机控制生成:像素级精确的「导演模式」
Atlas最直观的能力是相机可控生成。给定一张或多张参考图像,Atlas可以在你指定的任意相机位置和角度生成新视角。生成的视图与输入图像的内容和几何保持一致,并平滑地外推到输入中不可见的部分。
这意味着:你拍一张照片,Atlas就能「脑补」出这个场景的其他角度——机器人的背面长什么样?泳池旁边是不是有一片草地?它不只是猜测,而是基于对三维世界的理解做出合理的推断。

与LLM的类比:Atlas先把输入编码成一个「空间上下文」(spatial context),然后基于这个上下文生成输出。不同的是,Atlas中的每张图像都被锚定在三维空间中的一个具体位置。你可以把两张毫无关联的参考图放到这个空间上下文里,Atlas会生成一个在它们之间平滑过渡的世界——它会「想象」出门廊、走廊、壁龛来连接这两个场景。

Atlas支持生成长达1分钟、1440p分辨率的视频。你可以亲手设计相机路径,逐帧控制每个镜头。正如团队所说:「你是在导演一场戏,而不是在拉一台老虎机的杠杆。」

2. 空间重建:几张照片还原一个真实世界
Atlas的第二个核心能力是空间重建——从一张到几十张输入图像中重建真实世界场景。它不需要专业的采集设备,也不需要成百上千的密集视图。
「所见越多,想象越少」:当只有一张图时,Atlas会用自己的世界知识「脑补」看不见的部分。当给出更多图像时,它的重建会越来越精确。只用两三张图,Atlas就能给出可信的重建,效果甚至超过专门为3D重建训练的模型。

在演示中,团队从一张花园的地面照片开始,Atlas生成了该场景的鸟瞰视角。加入第二张照片(花园旁边的小屋)后,输出中同时出现了花园和小屋,但仍「想象」了左侧的房子。加入第三张照片(主屋)后,整个场景被精确还原。
Atlas原生支持显式3D输出——点云或3D高斯泼溅(3D Gaussian Splats)。从单张图像,Atlas就能联合生成新视角并估计其几何,输出一个完整的3D世界。点云估计场景的几何结构,而3D高斯泼溅则将其转化为可在设备上以高分辨率和高帧率渲染的完整场景。

3. 时空模拟:从「重构」到「推演」
Atlas不仅理解空间结构,还理解世界如何随时间演变。这种空间+时间的能力开启了全新的应用场景。

「子弹时间」平民化:只用三到五台普通手机摄像头,Atlas就能冻结时间,从任意角度回放事件——这以前需要专业的多相机阵列。Atlas从三到五个相机视图中重建场景,之后你可以随心所欲地重新取景。

机器人仿真的新范式:对于机器人领域,重建只是第一步。当模拟机器人在空间中移动时,Atlas还能生成它的传感器会观察到的RGB和深度数据。世界和机器人的视角来自同一个模型。

团队用手机视频拍摄了两个大型环境(每段仅用24帧重建),然后模拟不同类型的机器人沿不同路径导航,用Atlas生成机器人身上相机视角的图像。

对于机械臂操作,从几次随意的录像中,Atlas就能帮助构建一个同时捕捉物体如何移动和交互的仿真环境。一旦任务被仿真,你可以轻松地变化它——改变物体、位置、机器人运动、光照和背景——生成多样化的训练数据和测试环境。

4. 图像生成:世界模型的「副产品」
虽然Atlas的核心是世界建模,但它也是一个功能强大的图像生成器:能遵循复杂提示、渲染文字、生成多种视觉风格,还能从文本或图像生成360°全景图。

技术内核:多模态自回归扩散 Transformer
Atlas的设计理念是在一个统一的架构中处理多种任务和多种输入输出数据类型,将空间控制置于模型的核心。

它的架构是多模态自回归扩散Transformer(multimodal autoregressive diffusion transformer):
多模态:原生处理文本、图像、相机位姿和3D深度图。每张图像和深度图都关联一个显式的相机位姿,使空间控制成为架构的核心组件。 自回归:按序列顺序逐个生成输出,每个任务本质上是一种不同的序列模式。 扩散:采用修正流(rectified flow)模型,通过逐步去噪生成输出,可在推理时通过调整去噪步数来权衡速度与质量。 Transformer:以大规模矩阵乘运算为主,适配现代硬件。
Atlas融合了现代LLM和视频模型的思想。像LLM一样,它能利用KV-caching、缓存感知路由等加速技术;像视频模型一样,它能利用扩散蒸馏、无分类器引导等算法。
关键差异:Atlas将相机作为原生输入类型,而非通过文本描述相机运动。在基准测试中,第三方人类评估者判断Atlas在相机控制生成方面优于近期的视频模型,且优势随着相机轨迹变得更复杂而扩大。在3D重建任务上,Atlas也超越了最优秀的开源专用重建模型。


World Labs团队从零开始预训练Atlas,并发现随着模型规模和训练计算的增加,每个新阶段都解锁了新的模型能力。团队坚信这一趋势将持续下去。
结语:空间智能的「GPT时刻」
Atlas的发布,是空间智能领域的一个重要里程碑。它展示了一种可能性:一个模型可以同时理解、生成和模拟三维世界,而不需要为每个任务训练专门的模型。
当World Labs团队说「Atlas是一个全能世界模型」时,他们强调的不仅是技术能力,更是一种范式转变——从「为每个任务造一把专用钥匙」转向「造一把能开很多锁的万能钥匙」。
Atlas目前正与选定的合作伙伴进入早期访问阶段。它的未来版本将驱动Marble等产品。对于3D重建、机器人仿真、VFX、游戏设计等领域的从业者来说,Atlas可能意味着工作流的根本性重塑——从「采集大量数据→后处理→重建」变为「拍几张照片→让模型生成一个完整世界」。
空间智能的「GPT时刻」,或许已经到来。
项目信息:
名称:Atlas 发布机构:World Labs(李飞飞联合创办) 发布时间:2026年9月1日 核心能力:相机控制生成、空间重建、时空模拟、图像生成 技术架构:多模态自回归扩散Transformer 输出格式:2D图像、视频、点云、3D高斯泼溅 官网:https://www.worldlabs.ai
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。