Back

Atlas 深度调研:李飞飞 World Labs 的全能世界模型,与世界模型三条路线之争

2026 年 9 月 1 日,李飞飞联合创办的 World Labs 发布新一代世界模型 Atlas——官方称之为"全球首个多模态世界模型(omni world model)"。它从零预训练,原生处理文本、图像、视频、相机位姿与 3D 深度图,在同一个模型里完成世界生成、空间重建、时空模拟三件事:一张照片可以绕到背面看,三五台手机拍的素材可以做出"子弹时间",几段手机视频可以变成机器人的训练仿真环境。

这篇调研基于 World Labs 官方博客一手资料,结合公司脉络(Marble → World API → 收购 SceniX)、定量评测数据与行业路线之争(Sora/Genie 3 的生成派、LeCun 的 JEPA 表征派、World Labs 的空间智能派)做深度拆解。文末照例给出与本博客 UMM 系列的呼应、判断与待验证清单。


一、事实速览

项目 内容
发布方 World Labs(2024 年成立,李飞飞 + Justin Johnson + Ben Mildenhall(NeRF 共同发明人)+ Christoph Lassner 联合创办)
发布时间 2026 年 9 月 1 日(美国时间)
定位 面向空间智能(spatial intelligence)的全能世界模型:生成、重建、模拟任何可能的世界
架构 多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer),rectified flow,从零预训练
原生模态 文本、图像、相机位姿(camera pose)、3D 深度图;视频 = 图像序列
核心范式 空间上下文(Spatial Context):每张输入图像锚定在 3D 空间中的一个位置,模型据此自回归生成后续内容
四大能力 相机控制生成 / 空间重建 / 时空模拟 / 图像生成
生成规格 1~6 张参考图 + 手工相机路径,最长 1 分钟、1440p 视频
3D 输出 新视角帧、深度图、点云、**3D 高斯泼溅(3DGS)**场景,可在设备端高帧率渲染
评测 相机控制人评胜率 75%~94%(对 MiniMax H3 / Gemini Omni Flash / Happy Horse 1.1 / FLUX 3 / Seedance 2.5);稀疏视角 3D 重建平均误差优于全部专用开源模型
开放方式 早期访问(early access),申请制;未来驱动 Marble 等产品
论文/开源 暂无论文、未开源,技术细节以官方博客为准

公司背景一句话:World Labs 累计融资约 12.3 亿美元(2024 年 2.3 亿种子轮,a16z/NEA/Radical;2026 年 2 月 10 亿新一轮,AMD、NVIDIA、Fidelity、Sea,Autodesk 单家出资 2 亿),估值约 50 亿美元。产品节奏:2025 年 11 月 Marble(文本/图像/视频/3D 布局生成可探索 3D 世界)→ 2026 年 1 月 World API → 4 月 Marble 1.1/1.1-Plus → 7 月收购机器人仿真公司 SceniX → 9 月 Atlas。这条线很清楚:先做"能生成的世界",再补"能行动的世界"。


二、为什么是李飞飞:从 ImageNet 到空间智能

李飞飞的判断一以贯之:语言模型让机器学会了处理文字,但智能不止于文字——人类对世界的理解是三维空间性的。她的名言是"文字能扑灭火灾吗?文字能煎蛋饼吗?"物理世界的任务(导航、抓取、操作)需要的是对空间关系、几何结构、物理规律的理解,而不是 token 的接龙。

World Labs 把空间智能拆成三件事:

  1. 渲染(Render):生成能看的画面——想象中的世界;
  2. 模拟(Simulate):高保真复现真实世界,守住几何与物理结构;
  3. 规划(Plan):告诉机器人下一步怎么走、怎么抓。

Atlas 对应的正是这三件事的模型层统一:world generation(渲染)、reconstruction(模拟的入口)、simulation(规划的训练场)。她同时很克制地说过:世界模型现在的位置"大概相当于 2019 年的语言模型,密码还没破"。这句话是理解 Atlas 的正确心态——它是一个里程碑式的架构验证,不是终局。


三、四大能力拆解

3.1 相机控制生成:把相机位姿变成原生输入

主流视频生成模型的运镜控制是"文本猜谜":你在 prompt 里写"镜头缓慢向左拉升、绕着人物微仰角旋转",模型在像素空间里猜测你到底要什么。Atlas 的做法是把精确的相机几何(位置、角度、运动轨迹)作为一种原生输入类型,官方叫"像素级精准的相机控制(pixel-perfect camera control)"。

  • 单图生成任意视角:输入一张站在菜地里的铜色机器人正面照,Atlas 能生成机器人背面、并"脑补"出照片没拍到的泳池边草坪——靠的是输入内容 + 模型的世界知识。
  • 空间上下文拼接:把两张毫不相干的参考图放进上下文,分别指定它们在 3D 空间中的位置,Atlas 会生成门道、走廊、转角等过渡空间,把两个场景"焊"成一个连续世界。参考图不再只是风格参考,而是世界的组成部分
  • 可控长视频:1~6 张参考图 + 手工设计的相机路径,生成最长 1 分钟、1440p 的连贯视频。官方的比喻很到位:"你是在导演椅上布置场景(staging the scene),不是在拉老虎机的拉杆。"
  • 同场景多路径:同一组输入图可以生成多条不同相机轨迹,改变速度、长度、复杂度来调节情绪,场景始终保持 3D 一致。

本质上这是把视频生成从"时序帧预测"改写成了"空间条件下的新视角合成":模型回答的问题不是"下一帧长什么样",而是"相机移动到世界中的另一个位置时,会看到什么"。

3.2 空间重建:稀疏视角重建,超过专用模型

这是计算机视觉几十年的经典问题——novel view synthesis from sparse inputs。Atlas 的答案是"看得越多,脑补越少":

  • 2~3 张输入图通常就能给出忠实重建;上下文最多可以放进上百张图,图越多,想象成分越少,逐步逼近真实环境的精确复刻。
  • 官方案例一:一张地面视角花园照片 → 生成航拍视角(花园准确、其余脑补);加入第二张小屋照片 → 小屋出现;加入第三张主屋照片 → 整个场景准确。
  • 官方案例二:用 2~25 张地面照片逐步拼出斯坦福主方庭(Main Quad),最后能生成飞越校园上空的航拍路径,连纪念教堂立面的彩色马赛克都对得上。

关键的是显式 3D 输出:Atlas 原生同时操作 2D 图像帧和 3D 深度图,可以输出点云,并进一步补全成 3D 高斯泼溅(3DGS)场景——这正是 Marble 使用的表示,能在设备端高分辨率、高帧率渲染,可直接进入游戏、VFX、设计工作流。单图输入时联合生成新视角与几何;视频输入时逐帧预测深度并融合成 3D 重建。两种情况下,没有任何相机看到过的区域都由模型补全。

3.3 时空模拟:子弹时间与 Real-to-Sim

Reframing Video(视频重构):3~5 台普通手机/运动相机(三脚架+夹具,背包能装下)拍同一段场景,Atlas 重建后可以冻结时间、从"不可能的角度"重新取景——《黑客帝国》子弹时间,不需要几百台相机的环形阵列,也不需要专业摄影团队。

机器人 Real-to-Sim:这是收购 SceniX 之后战略意图最明显的部分。传统仿真环境搭建要靠激光雷达、深度相机等专业设备扫描,成本高、周期长;sim-to-real gap(仿真与现实的偏差)又是机器人落地的老大难。Atlas 的路径是:

  • 用手机视频(官方案例每个大场景仅 24 帧)重建空间显式 3D;
  • 模拟机器人沿不同路径导航时,由同一个模型生成机身相机本该观测到的 RGB 图像和深度数据——世界和机器人眼中的世界出自同一模型;
  • 操作任务(manipulation)更进一步:从少量随手拍摄的记录构建仿真,捕捉物体如何运动与交互,支持刚体、关节体、可变形物体;任务生成后可以随意改变物体、位置、机器人动作、光照、背景,批量产出多样化训练与测试环境。

英伟达机器人主管 Jim Fan(李飞飞高徒)评价:这是机器人领域 Real-to-Sim 的一大步

3.4 图像生成:世界模型的副产物

Atlas 的主业是世界建模,图像生成是"顺手"——但能力在线:遵循复杂 prompt、准确渲染文字、风格多样,还能从文本/图像生成 360° 全景图。官方把它放在最后讲,定位很清楚:每张图像都是"通往一个可能世界的窗口",生成单图只是世界模型的一个特例。


四、架构:多模态自回归扩散 Transformer

Atlas 的架构四个词,每个都有讲究:

属性 含义
Multimodal 原生处理文本、图像、相机位姿、深度图;视频是图像序列。每张图像/深度图都以显式相机位姿为条件——空间控制是架构的中心组件,不是外挂
Autoregressive 所有元素组成序列,逐个生成、每个输出以序列前部为条件。任务灵活性由此而来:每个任务不过是一种不同的序列(输入段 + 输出段)
Diffusion 具体是 rectified flow 潜空间扩散模型,逐步去噪生成高维连续数据(图像/视频),推理时可用去噪步数自由交换速度与质量
Transformer 以大矩阵乘为主,适配现代硬件,作为世界建模的骨干

这套设计的巧思是同时吃 LLM 和视频模型两条技术线的红利

  • 像 LLM 一样是自回归 Transformer → KV-caching、缓存感知路由(cache-aware routing)、分离式服务(disaggregated serving)等推理加速手段直接可用;
  • 像现代图像/视频模型一样是潜空间扩散 → 扩散蒸馏(少步采样)、classifier-free guidance、shifted noise schedules、VAE 改进等全部继承。

而所有这一切围绕的核心抽象是 Spatial Context(空间上下文):LLM 的上下文是一维 token 序列,Atlas 的上下文里每个视觉元素都锚定在 3D 空间的一个位姿上。模型先把输入编码进这个带坐标的上下文,再在其中自回归地"生成下一个元素"——下一个视角、下一帧、下一张深度图。生成与重建在架构上不是两个任务,而是同一种序列推理的两种排列。

Scaling 方面,官方称从零开始在大规模多模态语料上预训练,训练了一系列尺寸/算力递增的模型,每提升一档算力都解锁新能力,并预期这一趋势持续。


五、定量结果

5.1 相机控制生成(第三方人类盲评)

单图 + 1~3 个电影级相机运动(pan/truck/crane 等),Atlas 用原生相机格式输入轨迹,对照模型用文本描述相机运动。第三方评分者选择谁更好地跟随了目标路径,轨迹越复杂 Atlas 优势越大

对照模型 选择 Atlas 的比例
MiniMax H3 75%
Gemini Omni Flash 81%
Happy Horse 1.1 86%
FLUX 3 93%
Seedance 2.5 94%

5.2 稀疏视角 3D 重建(AbsRel 点图误差,×10⁻³,越低越好)

Atlas 作为全能模型,重建指标超过全部专门训练的开源重建模型(官方复现了所有基线以保证协议公平):

基准 Atlas Pi3X (posed) VGGT-Ω 1B Depth Anything 3 MapAnything
平均 25.3 28.7 34.7 36.4 47.7
DTU 8.6 11.1 16.2 9.7 18.2
ETH3D 9.3 18.7 25.4 11.4 34.8
KITTI 60.0 60.2 74.8 101.4 115.3
NRGBD 6.5 13.3 17.5 10.5 20.2
7-Scenes 37.8 39.3 44.4 45.2 50.8
T&T 42.4 42.4 47.0 40.2 60.8
ScanNet 12.4 15.7 17.4 36.6 37.0

注意这张表的意义:一个"什么都干"的 omni 模型,在传统上属于专用几何模型腹地的任务上拿到最优——这和 GAS、Swift-Image 传递的信号一致(详见第七节)。


六、行业坐标:世界模型的三条路线

"世界模型"(Craik 1943 年的"心智模型"→ 2018 年 Schmidhuber 的 Recurrent World Models)在 2025-2026 年成了显学,但路线明显分化为三派:

路线 代表 核心主张 输出形态 短板
生成派(像素预测) OpenAI Sora、DeepMind Genie 3、Odyssey "我若不能创造便不能理解",大规模视频预测中学物理;Genie 3 加入动作条件实现实时可交互(720p/24fps) 2D 视频帧 无动作条件时被质疑是"概率记忆"而非因果建模;交互限于基础导航;3D 一致性隐式、不可导出
表征派(潜在空间) LeCun(AMI Labs)、Meta V-JEPA 2、DeepMind Dreamer 4 像素是浪费,在抽象潜在空间预测状态,只保留对推理/行动有用的信息 抽象表征 / 策略 抽象表征能否支撑开放世界规划未经验证;无逼真画面,难直接进创意产业
空间智能派(显式 3D) World Labs(Marble / Atlas) 世界是三维的,模型应以显式空间结构为中心:持久、可编辑、可导出的 3D 环境 3DGS / 点云 / 可漫游世界 动态物理与交互仍在早期;生态与工具链待建

Atlas 的位置很微妙:它是生成派与空间派的合流。骨架是生成式的(自回归 + rectified flow 扩散),但它生成的不是 2D 帧序列,而是以相机位姿为骨架、3D 一致的世界,并能吐出显式几何(深度/点云/3DGS)。相比 Genie 3 的"实时可交互但 3D 隐式",Atlas 选择了"显式几何 + 离线高精度生成";相比 Marble 时代偏"3D 生成器",Atlas 把重建、模拟、生成收进了一个从零预训练的统一基座。

周边生态:NVIDIA Cosmos 走开源物理 AI 基础模型路线;国内生数科技(Vidu)提出 MoT 架构把"理解-预测-生成-行动"塞进同一基座,腾讯混元 3D、开悟世界模型 3.1(端侧驱动本体)等也在靠拢。共识是"能生成好看的视频只是入场券,能预判物理世界的下一步才是门槛"。


七、与 UMM 系列的呼应

把 Atlas 放进本博客这半年 UMM(统一多模态模型)系列的脉络里,有四个呼应值得点出:

  1. "任务即序列"的统一范式再次扩张边界。 UMM 讨论的是文本/图像/音频/视频在 token 空间的统一;Atlas 把相机位姿、深度图也变成序列元素,"每个任务不过是一种不同的序列"。自回归负责"生成什么、按什么顺序",扩散负责"高维连续内容怎么落地"——AR + Diffusion 混合架构在视频/世界域正在成为默认答案(与 Gemini Omni 系列的思路同源)。

  2. 条件信号从文本走向结构化几何。 Gemini Omni 1.1 用参考帧/场景扩展做视频控制,Swift-Image 用 4D-RoPE 编码多图位置,Atlas 干脆把相机位姿做成原生输入类型。趋势一致:文本 prompt 负责语义,精确控制要靠结构化条件。人评中轨迹越复杂 Atlas 优势越大,恰恰说明文本描述相机运动的带宽不够。

  3. "生成训练反哺理解"在 3D 域再添证据。 GAS 证明生成目标可以在零推理开销下打磨视觉理解表征;Atlas 一个生成模型在 3D 重建(典型感知/几何任务)上超过 VGGT、Depth Anything 3 等专用模型。VGAU-Diag 说"UMM 的瓶颈在视觉理解侧"——Atlas 的解法是把 3D 几何提升为一等公民,让理解在显式空间约束中发生。

  4. 时间流与空间流两条互补战线。 SeedRealtime 解决的是时间维度的统一(音视频流实时输入、turn-taking 实时决策),Atlas 解决的是空间维度的统一(相机轨迹、空间上下文、显式 3D)。一个管"什么时候该开口",一个管"移动到哪里会看到什么"。未来的具身智能体两者都要。


八、判断、局限与待验证清单

判断

  • Atlas 最大的架构贡献是 Spatial Context 抽象:把"相机位姿"从工程预处理提升为模型原生条件,把生成与重建统一为同一种序列推理。这是自 NeRF/3DGS 以来 3D 生成路线第一次有了一个可 scaling 的 omni 基座形态(官方给出了算力-能力递增曲线)。
  • 商业路径清晰:Marble(创意工具)+ World API(开发者)+ SceniX(机器人仿真)+ Autodesk 2 亿投资(DCC 工具生态),World Labs 押的是"空间智能成为影视/游戏/设计/机器人的基础设施"。
  • 它与 Genie 3 代表两种赌法:Genie 赌实时交互(世界随玩家动作即时响应),Atlas 赌显式几何与跨任务统一(高精度、可导出、可仿真)。短期内两者服务不同市场,长期看谁先补上对方的长板。

局限与待验证

  1. 脑补不等于复刻:未拍摄区域完全依赖模型先验,视角跨度越大、相机路径越长,局部几何漂移、物体形变、纹理闪烁越容易暴露。官方自己也强调"看得越多脑补越少"——这是诚实的边界说明。
  2. 通用物理模拟尚未证明:Atlas 强在几何连贯的静态空间;碰撞、流体、复杂动力学等物理规律没有公开验证。操作仿真展示了刚体/关节体/可变形物体,但细节未公开;sim-to-real gap 的弥合程度要等 SceniX 整合后的结果(行业基准约 8% 偏差仍未消除)。
  3. 子弹时间是"时刻重建"不是"物理模拟":reframing 处理的是同一时刻的多视角,物体运动的因果预测不在此列。
  4. 透明度不足:无论文、无开源、无参数量/训练数据/算力细节、无 API 定价;评测以人评和重建误差为主,"世界模拟"本身缺乏基准。早期访问,外部可复现性为零。
  5. 实时交互能力未知:1 分钟 1440p 是离线手工路径生成;能否像 Genie 3 那样实时响应用户动作输入,官方未展示。

参考链接

  1. World Labs 官方博客:Atlas: A World Model for Spatial Intelligence(2026-09-01)
  2. World Labs:Real-to-Sim-to-Real
  3. World Labs:Marble
  4. 量子位:《全球首个多模态世界模型,来了!》(2026-09-02)
  5. DeepTech 深科技:《李飞飞团队发布新一代世界模型 Atlas:从零训练,一次性打通视频生成、3D 重建与机器人仿真》(2026-09-02)
  6. 爱范儿:《刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位》(2026-09-02)
  7. 腾讯科技:《Atlas 来了,World Labs 把世界变成可生成的空间》(2026-09-02)
  8. 钛媒体:《李飞飞买下 SceniX,空间智能进入动手时代》(2026-07-22)
  9. DoNews:《世界模型概念泛滥,AI 巨头技术路线分化》(2025-12-05)
  10. AI2.Work:World Models in 2026: Why LeCun, Fei-Fei Li, and DeepMind Bet Billions on 3D AI

评论