2026 年 9 月 1 日,李飞飞联合创办的 World Labs 发布新一代世界模型 Atlas——官方称之为"全球首个多模态世界模型(omni world model)"。它从零预训练,原生处理文本、图像、视频、相机位姿与 3D 深度图,在同一个模型里完成世界生成、空间重建、时空模拟三件事:一张照片可以绕到背面看,三五台手机拍的素材可以做出"子弹时间",几段手机视频可以变成机器人的训练仿真环境。
这篇调研基于 World Labs 官方博客一手资料,结合公司脉络(Marble → World API → 收购 SceniX)、定量评测数据与行业路线之争(Sora/Genie 3 的生成派、LeCun 的 JEPA 表征派、World Labs 的空间智能派)做深度拆解。文末照例给出与本博客 UMM 系列的呼应、判断与待验证清单。
一、事实速览
| 项目 | 内容 |
|---|---|
| 发布方 | World Labs(2024 年成立,李飞飞 + Justin Johnson + Ben Mildenhall(NeRF 共同发明人)+ Christoph Lassner 联合创办) |
| 发布时间 | 2026 年 9 月 1 日(美国时间) |
| 定位 | 面向空间智能(spatial intelligence)的全能世界模型:生成、重建、模拟任何可能的世界 |
| 架构 | 多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer),rectified flow,从零预训练 |
| 原生模态 | 文本、图像、相机位姿(camera pose)、3D 深度图;视频 = 图像序列 |
| 核心范式 | 空间上下文(Spatial Context):每张输入图像锚定在 3D 空间中的一个位置,模型据此自回归生成后续内容 |
| 四大能力 | 相机控制生成 / 空间重建 / 时空模拟 / 图像生成 |
| 生成规格 | 1~6 张参考图 + 手工相机路径,最长 1 分钟、1440p 视频 |
| 3D 输出 | 新视角帧、深度图、点云、**3D 高斯泼溅(3DGS)**场景,可在设备端高帧率渲染 |
| 评测 | 相机控制人评胜率 75%~94%(对 MiniMax H3 / Gemini Omni Flash / Happy Horse 1.1 / FLUX 3 / Seedance 2.5);稀疏视角 3D 重建平均误差优于全部专用开源模型 |
| 开放方式 | 早期访问(early access),申请制;未来驱动 Marble 等产品 |
| 论文/开源 | 暂无论文、未开源,技术细节以官方博客为准 |
公司背景一句话:World Labs 累计融资约 12.3 亿美元(2024 年 2.3 亿种子轮,a16z/NEA/Radical;2026 年 2 月 10 亿新一轮,AMD、NVIDIA、Fidelity、Sea,Autodesk 单家出资 2 亿),估值约 50 亿美元。产品节奏:2025 年 11 月 Marble(文本/图像/视频/3D 布局生成可探索 3D 世界)→ 2026 年 1 月 World API → 4 月 Marble 1.1/1.1-Plus → 7 月收购机器人仿真公司 SceniX → 9 月 Atlas。这条线很清楚:先做"能生成的世界",再补"能行动的世界"。
二、为什么是李飞飞:从 ImageNet 到空间智能
李飞飞的判断一以贯之:语言模型让机器学会了处理文字,但智能不止于文字——人类对世界的理解是三维空间性的。她的名言是"文字能扑灭火灾吗?文字能煎蛋饼吗?"物理世界的任务(导航、抓取、操作)需要的是对空间关系、几何结构、物理规律的理解,而不是 token 的接龙。
World Labs 把空间智能拆成三件事:
- 渲染(Render):生成能看的画面——想象中的世界;
- 模拟(Simulate):高保真复现真实世界,守住几何与物理结构;
- 规划(Plan):告诉机器人下一步怎么走、怎么抓。
Atlas 对应的正是这三件事的模型层统一:world generation(渲染)、reconstruction(模拟的入口)、simulation(规划的训练场)。她同时很克制地说过:世界模型现在的位置"大概相当于 2019 年的语言模型,密码还没破"。这句话是理解 Atlas 的正确心态——它是一个里程碑式的架构验证,不是终局。
三、四大能力拆解
3.1 相机控制生成:把相机位姿变成原生输入
主流视频生成模型的运镜控制是"文本猜谜":你在 prompt 里写"镜头缓慢向左拉升、绕着人物微仰角旋转",模型在像素空间里猜测你到底要什么。Atlas 的做法是把精确的相机几何(位置、角度、运动轨迹)作为一种原生输入类型,官方叫"像素级精准的相机控制(pixel-perfect camera control)"。
- 单图生成任意视角:输入一张站在菜地里的铜色机器人正面照,Atlas 能生成机器人背面、并"脑补"出照片没拍到的泳池边草坪——靠的是输入内容 + 模型的世界知识。
- 空间上下文拼接:把两张毫不相干的参考图放进上下文,分别指定它们在 3D 空间中的位置,Atlas 会生成门道、走廊、转角等过渡空间,把两个场景"焊"成一个连续世界。参考图不再只是风格参考,而是世界的组成部分。
- 可控长视频:1~6 张参考图 + 手工设计的相机路径,生成最长 1 分钟、1440p 的连贯视频。官方的比喻很到位:"你是在导演椅上布置场景(staging the scene),不是在拉老虎机的拉杆。"
- 同场景多路径:同一组输入图可以生成多条不同相机轨迹,改变速度、长度、复杂度来调节情绪,场景始终保持 3D 一致。
本质上这是把视频生成从"时序帧预测"改写成了"空间条件下的新视角合成":模型回答的问题不是"下一帧长什么样",而是"相机移动到世界中的另一个位置时,会看到什么"。
3.2 空间重建:稀疏视角重建,超过专用模型
这是计算机视觉几十年的经典问题——novel view synthesis from sparse inputs。Atlas 的答案是"看得越多,脑补越少":
- 2~3 张输入图通常就能给出忠实重建;上下文最多可以放进上百张图,图越多,想象成分越少,逐步逼近真实环境的精确复刻。
- 官方案例一:一张地面视角花园照片 → 生成航拍视角(花园准确、其余脑补);加入第二张小屋照片 → 小屋出现;加入第三张主屋照片 → 整个场景准确。
- 官方案例二:用 2~25 张地面照片逐步拼出斯坦福主方庭(Main Quad),最后能生成飞越校园上空的航拍路径,连纪念教堂立面的彩色马赛克都对得上。
关键的是显式 3D 输出:Atlas 原生同时操作 2D 图像帧和 3D 深度图,可以输出点云,并进一步补全成 3D 高斯泼溅(3DGS)场景——这正是 Marble 使用的表示,能在设备端高分辨率、高帧率渲染,可直接进入游戏、VFX、设计工作流。单图输入时联合生成新视角与几何;视频输入时逐帧预测深度并融合成 3D 重建。两种情况下,没有任何相机看到过的区域都由模型补全。
3.3 时空模拟:子弹时间与 Real-to-Sim
Reframing Video(视频重构):3~5 台普通手机/运动相机(三脚架+夹具,背包能装下)拍同一段场景,Atlas 重建后可以冻结时间、从"不可能的角度"重新取景——《黑客帝国》子弹时间,不需要几百台相机的环形阵列,也不需要专业摄影团队。
机器人 Real-to-Sim:这是收购 SceniX 之后战略意图最明显的部分。传统仿真环境搭建要靠激光雷达、深度相机等专业设备扫描,成本高、周期长;sim-to-real gap(仿真与现实的偏差)又是机器人落地的老大难。Atlas 的路径是:
- 用手机视频(官方案例每个大场景仅 24 帧)重建空间显式 3D;
- 模拟机器人沿不同路径导航时,由同一个模型生成机身相机本该观测到的 RGB 图像和深度数据——世界和机器人眼中的世界出自同一模型;
- 操作任务(manipulation)更进一步:从少量随手拍摄的记录构建仿真,捕捉物体如何运动与交互,支持刚体、关节体、可变形物体;任务生成后可以随意改变物体、位置、机器人动作、光照、背景,批量产出多样化训练与测试环境。
英伟达机器人主管 Jim Fan(李飞飞高徒)评价:这是机器人领域 Real-to-Sim 的一大步。
3.4 图像生成:世界模型的副产物
Atlas 的主业是世界建模,图像生成是"顺手"——但能力在线:遵循复杂 prompt、准确渲染文字、风格多样,还能从文本/图像生成 360° 全景图。官方把它放在最后讲,定位很清楚:每张图像都是"通往一个可能世界的窗口",生成单图只是世界模型的一个特例。
四、架构:多模态自回归扩散 Transformer
Atlas 的架构四个词,每个都有讲究:
| 属性 | 含义 |
|---|---|
| Multimodal | 原生处理文本、图像、相机位姿、深度图;视频是图像序列。每张图像/深度图都以显式相机位姿为条件——空间控制是架构的中心组件,不是外挂 |
| Autoregressive | 所有元素组成序列,逐个生成、每个输出以序列前部为条件。任务灵活性由此而来:每个任务不过是一种不同的序列(输入段 + 输出段) |
| Diffusion | 具体是 rectified flow 潜空间扩散模型,逐步去噪生成高维连续数据(图像/视频),推理时可用去噪步数自由交换速度与质量 |
| Transformer | 以大矩阵乘为主,适配现代硬件,作为世界建模的骨干 |
这套设计的巧思是同时吃 LLM 和视频模型两条技术线的红利:
- 像 LLM 一样是自回归 Transformer → KV-caching、缓存感知路由(cache-aware routing)、分离式服务(disaggregated serving)等推理加速手段直接可用;
- 像现代图像/视频模型一样是潜空间扩散 → 扩散蒸馏(少步采样)、classifier-free guidance、shifted noise schedules、VAE 改进等全部继承。
而所有这一切围绕的核心抽象是 Spatial Context(空间上下文):LLM 的上下文是一维 token 序列,Atlas 的上下文里每个视觉元素都锚定在 3D 空间的一个位姿上。模型先把输入编码进这个带坐标的上下文,再在其中自回归地"生成下一个元素"——下一个视角、下一帧、下一张深度图。生成与重建在架构上不是两个任务,而是同一种序列推理的两种排列。
Scaling 方面,官方称从零开始在大规模多模态语料上预训练,训练了一系列尺寸/算力递增的模型,每提升一档算力都解锁新能力,并预期这一趋势持续。
五、定量结果
5.1 相机控制生成(第三方人类盲评)
单图 + 1~3 个电影级相机运动(pan/truck/crane 等),Atlas 用原生相机格式输入轨迹,对照模型用文本描述相机运动。第三方评分者选择谁更好地跟随了目标路径,轨迹越复杂 Atlas 优势越大:
| 对照模型 | 选择 Atlas 的比例 |
|---|---|
| MiniMax H3 | 75% |
| Gemini Omni Flash | 81% |
| Happy Horse 1.1 | 86% |
| FLUX 3 | 93% |
| Seedance 2.5 | 94% |
5.2 稀疏视角 3D 重建(AbsRel 点图误差,×10⁻³,越低越好)
Atlas 作为全能模型,重建指标超过全部专门训练的开源重建模型(官方复现了所有基线以保证协议公平):
| 基准 | Atlas | Pi3X (posed) | VGGT-Ω 1B | Depth Anything 3 | MapAnything |
|---|---|---|---|---|---|
| 平均 | 25.3 | 28.7 | 34.7 | 36.4 | 47.7 |
| DTU | 8.6 | 11.1 | 16.2 | 9.7 | 18.2 |
| ETH3D | 9.3 | 18.7 | 25.4 | 11.4 | 34.8 |
| KITTI | 60.0 | 60.2 | 74.8 | 101.4 | 115.3 |
| NRGBD | 6.5 | 13.3 | 17.5 | 10.5 | 20.2 |
| 7-Scenes | 37.8 | 39.3 | 44.4 | 45.2 | 50.8 |
| T&T | 42.4 | 42.4 | 47.0 | 40.2 | 60.8 |
| ScanNet | 12.4 | 15.7 | 17.4 | 36.6 | 37.0 |
注意这张表的意义:一个"什么都干"的 omni 模型,在传统上属于专用几何模型腹地的任务上拿到最优——这和 GAS、Swift-Image 传递的信号一致(详见第七节)。
六、行业坐标:世界模型的三条路线
"世界模型"(Craik 1943 年的"心智模型"→ 2018 年 Schmidhuber 的 Recurrent World Models)在 2025-2026 年成了显学,但路线明显分化为三派:
| 路线 | 代表 | 核心主张 | 输出形态 | 短板 |
|---|---|---|---|---|
| 生成派(像素预测) | OpenAI Sora、DeepMind Genie 3、Odyssey | "我若不能创造便不能理解",大规模视频预测中学物理;Genie 3 加入动作条件实现实时可交互(720p/24fps) | 2D 视频帧 | 无动作条件时被质疑是"概率记忆"而非因果建模;交互限于基础导航;3D 一致性隐式、不可导出 |
| 表征派(潜在空间) | LeCun(AMI Labs)、Meta V-JEPA 2、DeepMind Dreamer 4 | 像素是浪费,在抽象潜在空间预测状态,只保留对推理/行动有用的信息 | 抽象表征 / 策略 | 抽象表征能否支撑开放世界规划未经验证;无逼真画面,难直接进创意产业 |
| 空间智能派(显式 3D) | World Labs(Marble / Atlas) | 世界是三维的,模型应以显式空间结构为中心:持久、可编辑、可导出的 3D 环境 | 3DGS / 点云 / 可漫游世界 | 动态物理与交互仍在早期;生态与工具链待建 |
Atlas 的位置很微妙:它是生成派与空间派的合流。骨架是生成式的(自回归 + rectified flow 扩散),但它生成的不是 2D 帧序列,而是以相机位姿为骨架、3D 一致的世界,并能吐出显式几何(深度/点云/3DGS)。相比 Genie 3 的"实时可交互但 3D 隐式",Atlas 选择了"显式几何 + 离线高精度生成";相比 Marble 时代偏"3D 生成器",Atlas 把重建、模拟、生成收进了一个从零预训练的统一基座。
周边生态:NVIDIA Cosmos 走开源物理 AI 基础模型路线;国内生数科技(Vidu)提出 MoT 架构把"理解-预测-生成-行动"塞进同一基座,腾讯混元 3D、开悟世界模型 3.1(端侧驱动本体)等也在靠拢。共识是"能生成好看的视频只是入场券,能预判物理世界的下一步才是门槛"。
七、与 UMM 系列的呼应
把 Atlas 放进本博客这半年 UMM(统一多模态模型)系列的脉络里,有四个呼应值得点出:
-
"任务即序列"的统一范式再次扩张边界。 UMM 讨论的是文本/图像/音频/视频在 token 空间的统一;Atlas 把相机位姿、深度图也变成序列元素,"每个任务不过是一种不同的序列"。自回归负责"生成什么、按什么顺序",扩散负责"高维连续内容怎么落地"——AR + Diffusion 混合架构在视频/世界域正在成为默认答案(与 Gemini Omni 系列的思路同源)。
-
条件信号从文本走向结构化几何。 Gemini Omni 1.1 用参考帧/场景扩展做视频控制,Swift-Image 用 4D-RoPE 编码多图位置,Atlas 干脆把相机位姿做成原生输入类型。趋势一致:文本 prompt 负责语义,精确控制要靠结构化条件。人评中轨迹越复杂 Atlas 优势越大,恰恰说明文本描述相机运动的带宽不够。
-
"生成训练反哺理解"在 3D 域再添证据。 GAS 证明生成目标可以在零推理开销下打磨视觉理解表征;Atlas 一个生成模型在 3D 重建(典型感知/几何任务)上超过 VGGT、Depth Anything 3 等专用模型。VGAU-Diag 说"UMM 的瓶颈在视觉理解侧"——Atlas 的解法是把 3D 几何提升为一等公民,让理解在显式空间约束中发生。
-
时间流与空间流两条互补战线。 SeedRealtime 解决的是时间维度的统一(音视频流实时输入、turn-taking 实时决策),Atlas 解决的是空间维度的统一(相机轨迹、空间上下文、显式 3D)。一个管"什么时候该开口",一个管"移动到哪里会看到什么"。未来的具身智能体两者都要。
八、判断、局限与待验证清单
判断
- Atlas 最大的架构贡献是 Spatial Context 抽象:把"相机位姿"从工程预处理提升为模型原生条件,把生成与重建统一为同一种序列推理。这是自 NeRF/3DGS 以来 3D 生成路线第一次有了一个可 scaling 的 omni 基座形态(官方给出了算力-能力递增曲线)。
- 商业路径清晰:Marble(创意工具)+ World API(开发者)+ SceniX(机器人仿真)+ Autodesk 2 亿投资(DCC 工具生态),World Labs 押的是"空间智能成为影视/游戏/设计/机器人的基础设施"。
- 它与 Genie 3 代表两种赌法:Genie 赌实时交互(世界随玩家动作即时响应),Atlas 赌显式几何与跨任务统一(高精度、可导出、可仿真)。短期内两者服务不同市场,长期看谁先补上对方的长板。
局限与待验证
- 脑补不等于复刻:未拍摄区域完全依赖模型先验,视角跨度越大、相机路径越长,局部几何漂移、物体形变、纹理闪烁越容易暴露。官方自己也强调"看得越多脑补越少"——这是诚实的边界说明。
- 通用物理模拟尚未证明:Atlas 强在几何连贯的静态空间;碰撞、流体、复杂动力学等物理规律没有公开验证。操作仿真展示了刚体/关节体/可变形物体,但细节未公开;sim-to-real gap 的弥合程度要等 SceniX 整合后的结果(行业基准约 8% 偏差仍未消除)。
- 子弹时间是"时刻重建"不是"物理模拟":reframing 处理的是同一时刻的多视角,物体运动的因果预测不在此列。
- 透明度不足:无论文、无开源、无参数量/训练数据/算力细节、无 API 定价;评测以人评和重建误差为主,"世界模拟"本身缺乏基准。早期访问,外部可复现性为零。
- 实时交互能力未知:1 分钟 1440p 是离线手工路径生成;能否像 Genie 3 那样实时响应用户动作输入,官方未展示。
参考链接
- World Labs 官方博客:Atlas: A World Model for Spatial Intelligence(2026-09-01)
- World Labs:Real-to-Sim-to-Real
- World Labs:Marble
- 量子位:《全球首个多模态世界模型,来了!》(2026-09-02)
- DeepTech 深科技:《李飞飞团队发布新一代世界模型 Atlas:从零训练,一次性打通视频生成、3D 重建与机器人仿真》(2026-09-02)
- 爱范儿:《刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位》(2026-09-02)
- 腾讯科技:《Atlas 来了,World Labs 把世界变成可生成的空间》(2026-09-02)
- 钛媒体:《李飞飞买下 SceniX,空间智能进入动手时代》(2026-07-22)
- DoNews:《世界模型概念泛滥,AI 巨头技术路线分化》(2025-12-05)
- AI2.Work:World Models in 2026: Why LeCun, Fei-Fei Li, and DeepMind Bet Billions on 3D AI