AI教母李飞飞的创业公司 World Labs 正式发布了一款专注于「空间智能」(Spatial Intelligence)的全能世界模型——Atlas。作为云栈社区持续关注的前沿动态之一,Atlas 的定位很明确:生成、重建和模拟任意可能的世界,从底层理解物理世界的呈现、行为与演变。

Atlas 基于多模态自回归扩散 Transformer 架构,通过独创的「空间上下文」将文本、图像与 3D 深度无缝锚定在同一空间坐标系中。它不仅能生成带像素级相机控制的超长视频,还能从稀疏视角重建高保真三维世界,并凭借高精度时空模拟为机器人领域提供 Real-to-Sim 训练仿真。伴随算力与数据的持续规模化扩展,Atlas 有可能重新定义人类生成、重建与模拟物理世界的技术范式。

一、Atlas 核心架构特性
Atlas 从零开始预训练,原生支持文本、图像、视频和 3D 数据。它通过逐步去噪的流匹配(Rectified Flow)方式生成高维度连续数据,并能以自回归的方式每次生成序列中的一个元素,从而灵活适配多种输入与输出任务。这也是它与传统生成模型最本质的区别之一:不是一个工具去「套」另一个任务,而是同一种模型框架同时处理多模态信号。

2、空间上下文(Spatial Context)
语言模型把词元(Tokens)编码为上下文,Atlas 的思路与之类似——它将每张图像和深度图都关联到 3D 空间中的具体位置,形成独特的「空间上下文」。这让 Atlas 能够在不同图像、视角之间平滑过渡,同时维持三维空间的一致性。换句话说,它不是在「猜」下一帧长什么样,而是在空间坐标里推算下一帧应该出现在哪里。

实际使用中,你可以先选择左侧和右侧的框架构建空间上下文,Atlas 会自动把这些框架连接起来,形成连贯的空间轨迹。

3、技术融合与可扩展性
Atlas 融合了现代 LLM(如 KV 缓存、离散化服务)与潜在扩散模型(如扩散蒸馏、无分类器指导)的技术优势。实验显示,模型性能会随着训练算力与多模态数据规模的扩大而持续显著提升。也就是说,这并非一个「差不多能用」的演示模型,而是沿着规模化路径不断变强的底座型架构。
二、四大核心功能与应用
1、相机控制生成
Atlas 支持像素级的精确相机控制。它把精准的相机几何参数直接作为原生输入,摆脱了传统视频模型靠模糊文字描述相机运动的局限。用户可以设计特定的镜头轨迹,模型能从单张或多张参考图像中生成长达 1 分钟、分辨率达 1440p 的高保真视频,并对未见过的场景区域进行合理的空间想象与外推。
当然,这只是能力之一。真正让人在意的是它的泛化表现。


Atlas 能够处理各种场景类型、视觉风格以及摄像机运动方式。从单张图片出发,它可以生成任何角度的视图,点击图片即可切换不同视角。


2、空间重建(Spatial Reconstruction)
Atlas 能够从一个或多个输入图像中重建真实世界的空间场景,不需要特殊采集设备,也不需要几百张高密度视图。这恰恰解决了 3D 计算机视觉中长期存在的「稀疏视角合成」难题。
基于多张图片进行重建:仅凭一到数十张稀疏输入图像,Atlas 即可高保真地重建真实世界的物体与场景。举个例子,Atlas 仅根据 1 到 3 张地面照片就生成了场景的鸟瞰图。

重建不同的路径:Atlas 可以对同一场景生成多种不同轨迹,从而从不同角度观察相同的输入图像。只要提供一组合适的输入图像,它就能生成多条相机路径来遍历同一场景。


直接输出 3D 结果:除了生成 2D 视角,Atlas 还能直接输出 3D 点云或 3D 高斯泼溅(3D Gaussian Splats)。这些结果可直接用于游戏、机器人、VFX 等工作流,并与 World Labs 的 Marble 等产品无缝集成。例如,从一张图片出发,Atlas 可以先生成新视图和 3D 几何模型,再将这些模型转换为 3D 高斯光斑效果。


从单一输入图像开始,Atlas 能够生成完整的 3D 世界模型。它一边生成新视图,一边估算几何结构,从而构建 3D 场景。对于真实空间的视频画面,Atlas 会预测每一帧的深度信息,并将这些信息整合成 3D 重建结果。无论哪种情况,Atlas 都会填补那些从未被任何相机捕捉到的区域。例如,Atlas 可以直接从输入视频中重建出 3D 点云数据。


点云数据可用来估算场景几何结构,而 3D 高斯斑点则让这些结构真正具备实用价值。将点云转化为完整的高斯斑点场景后,就可以在设备上以高分辨率和高帧率渲染。这种表示方式与 Marble 所用的一致,使 Atlas 能自然地与其他产品集成。下面展示的就是由 Atlas 技术重建的高斯分片场景。


3、时空模拟(Space-Time Simulation)
Atlas 既能理解世界的空间结构,也能捕捉世界随时间变化的趋势。空间与时间能力结合后,它在视觉特效、机器人技术等领域都有很现实的落地可能。
视频重构:仅需 3 到 5 个普通手机在不同角度拍摄的视频,Atlas 就能「冻结时间」,重构出任意视角的「子弹时间」画面。


机器人模拟:Atlas 能显著加速 Real-to-Sim(真实到模拟)工作流。它可以模拟机器人导航时传感器可能观察到的 RGB 和深度数据;在物体操作方面,仅凭少量录像就能模拟刚体、关节体和可变形物体的物理交互,并任意改变光照、背景和材质,为机器人训练提供多元化的虚拟测试数据。



Atlas 还能辅助构建仿真模型,捕捉物体之间的运动与互动方式。一旦某个任务被模拟出来,就能灵活修改:更换物体、调整位置、改变机器人运动方式、切换照明效果和背景环境,从而得到多样化的训练数据和规模化的机器人测试环境。


图像生成:虽然图像生成不是 Atlas 的首要定位,但它同样具备出色的表现。Atlas 能遵循复杂提示词、精准渲染文本,并生成各种艺术风格的 360 度全景图。


三、性能与评测表现
1、相机控制超越主流视频模型
在与 MiniMax H3、Gemini Omni Flash、FLUX 3 等近期主流视频模型的对比测试中,第三方人类评估显示 Atlas 展现了极强的相机轨迹遵循能力。轨迹越复杂,Atlas 的领先优势越明显。

2、重建精度击败专门模型
在 DTU、KITTI、ScanNet 等多项 3D 重建基准测试中,作为全能模型的 Atlas 在点图误差(AbsRel Error)上击败了 Pi3X、Depth Anything 3 等多款专门针对 3D 重建优化的开源模型。一个通用模型能在专业基准上压过专用模型,这一点多少有些出人意料。

结语
Atlas 把文本、图像、视频和 3D 数据原生地、自回归地融合进统一的「空间上下文」中,彻底打破了传统生成模型局限于二维平面或孤立帧的桎梏。从超高画质、像素级精准的相机路径控制,到攻克三维计算机视觉中稀疏视角场景重建的长期难题,再到赋能机器人学关键的 Real-to-Sim 时空模拟,Atlas 让创作者和工程师坐上了设计、模拟与重塑世界运行规律的「导演席」。
随着计算算力与多模态数据规模持续扩展,作为通用世界模型的 Atlas 很可能开启一个由空间智能主导、虚实深度交融的全新技术范式。
参考资料:
- 李飞飞的 Twitter:https://x.com/drfeifei
- Atlas: A World Model for Spatial Intelligence:https://www.worldlabs.ai/blog/atlas