World Labs Atlas 是什么?一张图片也能生成 3D 世界

world-labs-atlas

大多数生成式 AI,生成的是一张图片或一段视频。

World Labs 想做的却更进一步:让 AI 生成一个可以移动、观察和探索的世界。

最新发布的 Atlas,就是 World Labs 对这一方向的最新尝试。

Atlas 是一个围绕 空间智能(Spatial Intelligence) 构建的多模态世界模型。给它一张图片,它不仅可以生成新的视角,还能理解场景中的空间关系、重建 3D 环境、控制镜头移动,甚至为机器人生成模拟空间。

简单来说:

Atlas 不只是生成一张图,而是在尝试理解“这张图背后的世界”。

World Labs Atlas 是什么?

World Labs 将 Atlas 定义为一种 Omni World Model(全模态世界模型)

它可以同时处理多种信息,包括:

  • 文本
  • 图片
  • 视频
  • 相机位置
  • 3D 深度信息

传统图片生成模型更关注“画面看起来像什么”。

Atlas 则进一步尝试理解:

这些物体到底位于空间中的什么位置。

举个简单的例子。

如果你上传一张房间照片,普通图片生成模型可能会生成另一张类似的房间图片。

但 Atlas 会尝试推断整个房间的空间结构。

之后,你可以把“相机”移动到照片中从未拍摄过的位置,让 Atlas 生成从新角度应该看到的画面。

这也是世界模型和普通图片生成模型最大的区别之一。

new-camera-view
Atlas 可以从新的相机位置生成不同视角,同时尽量保持场景结构一致。来源:World Labs。

Atlas 的核心能力:精准控制相机

目前很多 AI 视频模型都可以生成运镜效果。

但“控制镜头”依然是一个问题。

比如输入:

让镜头缓慢绕着人物移动。

最终镜头怎么转、转多少、从什么角度转,仍然很大程度由模型自己决定。

World Labs Atlas 的不同之处在于:

它可以直接使用相机几何信息作为输入。

这意味着创作者可以更准确地控制:

  • 相机位置
  • 镜头角度
  • 移动方向
  • 运动路径
  • 镜头切换

World Labs 将其称为 Pixel-Perfect Camera Control

相比反复生成视频直到“碰巧得到正确镜头”,Atlas 更接近传统 3D 软件中的镜头控制方式。

这项能力可能非常适合:

  • 电影和短片制作
  • 游戏开发
  • 广告制作
  • 虚拟拍摄
  • 建筑设计
  • 3D 可视化

对于专业内容创作来说,这可能比单纯提升视频画质更重要。

Atlas 可生成最长一分钟的 1440p 视频

World Labs 表示,Atlas 可以结合参考图片和预设相机路径,生成最长约 1 分钟、1440p 分辨率的视频。

但 Atlas 真正值得关注的,并不是“视频更长”。

而是空间一致性

例如,当镜头在一个房间里移动时:

  • 桌子不能突然消失
  • 门不能换到另一面墙
  • 窗户的位置不能不断变化
  • 角色和物体之间的距离应该保持稳定

传统 AI 视频模型很容易在长镜头中出现这类问题。

Atlas 则试图让模型理解场景本身的 3D 结构,从而让不同视角之间保持更稳定的一致性。

对于 AI 视频来说,这可能是从“生成一段画面”走向“生成一个空间”的关键一步。

Atlas 可以从图片重建 3D 场景

Atlas 不只是一个视频生成模型。

它还可以用来进行 3D 场景重建

给 Atlas 一张或多张真实环境的图片,它可以根据已有画面推测未被拍摄的部分,并生成新的观察视角。

如果输入更多参考图片,模型得到的信息就会更加完整,也就不需要过多猜测缺失区域。

Atlas 还可以生成明确的 3D 数据,例如:

  • 点云(Point Clouds)
  • 3D Gaussian Splats(3D 高斯泼溅)

这意味着生成结果未来可以不仅停留在图片或视频中,还可能继续进入真正的 3D 工作流。

例如:

  • 游戏场景
  • 3D 设计
  • VFX
  • 数字孪生
  • 仿真系统
  • 机器人训练

3d-scene
Atlas 可以根据图片生成新的场景视角,并进一步生成 Gaussian Splats 等 3D 表示。来源:World Labs。

为什么 Atlas 被称为“世界模型”?

最近几年,World Model(世界模型) 开始成为 AI 领域非常热门的概念。

大型语言模型主要学习的是:

文字、概念和知识之间的关系。

世界模型则更关注:

物体、空间、运动和时间之间的关系。

例如,一个机器人看到一把椅子,仅仅识别出“这是一把椅子”还不够。

它还需要知道:

  • 椅子在哪里
  • 椅子距离自己有多远
  • 椅子有多高
  • 自己能不能绕过去
  • 从侧面看椅子是什么样子
  • 如果碰到椅子会发生什么

这类能力就是 World Labs 所强调的 空间智能

如果大语言模型让 AI 更擅长理解语言,那么世界模型想解决的,则是 AI 如何理解真实世界中的空间关系。

Atlas 为什么可能改变机器人训练?

Atlas 一个很重要的应用方向,并不是生成电影。

而是机器人和 Physical AI

训练机器人通常有两种方式:

一种是在真实世界中不断测试。

另一种是在模拟环境中训练。

真实训练成本高、速度慢,而且可能存在安全风险。

模拟训练效率更高,但创建真实、复杂的虚拟环境同样需要大量时间。

Atlas 提供了一种新的可能性:

直接把真实环境转换成可用于模拟的数字空间。

整个流程可能变成:

记录真实环境 → 重建 3D 场景 → 生成不同情况 → 训练或测试机器人

move-around-subject
Atlas 可以重建真实空间,并模拟机器人在不同位置可能看到的环境。来源:World Labs。

例如,可以先拍摄一个仓库,再让 Atlas 重建完整空间。

之后,开发者就可以模拟不同光线、障碍物、相机位置甚至移动路线,测试机器人在不同条件下的表现。

如果这类世界模型未来能够稳定扩展,它可能成为机器人训练的重要基础设施。

Atlas 也可以作为 AI 图片生成器

虽然 Atlas 的重点是空间理解,但它同样具备一些常见的图片生成能力。

包括:

  • 文生图
  • 不同艺术风格
  • 图片中文字生成
  • 360° 全景图片

不过,只把 Atlas 看成图片生成器,就会低估它真正想做的事情。

对于传统 AI 图片模型来说:

一张图片就是最终输出。

但对于 Atlas 来说:

一张图片只是一个世界中的某个观察角度。

模型真正需要理解的是,这张图片之外的空间可能是什么样子。

World Labs Atlas vs 传统 AI 视频生成

如果还不清楚 Atlas 和普通 AI 视频模型有什么区别,可以看下面这张表。

传统 AI 视频生成 World Labs Atlas
生成一段视频 生成或重建一个空间世界
镜头主要通过 Prompt 控制 可以直接使用相机几何信息
重点是单个视频片段 更强调不同视角之间的一致性
主要输出 2D 视频 支持 2D 与 3D 输出
主要用于内容创作 可用于创作、3D 重建、仿真和机器人

因此,Atlas 并不是简单地和其他 AI 视频生成器竞争。

它想解决的是一个更基础的问题:

AI 能不能真正理解一个空间,并从不同位置观察这个空间?

你也可以 查看 World Labs 官方 Atlas 视频,更直观地了解 Atlas 的实际效果。

用 iWeaver 更快研究 Atlas 和其他世界模型

像 Atlas 这样的新模型发布后,真正麻烦的往往不是“没有信息”。

而是信息太多,而且散落在不同地方

为了真正判断一个新模型有没有突破,通常需要同时查看:

  • 官方博客
  • 技术报告
  • 研究论文
  • YouTube 演示
  • Benchmark 数据
  • 开发者测试
  • 社区反馈
  • 竞品资料

资料一多,很容易出现一个问题:

看了很多内容,但最后不知道哪些信息来自哪里,也很难快速对比不同模型之间的差异。

使用 iWeaver,你可以把网页、PDF、视频和研究笔记放到同一个工作空间中,快速整理重点、对比不同来源,并持续追溯到原始资料。

例如,在研究 Atlas 时,可以把:

World Labs 官方介绍 + 技术资料 + Demo 视频 + 竞品模型

放在一起进行总结和对比。

这样关注的就不只是:

“Atlas 发布了。”

而是:

Atlas 到底解决了什么问题,它和之前的世界模型相比有什么不同?

对于更新速度非常快的 AI 行业,这种研究方式会更高效。

World Labs Atlas 现在可以使用吗?

目前,Atlas 还没有全面向普通用户开放。

World Labs 表示,Atlas 正在向部分合作伙伴提供 Early Access

普通用户什么时候可以直接使用,目前还没有公布明确时间。

Atlas 未来预计也会用于 World Labs 的 Marble 产品。

所以现阶段,Atlas 更像是 World Labs 对下一代空间 AI 能力的一次展示。

对于普通用户来说,它暂时还不是一个可以立即加入日常工作流的工具。

Atlas 代表了 AI 的下一个方向吗?

过去几年,AI 已经越来越擅长生成:

  • 文字
  • 图片
  • 音频
  • 视频

但这些内容大多数仍然是独立存在的。

一张图片就是一张图片。

一段视频就是一段视频。

Atlas 所代表的世界模型方向,则开始尝试回答一个不同的问题:

AI 能不能理解这些画面背后的空间?

如果答案最终是肯定的,那么未来生成式 AI 可能不再只是生成一个个独立素材。

它可能生成的是一个完整、持续存在的数字环境。

人可以进入。

相机可以移动。

游戏角色可以行动。

机器人也可以在其中训练。

Atlas 目前仍处于早期阶段。

但相比“又一个更强的图片或视频模型”,它真正值得关注的,是 AI 正在开始从生成内容走向理解世界