大多数生成式 AI,生成的是一张图片或一段视频。
World Labs 想做的却更进一步:让 AI 生成一个可以移动、观察和探索的世界。
最新发布的 Atlas,就是 World Labs 对这一方向的最新尝试。
Atlas 是一个围绕 空间智能(Spatial Intelligence) 构建的多模态世界模型。给它一张图片,它不仅可以生成新的视角,还能理解场景中的空间关系、重建 3D 环境、控制镜头移动,甚至为机器人生成模拟空间。
简单来说:
Atlas 不只是生成一张图,而是在尝试理解“这张图背后的世界”。
World Labs Atlas 是什么?
World Labs 将 Atlas 定义为一种 Omni World Model(全模态世界模型)。
它可以同时处理多种信息,包括:
- 文本
- 图片
- 视频
- 相机位置
- 3D 深度信息
传统图片生成模型更关注“画面看起来像什么”。
Atlas 则进一步尝试理解:
这些物体到底位于空间中的什么位置。
举个简单的例子。
如果你上传一张房间照片,普通图片生成模型可能会生成另一张类似的房间图片。
但 Atlas 会尝试推断整个房间的空间结构。
之后,你可以把“相机”移动到照片中从未拍摄过的位置,让 Atlas 生成从新角度应该看到的画面。
这也是世界模型和普通图片生成模型最大的区别之一。

Atlas 的核心能力:精准控制相机
目前很多 AI 视频模型都可以生成运镜效果。
但“控制镜头”依然是一个问题。
比如输入:
让镜头缓慢绕着人物移动。
最终镜头怎么转、转多少、从什么角度转,仍然很大程度由模型自己决定。
World Labs Atlas 的不同之处在于:
它可以直接使用相机几何信息作为输入。
这意味着创作者可以更准确地控制:
- 相机位置
- 镜头角度
- 移动方向
- 运动路径
- 镜头切换
World Labs 将其称为 Pixel-Perfect Camera Control。
相比反复生成视频直到“碰巧得到正确镜头”,Atlas 更接近传统 3D 软件中的镜头控制方式。
这项能力可能非常适合:
- 电影和短片制作
- 游戏开发
- 广告制作
- 虚拟拍摄
- 建筑设计
- 3D 可视化
对于专业内容创作来说,这可能比单纯提升视频画质更重要。
Atlas 可生成最长一分钟的 1440p 视频
World Labs 表示,Atlas 可以结合参考图片和预设相机路径,生成最长约 1 分钟、1440p 分辨率的视频。
但 Atlas 真正值得关注的,并不是“视频更长”。
而是空间一致性。
例如,当镜头在一个房间里移动时:
- 桌子不能突然消失
- 门不能换到另一面墙
- 窗户的位置不能不断变化
- 角色和物体之间的距离应该保持稳定
传统 AI 视频模型很容易在长镜头中出现这类问题。
Atlas 则试图让模型理解场景本身的 3D 结构,从而让不同视角之间保持更稳定的一致性。
对于 AI 视频来说,这可能是从“生成一段画面”走向“生成一个空间”的关键一步。
Atlas 可以从图片重建 3D 场景
Atlas 不只是一个视频生成模型。
它还可以用来进行 3D 场景重建。
给 Atlas 一张或多张真实环境的图片,它可以根据已有画面推测未被拍摄的部分,并生成新的观察视角。
如果输入更多参考图片,模型得到的信息就会更加完整,也就不需要过多猜测缺失区域。
Atlas 还可以生成明确的 3D 数据,例如:
- 点云(Point Clouds)
- 3D Gaussian Splats(3D 高斯泼溅)
这意味着生成结果未来可以不仅停留在图片或视频中,还可能继续进入真正的 3D 工作流。
例如:
- 游戏场景
- 3D 设计
- VFX
- 数字孪生
- 仿真系统
- 机器人训练

为什么 Atlas 被称为“世界模型”?
最近几年,World Model(世界模型) 开始成为 AI 领域非常热门的概念。
大型语言模型主要学习的是:
文字、概念和知识之间的关系。
世界模型则更关注:
物体、空间、运动和时间之间的关系。
例如,一个机器人看到一把椅子,仅仅识别出“这是一把椅子”还不够。
它还需要知道:
- 椅子在哪里
- 椅子距离自己有多远
- 椅子有多高
- 自己能不能绕过去
- 从侧面看椅子是什么样子
- 如果碰到椅子会发生什么
这类能力就是 World Labs 所强调的 空间智能。
如果大语言模型让 AI 更擅长理解语言,那么世界模型想解决的,则是 AI 如何理解真实世界中的空间关系。
Atlas 为什么可能改变机器人训练?
Atlas 一个很重要的应用方向,并不是生成电影。
而是机器人和 Physical AI。
训练机器人通常有两种方式:
一种是在真实世界中不断测试。
另一种是在模拟环境中训练。
真实训练成本高、速度慢,而且可能存在安全风险。
模拟训练效率更高,但创建真实、复杂的虚拟环境同样需要大量时间。
Atlas 提供了一种新的可能性:
直接把真实环境转换成可用于模拟的数字空间。
整个流程可能变成:
记录真实环境 → 重建 3D 场景 → 生成不同情况 → 训练或测试机器人

例如,可以先拍摄一个仓库,再让 Atlas 重建完整空间。
之后,开发者就可以模拟不同光线、障碍物、相机位置甚至移动路线,测试机器人在不同条件下的表现。
如果这类世界模型未来能够稳定扩展,它可能成为机器人训练的重要基础设施。
Atlas 也可以作为 AI 图片生成器
虽然 Atlas 的重点是空间理解,但它同样具备一些常见的图片生成能力。
包括:
- 文生图
- 不同艺术风格
- 图片中文字生成
- 360° 全景图片
不过,只把 Atlas 看成图片生成器,就会低估它真正想做的事情。
对于传统 AI 图片模型来说:
一张图片就是最终输出。
但对于 Atlas 来说:
一张图片只是一个世界中的某个观察角度。
模型真正需要理解的是,这张图片之外的空间可能是什么样子。
World Labs Atlas vs 传统 AI 视频生成
如果还不清楚 Atlas 和普通 AI 视频模型有什么区别,可以看下面这张表。
| 传统 AI 视频生成 | World Labs Atlas |
|---|---|
| 生成一段视频 | 生成或重建一个空间世界 |
| 镜头主要通过 Prompt 控制 | 可以直接使用相机几何信息 |
| 重点是单个视频片段 | 更强调不同视角之间的一致性 |
| 主要输出 2D 视频 | 支持 2D 与 3D 输出 |
| 主要用于内容创作 | 可用于创作、3D 重建、仿真和机器人 |
因此,Atlas 并不是简单地和其他 AI 视频生成器竞争。
它想解决的是一个更基础的问题:
AI 能不能真正理解一个空间,并从不同位置观察这个空间?
你也可以 查看 World Labs 官方 Atlas 视频,更直观地了解 Atlas 的实际效果。
用 iWeaver 更快研究 Atlas 和其他世界模型
像 Atlas 这样的新模型发布后,真正麻烦的往往不是“没有信息”。
而是信息太多,而且散落在不同地方。
为了真正判断一个新模型有没有突破,通常需要同时查看:
- 官方博客
- 技术报告
- 研究论文
- YouTube 演示
- Benchmark 数据
- 开发者测试
- 社区反馈
- 竞品资料
资料一多,很容易出现一个问题:
看了很多内容,但最后不知道哪些信息来自哪里,也很难快速对比不同模型之间的差异。
使用 iWeaver,你可以把网页、PDF、视频和研究笔记放到同一个工作空间中,快速整理重点、对比不同来源,并持续追溯到原始资料。
例如,在研究 Atlas 时,可以把:
World Labs 官方介绍 + 技术资料 + Demo 视频 + 竞品模型
放在一起进行总结和对比。
这样关注的就不只是:
“Atlas 发布了。”
而是:
Atlas 到底解决了什么问题,它和之前的世界模型相比有什么不同?
对于更新速度非常快的 AI 行业,这种研究方式会更高效。
World Labs Atlas 现在可以使用吗?
目前,Atlas 还没有全面向普通用户开放。
World Labs 表示,Atlas 正在向部分合作伙伴提供 Early Access。
普通用户什么时候可以直接使用,目前还没有公布明确时间。
Atlas 未来预计也会用于 World Labs 的 Marble 产品。
所以现阶段,Atlas 更像是 World Labs 对下一代空间 AI 能力的一次展示。
对于普通用户来说,它暂时还不是一个可以立即加入日常工作流的工具。
Atlas 代表了 AI 的下一个方向吗?
过去几年,AI 已经越来越擅长生成:
- 文字
- 图片
- 音频
- 视频
但这些内容大多数仍然是独立存在的。
一张图片就是一张图片。
一段视频就是一段视频。
Atlas 所代表的世界模型方向,则开始尝试回答一个不同的问题:
AI 能不能理解这些画面背后的空间?
如果答案最终是肯定的,那么未来生成式 AI 可能不再只是生成一个个独立素材。
它可能生成的是一个完整、持续存在的数字环境。
人可以进入。
相机可以移动。
游戏角色可以行动。
机器人也可以在其中训练。
Atlas 目前仍处于早期阶段。
但相比“又一个更强的图片或视频模型”,它真正值得关注的,是 AI 正在开始从生成内容走向理解世界。
