World Labs Atlasとは?1枚の画像から3D世界を生成する新しいAIモデル

world-labs-atlas

多くの生成AIは、「見るためのコンテンツ」を作ります。

World Labsが目指しているのは、その先です。

人やカメラが移動できる“世界そのもの”をAIで生成すること。

新しく発表された Atlas は、World Labsが「空間知能(Spatial Intelligence)」と呼ぶ考え方を中心に開発されたマルチモーダル世界モデルです。

1枚の画像を入力するだけで、新しいカメラ視点を生成したり、3D空間を再構築したり、カメラの動きを細かく指定した動画を作ったりできます。

さらに、ロボット向けのシミュレーション環境にも利用できます。

簡単に言えば、

Atlasは画像を生成するだけではなく、その画像の“奥にある世界”を理解しようとするAIです。

World Labs Atlasとは?

World LabsはAtlasを Omni World Model と表現しています。

Atlasは以下のような情報を扱えるよう学習されています。

  • テキスト
  • 画像
  • 動画
  • カメラ位置
  • 3D深度情報

一般的な画像生成AIは、「画像がどのように見えるか」を中心に処理します。

一方、Atlasが理解しようとしているのは、

物体が空間のどこに存在しているか

という点です。

たとえば、部屋の写真を1枚アップロードしたとします。

通常の画像生成AIなら、似た雰囲気の別の部屋を生成するかもしれません。

Atlasは、写真の中にある部屋の空間構造そのものを理解しようとします。

そして、元の写真には存在しなかった位置まで仮想カメラを移動させ、そこから見えるはずの景色を生成できます。

ここが、従来の画像生成モデルと世界モデルの大きな違いです。

new-camera-view
Atlasは異なるカメラ位置から新しい視点を生成しながら、シーン全体の空間的な一貫性を維持します。出典:World Labs

Atlasの大きな特徴:カメラを細かくコントロールできる

AI動画生成モデルは急速に進化しています。

しかし、カメラの動きを正確に制御することは今でも簡単ではありません。

たとえば、

キャラクターの周りをゆっくりカメラで回ってください。

と入力しても、「周りを回る」の具体的な動きはモデル側が判断します。

Atlasは別の方法を採用しています。

カメラの幾何情報を直接入力できるため、以下のような要素をより正確に指定できます。

  • カメラ位置
  • 視点
  • 移動方向
  • カメラパス
  • ショットの切り替え

World Labsはこれを Pixel-Perfect Camera Control と表現しています。

狙ったカメラワークが出るまで何度も生成し直すのではなく、最初から動きをより直接的に指定できます。

活用が期待できる分野には、次のようなものがあります。

  • 映画制作
  • ゲーム開発
  • 広告
  • バーチャルプロダクション
  • 建築
  • 3Dビジュアライゼーション

Atlasは最大1分・1440pの動画生成に対応

World Labsによると、Atlasは参照画像と設計されたカメラパスを使い、最大約1分、1440p の動画を生成できます。

ただし、注目すべきポイントは長さだけではありません。

より重要なのは 空間的一貫性 です。

カメラが生成された空間を移動するとき、物体は同じ場所に存在し続ける必要があります。

ドアが突然別の壁に移動してはいけません。

カメラを回した瞬間にテーブルが消えるのも不自然です。

視点が変わっても、シーン全体の構造を維持する必要があります。

Atlasは、まさにこの問題を解決するために設計されています。

1枚の画像から3Dシーンを再構築

Atlasは3D再構築モデルとしても利用できます。

実際の場所を撮影した1枚、または複数の画像から、元の写真には存在しなかった位置からの視点を生成できます。

参照画像が多いほど、Atlasが取得できる情報も増えるため、欠けている部分を推測する必要が少なくなります。

さらに、Atlasは以下のような明示的な3D表現も生成できます。

  • 点群(Point Clouds)
  • 3D Gaussian Splats

そのため、Atlasの出力は画像や動画だけで終わるとは限りません。

将来的には次のような分野で利用できる可能性があります。

  • ゲーム
  • 3Dデザイン
  • VFX
  • デジタルツイン
  • シミュレーション
  • ロボティクス

3d-scene
Atlasは画像から新しい視点やシーンのジオメトリを生成し、Gaussian Splatsなどの3D表現へ変換できます。出典:World Labs

なぜAtlasは「世界モデル」と呼ばれるのか?

最近のAI分野では、World Model(世界モデル) という言葉が注目されています。

大規模言語モデルが主に学習するのは、言葉、概念、情報の関係です。

一方、世界モデルが理解しようとするのは、

  • 物体
  • 空間
  • 動き
  • 時間

の関係です。

たとえば、ロボットが椅子を見つけたとします。

「これは椅子だ」と認識するだけでは不十分です。

さらに、

  • 椅子はどこにあるのか
  • どれくらいの大きさなのか
  • どれくらい離れているのか
  • 横を通れるのか
  • 別の角度から見るとどう見えるのか
  • ぶつかったらどうなるのか

といったことまで理解する必要があります。

World Labsは、このような能力を 空間知能 と呼んでいます。

Atlasがロボティクスで重要になる可能性

Atlasの興味深い用途のひとつは、クリエイティブ動画ではありません。

ロボットのトレーニングです。

現実世界でロボットを訓練するには、多くの時間とコストがかかります。

シミュレーションを使えば効率化できますが、リアルな仮想環境を作る作業にも手間がかかります。

Atlasは別の方法を提案しています。

現実の環境を、そのままシミュレーション可能なデジタル空間へ変換する方法です。

たとえば、次のような流れが考えられます。

現実の環境を記録 → 3D空間を再構築 → 条件を変えてシミュレーション → ロボットを訓練・テスト

move-around-subject
Atlasは現実の空間を再構築し、ロボットが移動したときに見える環境をシミュレーションできます。出典:World Labs

この技術が大規模かつ安定して利用できるようになれば、世界モデルは Physical AI を支える重要な基盤になるかもしれません。

Atlasは画像生成にも対応

Atlasは、より一般的な生成AI機能も備えています。

たとえば、

  • テキストから画像生成
  • 異なるビジュアルスタイルの生成
  • 画像内テキストの生成
  • 360度パノラマ

などです。

ただし、Atlasの本質は単なる画像生成ではありません。

従来の画像生成AIにとって、

画像は最終結果です。

Atlasにとっては、

画像はより大きな世界を切り取ったひとつの視点にすぎません。

World Labs Atlasと従来のAI動画生成の違い

従来のAI動画生成 World Labs Atlas
動画を生成 世界を生成・再構築
カメラは主にプロンプトで制御 カメラ幾何情報を直接利用可能
単体の動画クリップを重視 空間的一貫性を重視
主に2D出力 2D・3Dの両方に対応
主にコンテンツ制作 制作、再構築、シミュレーション、ロボティクス

Atlasは、すべてのAI動画生成ツールを置き換えようとしているわけではありません。

より大きな問題に取り組んでいます。

AIは空間そのものを理解し、異なる視点から正しく観察できるのか?

実際のデモを確認したい場合は、World LabsのAtlas公式動画もチェックできます。

iWeaverでAtlasや世界モデルを効率よく調べる

Atlasのような新しいAIモデルが登場したとき、問題になるのは情報が少ないことではありません。

むしろ、情報が分散していることです。

本当に何が変わったのかを理解するには、次のような資料を確認する必要があります。

  • 公式発表
  • 技術レポート
  • 論文
  • デモ動画
  • ベンチマーク
  • 開発者テスト
  • ユーザーの評価
  • 競合モデル

iWeaverを使えば、Webページ、PDF、動画、リサーチノートをひとつのワークスペースにまとめ、重要な情報を要約しながら複数の情報源を比較できます。

たとえば、

World Labs公式資料 + 技術レポート + デモ動画 + 競合モデル

をまとめて分析できます。

単に、

「新しいモデルが出た」

で終わるのではなく、

「Atlasは何を解決し、以前のモデルと何が違うのか?」

まで理解しやすくなります。

World Labs Atlasは今すぐ使える?

現在、Atlasは一般公開されていません。

World Labsによると、現在は 一部のパートナー向けにEarly Access を提供している段階です。

一般ユーザー向けの公開時期はまだ発表されていません。

Atlasは今後、World LabsのMarble製品にも活用される予定です。

そのため現時点では、Atlasはすぐに日常のワークフローへ導入するツールというより、

空間AIが今後どこへ向かうのかを示す先行プレビュー

と考えたほうが近いでしょう。

AtlasはAIの次の方向性を示している?

ここ数年で、AIは次のようなコンテンツを非常に高いレベルで生成できるようになりました。

  • テキスト
  • 画像
  • 音声
  • 動画

ただし、多くの場合、それぞれは独立したコンテンツです。

画像は画像。

動画は動画。

Atlasのような世界モデルは、別の問いを投げかけています。

AIは、その画像の背後にある空間まで理解できるのか?

もしそれが可能になれば、次世代の生成AIは単体の素材を作るだけではなくなるかもしれません。

人、カメラ、ゲームキャラクター、ソフトウェア、ロボットが移動できる、持続的なデジタル環境そのものを生成する可能性があります。

Atlasはまだ初期段階です。

それでも、AIが 「コンテンツを生成する」から「世界を理解する」へ進む方向は、今後注目しておく価値があります。