
Fei Fei Li:AIのためのワールドモデル構築競争
- 空間知能(spatial intelligence)の実現を目指すWorld Labsが、最新の世界モデル「ATLAS」を発表した。このエピソードでは、共同創業者であ...
- 議論は、ATLASの技術的な詳細から、なぜこのアプローチが空間知能への重要なステップなのか、そして今後のロードマップまで多岐にわたる。特に注目すべきは、LLM(大規模...
- [0:00] ATLASの核心:新規ビュー予測という新しいプリミティブ ATLASは、World Labsが開発した次世代の世界モデルであり、その基本的な機能は「生成...
自分では見つけにくい海外Podcastの話題に、日本語で気軽に触れたい人。
The a16z Show / Andreessen Horowitz
- World Labsの新モデル「ATLAS」は、LLMの「次トークン予測」に相当する「新規ビュー予測(new view prediction)」を基本プリミティブとして採用し、画像生成と3D再構築を単一モデルで統合した。
- ATLASはテキスト、画像、ビデオに加え、カメラポーズと深度マップをネイティブな入力として扱うマルチモーダル設計を採用しており、プリトレーニング段階でカメラポーズを扱ったのは業界初。
- 従来の高密度3D再構築では100〜300枚の写真が必要だったが、ATLASは3枚の画像から同等の再構築を可能にし、50〜100倍の効率化を実現。スタンフォード大学のクワッド全体を地上からの3〜25枚の画像で再構築できる。
- 開発チームは「スケーリングラダー」を一段ずつ登るアプローチを採用し、小規模な実験から確信を積み重ねた。転機は、NeRF論文で有名な「ガーデンテーブル」のシーンでカメラがテーブル下を飛び抜けるデモが成功した瞬間だった。
- ATLASはすでに「ベビーダイナミクス」を備えており、水面の波や移動する車など動的要素を処理できるが、本格的なダイナミクスと編集可能性の実現が今後の課題。
- ロボティクス分野では、実世界データの収集とランダム化の難しさが最大の制約であり、ATLASは「リアルからシミュレーションへ」の変換を劇的に効率化する次世代技術として期待される。
- 「新規ビュー予測」は「AI完全性」を持つ可能性があり、あらゆる知能タスクをこの形式に還元できる。Fei-Fei Li氏は「動物が目を持つのは動くからだ」と進化論的な観点からこの主張を支持した。
空間知能(spatial intelligence)の実現を目指すWorld Labsが、最新の世界モデル「ATLAS」を発表した。このエピソードでは、共同創業者であるFei-Fei Li(フェイフェイ・リー)、Justin Johnson(ジャスティン・ジョンソン)、Ben Mildenhall(ベン・ミルデンホール)の3人が、a16zのゼネラルパートナーであるMartin Casado(マーティン・カサド)のインタビューに応じ、ATLASの技術的核心と、それがもたらすパラダイムシフトについて語り合っている。ATLASの中心にあるのは「新規ビュー予測(new view prediction)」という、これまでにない基本原則だ。これは、あるシーンの画像やビューを入力として、空間と時間の異なる位置から見た場合の環境の見え方を予測するというもの。このアプローチにより、画像生成と3D再構築という、コンピュータビジョン分野で半世紀以上にわたって別々に発展してきた二大タスクが、単一のモデル内で統合されることになった。
議論は、ATLASの技術的な詳細から、なぜこのアプローチが空間知能への重要なステップなのか、そして今後のロードマップまで多岐にわたる。特に注目すべきは、LLM(大規模言語モデル)における「次のトークン予測」と、ATLASにおける「次のビュー予測」の類似性だ。言語モデルがテキストの次を予測することで知能を獲得したように、視覚モデルも空間の次を予測することで物理世界の理解を深めることができるという仮説が、この会話の根底に流れている。さらに、ロボティクス分野におけるデータ不足という喫緊の課題に対し、ATLASがどのような解決策を提供し得るのかについても、具体的な議論が展開された。
ATLASの核心:新規ビュー予測という新しいプリミティブ
ATLASは、World Labsが開発した次世代の世界モデルであり、その基本的な機能は「生成」「再構築」「シミュレーション」の3つに集約される。Justin Johnson氏によれば、ATLASの最も根本的な特徴は「新規ビュー予測」というプリミティブ(基本操作)にある。LLMが「次のトークン予測」に基づいて構築され、ビデオモデルが「次のフレーム予測」に基づいて構築されているのに対し、ATLASは「与えられたシーンのいくつかのビュー(視点)から、空間と時間の任意の点に仮想カメラを置いたときに、その世界がどのように見えるべきかを予測する」というタスクを基本単位としている。このアプローチにより、ユーザーは画像とカメラの軌跡を入力するだけで、モデルを任意の視点へと誘導し、映像フレームを生成できるようになる。
Ben Mildenhall氏は、この新規ビュー予測が従来のビデオモデルと決定的に異なる点として、「空間的文脈(spatial context)」の概念を挙げる。既存の多くのビデオモデルは、単一の画像入力や、開始フレームから終了フレームへの補間に依存している。これに対し、ATLASに入力されるすべての画像には、三次元空間におけるカメラの位置と姿勢(カメラポーズ)が関連付けられている。つまり、モデルは入力画像を単なる2Dのピクセルとしてではなく、3D空間内の特定の視点から見た正確な記録として処理するのだ。例えば、部屋の四隅から撮影した4枚の写真を入力すれば、モデルはその部屋の正確な複製を再現できる。これは、従来の再構築技術のように「見えていない部分を推測する」のではなく、「与えられた情報を正確に空間配置する」という点で、はるかに高い精度を実現する。
さらに重要なのは、ATLASが生成と再構築を単一のアーキテクチャ内で統合した点だ。Fei-Fei Li氏は、コンピュータビジョン分野が半世紀以上にわたり、ピクセル生成、認識、3D再構築という別々のトラックに分かれて発展してきた歴史を振り返り、ATLASが視点推定をアンカーとすることで、これらの問題を初めて統一的に扱うことに成功したと強調する。この統合により、ユーザーは異なるAI生成画像や実世界の写真を組み合わせて、意図的に演出されたフライスルー(空間を飛び回るような映像)を作り出すことも可能になる。これは、テキストによる高レベルな指示に依存し、何度も生成を繰り返す必要がある従来のビデオモデルとは対照的だ。
技術的には、ATLASはマルチモーダルな設計を当初から採用している。テキスト、画像、ビデオに加え、カメラポーズと深度マップ(depth map、各ピクセルまでの距離を表す画像)をネイティブな入力として扱う。深度マップは、カメラ位置に付随する空間構造の情報を提供し、RGB画像(色情報)と組み合わせることで、モデルはシーンの三次元構造を理解する。Johnson氏は、プリトレーニング段階でカメラポーズをネイティブ入力として扱った例はこれまでにないと述べ、この点がATLASの新規性の一つであると指摘する。
開発の軌跡:MarbleからATLASへ、そして「あの瞬間」
World Labsの設立からわずか2年半で、なぜATLASに到達したのか。Johnson氏は、その道のりが決して一直線ではなかったことを明かす。同社は以前、画像やテキストプロンプトから3D世界を生成する世界モデル「Marble」をリリースしていた。Marbleは出力表現としてガウシアンスプラット(Gaussian splat、3Dシーンを表現するための技術)に焦点を当てていた。ガウシアンスプラットはレンダリングが容易で、モバイルやVRデバイス、ゲームエンジンとの相互運用性に優れるという利点がある一方、それが出力のボトルネックとなっていた。ATLASの開発では、この教訓を活かし、出力を特定の表現形式に制限するのではなく、新規ビュー予測というより根本的なプリミティブに立ち返ることで、RGBフレームの生成と3D再構築の両方を柔軟に可能にした。
開発プロセスは「スケーリングラダー(規模拡大の階段)」を一段ずつ登るようなものだったとJohnson氏は説明する。空間知能に関するスケーリング則(モデルを大きくすれば性能が向上するという経験則)は、当時まだ存在しなかったため、小規模な実験を繰り返し、何が機能し、何がスケールするのかについて確信を積み重ねる必要があった。しかし、ある夏の初めの日、状況は一変する。当時のATLASよりも小さいモデルでテストを行っていたところ、Ben Mildenhall氏が、NeRF(Neural Radiance Fields、神経放射場)の論文で有名な「ガーデンテーブル」のシーンを再現した結果をSlackに投稿したのだ。その映像では、カメラがテーブルの下を飛び抜け、サッカーボールが転がっている様子が映し出されていた。この瞬間、3人の創業者は互いの目を見合わせ、5秒以内に「これだ」と確信したという。Fei-Fei Li氏は「誰もこの結果を見たことがなかった」と述べ、この瞬間がATLAS開発の転換点だったと振り返る。
Mildenhall氏は、自身のキャリアの大半を画像から3Dを生成することに費やしてきた経験から、このアプローチへの確信があったと語る。従来の「高密度再構築(dense reconstruction)」は、再構築したいすべての点を少なくとも3〜4つの視点から捉える必要があり、部屋全体をスキャンするには100〜300枚もの写真が必要だった。熟練者なら数分で済むが、初心者が複数部屋の環境をスキャンしようとすると2時間かかることもある。ATLASはこのプロセスを劇的に変え、わずか3枚の画像からでも高品質な再構築を可能にする。これは50倍から100倍の効率化であり、既存の映像やインターネット上の画像を3Dシーンとして蘇らせるという、これまで不可能だったユースケースを切り開くものだ。
再構築と生成の融合:なぜ「穴埋め」に生成が必要なのか
ATLASの技術的な革新性は、再構築と生成という一見相反するタスクを統合した点にある。従来の再構築技術では、入力ビューに写っていない領域は必ず「穴」として残る。どれほど多くの視点から撮影しても、テーブルの下やマイクの裏側など、必ず見逃す場所が存在するからだ。Mildenhall氏は、この穴を埋めるためには本質的に生成プロセスが必要だと説明する。つまり、モデルは三角測量によって見える部分を正確に再構築しつつ、見えない部分については、周囲の文脈から「想像」して補完する必要がある。ATLASはこの両方を単一のモデル内で実現しており、これが従来の再構築技術との決定的な違いだ。
この「文脈の長さ」という観点は、LLMの発展と興味深い類似性を持つ。Johnson氏は、LLMがコンテキストウィンドウ(一度に処理できる入力の長さ)の拡大に長年取り組んできたことを指摘する。128トークンから始まり、256、512、そして100万トークンへと拡大してきた。しかし、画像やビデオモデルの分野では、このような体系的な文脈長の拡大はほとんど試みられてこなかった。ATLASは、再構築を「非常に長い文脈を持つ生成」と捉えることで、この問題に取り組んでいる。実際、ATLASは64枚の画像を入力として、家全体のフライスルーを生成できる。以前は2,000枚の画像を必要としたマルチルームのキャプチャも、30〜40枚の入力でほぼ同等の品質のフライスルーを生成可能だ。これは、モデルが入力画像を「見た」情報と、そこから「わずかに外挿した」情報を巧みに組み合わせることで実現されている。
Martin Casado氏は、この仕組みを「4枚の写真を入力し、モデルがその間を外挿し、再構築時に3Dとして整合させる」という単純なモデルで理解しようとする。しかし、なぜ拡散モデル(diffusion model、ノイズから画像を生成するモデル)が視覚的に優れていながら正確性に欠けるのに対し、ATLASは3Dとして一貫性を保てるのかという疑問を投げかける。これに対する答えは、スケーリング仮説への信念だとJohnson氏は語る。モデルを大きくし、訓練時間を長くし、より多くのチップを使用するたびに、性能は有意に向上した。ATLASの開発を制限したのは、アーキテクチャやデータの問題ではなく、単にリリース期限までに訓練できる計算資源の制約だったという。Fei-Fei Li氏も、スケーリング則と次視点予測という2つの仮説に対する強い確信があったと述べつつも、新しいアーキテクチャとパラダイムの最初の訓練サイクルでこれほどの品質に到達するとは予想していなかったと認める。
クリエイティブ産業への応用:永続的な3D世界の価値
ATLASの応用範囲は、既存のクリエイティブ産業から新たな領域へと広がっている。Mildenhall氏は、以前の製品であるMarbleのユーザーが、生成した3Dシーンから異なる視点のスクリーンショットを撮り、それを再び画像生成モデルに入力するというワークフローを頻繁に使っていたことを明かす。これは、ユーザーが単発の画像生成ではなく、一貫性のある3D世界を基盤としたマルチステージの制作プロセスを求めていることを示している。映画、ショー、マーケティング映像、ゲーム環境の構築など、プロの制作現場では「永続的な3D状態」が長年にわたって当たり前のように使われてきた。人々は一時的な生成物を次々に作り捨てるのではなく、資産のコレクションを構築し、時間をかけて世界を発展させていくことを望んでいるのだ。
この「編集可能性(editability)」こそが、今後の世界モデル開発における重要な鍵だとMildenhall氏は強調する。現在のフロンティアの画像モデルは編集機能にある程度対応しているが、ビデオモデルや世界モデルではまだ発展途上だ。「恐竜を出現させる」といったおもちゃレベルの例は存在するが、産業強度の編集機能を実現するには、制御を追加してもモデルの品質を損なわないという難しいバランスが求められる。ユーザーに追加の操作手段を提供しても、出力品質が低下すれば、最先端のビデオモデルから乗り換える意味がないからだ。ATLASの目標は、現在の高品質な出力を維持しながら、シーンとの対話、レイアウトの制御、オブジェクトの同一性の保持、時間の制御など、ユーザーが求める多様な編集機能を追加していくことにある。
さらに、この技術は建築や建設分野にも大きな変革をもたらす可能性がある。Mildenhall氏は、会議用ブースを製作する企業の例を挙げ、世の中の多くの物体が「仮想設計フェーズ」を経て製造されていると指摘する。しかし、現在の3Dソフトウェアは数十年変わっておらず、直感的とは言い難い。クリエイティブディレクターや建築家からの口頭でのフィードバックやスケッチを3D表現に反映する作業は、作業全体の95%を占めることもある。1回のミーティングでフィードバックを受け、それを反映するために1週間の修正作業が必要になるというのが現状だ。ATLASのような技術は、このプロセスを根本的に変え、レゴや粘土細工のように直感的な3D編集を可能にする可能性を秘めている。
ロボティクスへの展望:データ不足という最大の制約
Fei-Fei Li氏は、ATLASがロボティクス分野においても重要な役割を果たすと主張する。World Labsは以前、Sinixというロボティクス企業を買収した。Sinixの主要技術は「リアルからシミュレーションへ(real to sim)」そして「シミュレーションからリアルへ(sim to real)」という変換システムだ。ロボットアームに産業環境でのケーブル配線作業を訓練する場合、まず大量のデータが必要になる。そして、訓練したポリシー(方策)が適切に機能するかを評価し、実際の環境に展開する。このプロセスでは、環境の高密度再構築が不可欠だが、従来の手法は非常に時間がかかり、ロボットシミュレーションの速度を大きく制限していた。ATLASはこのリアルからシミュレーションへの変換を劇的に効率化する次世代技術だとLi氏は位置づける。
Li氏は、現在のロボティクスにおける最大の課題は「データ」だと強調する。いつかはチップが課題になるかもしれないが、現時点では実世界のデータ収集の難しさが根本的な制約となっている。さらに重要なのは「ランダム化(randomization)」のプロセスだ。ロボットが様々な状況に対応できるようにするためには、同じ環境でもケーブルの曲がり方、箱のサイズや色、蓋の有無など、条件を変えたデータが必要になる。このランダム化を実現するためにも、リアルからシミュレーションへの変換が不可欠であり、ATLASはこのステップを大幅に加速する。ただしLi氏は、ATLASはあくまで現在のロボティクス技術のニーズを満たすものであり、ロボティクス用のフロンティア基盤モデルはまだ存在しないと述べる。しかし、ATLASがマルチモーダルモデルであることを考えれば、次のステップとして、動的なデータを入力として扱い、行動計画とロボティクスの間のギャップを埋めることが可能になるだろう。
Johnson氏は、ロボティクスポリシーの訓練が他のAIアプリケーションと根本的に異なる点を指摘する。コード生成や画像生成は、ウェブ上に豊富に存在する「成果物」から学習できる。しかし、ロボティクスポリシーは静的な成果物を生成するのではなく、実世界で行動し、目標を達成しようとする「エージェント」だ。展開中に起こり得るあらゆる問題を訓練中に経験させる必要があり、ここでシミュレーションが重要な役割を果たす。伝統的なアプローチは、物理エンジンを用いて人間の設計者が想定し得るシナリオを明示的にコード化する方法だ。しかし、より興味深いのは、学習されたニューラルシミュレーターを用いる方法だ。環境が行動に対してどのように応答するかを学習したモデルを構築し、それをロボットポリシーの訓練に使用する。そして、この学習されたシミュレーターが世界の理解を持っているならば、なぜシミュレーター自体がプランナー(計画立案者)になることができないのか、というのがWorld Labsの世界モデルに関する中心的なテーゼだ。世界の生成、シミュレーション、異なる状況での見え方の理解、そして行動に対する世界の応答の理解は、特定の方法で世界を応答させるために必要な行動を想像することと深く関連している。
ダイナミクスと編集可能性:世界モデルの次のフロンティア
ATLASのローンチに対する反応は圧倒的に肯定的だったが、専門家からは「より多くのダイナミクス(動的要素)が必要」というフィードバックも寄せられた。これに対しJohnson氏は、ATLASはすでに「ベビーダイナミクス」を備えていると説明する。以前のMarbleモデルは本質的に静的であり、アーキテクチャと訓練データの両方に動的要素が組み込まれていなかった。しかしATLASでは、アーキテクチャと訓練データの両方が根本的にダイナミクスをサポートしている。公開されたデモ映像の中にも、水面の波や、航空視点の映像内を移動する車など、動的要素が確認できる。興味深いことに、静的な出力を望む場合でも、モデルを動的データに露出させることが最善の方法だとJohnson氏は主張する。モデルが動的要素と静的要素をどのように分離するかを学習することで、より堅牢な再構築が可能になるからだ。
Casado氏は、複数の視点から3Dを再構築する際にダイナミクスが問題を引き起こすのではないかと疑問を呈する。これに対しJohnson氏は、プリトレーニングでは大量の動的データを処理し、その後のポストトレーニングで静的シーンと空間的移動に焦点を当てたと説明する。つまり、プリトレーニング済みのチェックポイントにはすでに多くの潜在的なダイナミクスが含まれており、今後の改善でさらに強化される見込みだ。Mildenhall氏は、このダイナミクスとスタティクスの区別を「直接的な編集可能性」という観点から捉えることの重要性を強調する。ユーザーがシーン内の特定の人物やオブジェクト、特定のアクションを直感的に指定し、それらを組み合わせて一つのまとまった結果を得る能力が鍵となる。しかし、制御を追加してもモデルの品質が低下しては意味がない。最先端のビデオモデルから乗り換える動機が失われるからだ。
Fei-Fei Li氏は、知能の第一原理に立ち返り、「知能とは、単に何かを見て解釈することではなく、見ることと経験することと相互作用のループを閉じることだ」と述べる。空間と物理的世界に関しては、このループを閉じることが本質的な課題であり、ATLASはその階段を登る一歩に過ぎない。議論の終盤では、Casado氏が「AI完全性(AI completeness)」という概念を持ち出す。これは、あるタスクがAI完全であるとは、そのタスクを完全な一般性で解決できれば、あらゆる知能問題を解決できることを意味する。LLMにおける「次のトークン予測」がAI完全であると広く信じられているように、ATLASの「生成的新規ビュー予測」もまたAI完全である可能性がある。映画のすべてのフレームを見て「次に誰が登場するか」を予測するタスクは、あらゆる知能タスクを包含し得る。Li氏は進化の観点からこの議論を補強する。「動物が目を持つが、木は目を持たないのはなぜか。動くからだ。動くとき、新しい視点を見る。それが知能の本質だ」と。このようにして、次視点予測は次トークン予測と同等の重要性を持つという信念が、World Labsのビジョンの核心にあることが明らかにされた。
結びに
このエピソードは、単なる新モデルの発表を超えて、空間知能という新しいAIのフロンティアを切り開くための知的基盤を提示している。ATLASの「新規ビュー予測」というプリミティブは、言語モデルにおける「次トークン予測」に匹敵する可能性を秘めており、生成と再構築という長年分離されてきたコンピュータビジョンの二大潮流を統合する画期的な試みだ。特に印象的なのは、開発チームが「スケーリングラダー」を一段ずつ登りながら、小さな実験から確信を積み重ね、最終的に「ガーデンテーブル」のデモで全員が5秒以内に確信を持ったというエピソードだ。理論的な確信と実際の結果が一致した瞬間の興奮が伝わってくる。
また、この議論は技術的な詳細にとどまらず、ロボティクスにおけるデータ不足という実践的な課題や、クリエイティブ産業における永続的な3D世界の価値、さらには「AI完全性」という理論的な枠組みまで、幅広い視点を提供している。Fei-Fei Li氏の「動物が目を持ち、木が持たない理由」という進化論的な洞察は、空間知能の本質を鮮やかに照らし出す。ATLASはまだ「ベビーダイナミクス」の段階であり、編集可能性や相互作用の面でも発展の余地が大きい。しかし、このモデルが示す方向性は、AIが単にテキストや画像を生成するだけでなく、物理世界を理解し、シミュレートし、最終的にはロボットを通じて行動するための基盤となる可能性を示唆している。世界モデルの開発はまだ始まったばかりであり、今後の進化が楽しみだ。
あわせて読む
同じ番組の別エピソードや、近いテーマの記事から続けて読めます。





