← 最新の論文
💻 computer science

Coding Agent Is Good As World Simulator

本論文は、協調的な計画、コーディング、視覚的レビュー、物理分析を通じて実行可能なシミュレーションコードを反復的に生成・洗練させることで物理的に妥当な世界モデルを構築するエージェント型フレームワークを導入し、物理的精度、指示忠実度、視覚的品質においてビデオベースのアプローチを上回る性能を実証する。

原著者: Hongyu Wang, Jingquan Wang, Bocheng Zou, Radu Serban, Dan Negrut

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Hongyu Wang, Jingquan Wang, Bocheng Zou, Radu Serban, Dan Negrut

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現実的な映画のシーン、例えば水面上に浮かぶ橋を車が渡る様子や、ロボットが散らかったオフィス内を移動する様子を構築したいと想像してみてください。

従来の方法(ビデオモデル):
現在の AI ビデオ生成ツールを、極めて才能のある画家だと考えてください。もし彼らに「水の上を走る車」を描くよう頼めば、彼らは車と水の何百万もの写真や動画を参照します。そして、パターンに基づいて次のフレームがどのように見えるかを推測します。

  • 問題点: 彼らは実際には物理法則を「理解」していません。色や形を推測しているに過ぎません。車が段差にぶつかった場合、画家は偶然にも車が段差をすり抜けて浮遊させてしまったり、AI が重力の働きを「忘れた」せいで橋が奇妙な形に歪んでしまったりする可能性があります。一瞬はかっこよく見えますが、物理法則はすぐに崩壊してしまいます。

新しい方法(この論文のアプローチ):
著者たちは異なる方法を提案しています。映画のフレームを一枚ずつ描く代わりに、AI に物理エンジンのための指示書(コード)を書くよう求めるのです。

次のように考えてみてください。

  • 従来の方法は、次のトリックを推測しようとするマジシャンのようです。
  • この論文の方法は、実験室で実際に機能するモデルを構築するためにエンジニアを雇うようなものです。

「コーディング・エージェント」の仕組み

この論文では、このシミュレーションを構築するために連携する AI の「エージェント」(専門アシスタント)のチームについて説明しています。彼らは建設チームのように行動します。

  1. プランナー(設計者): あなたがチームに「オフィスにロボットが欲しい」と伝えます。プランナーはこれを設計図に分解します。「床、机 2 台、椅子 7 脚、そしてロボットが必要です。ロボットはそれらの間を歩けるようにする必要があります。」
  2. コーダー(建設者): このエージェントは設計図を受け取り、Project Chrono というツールを使用して、コンピュータに部屋をどのように構築するか、家具をどこに配置するか、そしてすべての物の重量をどのように設定するかを正確に指示する実際のコンピュータコードを書きます。
  3. ビジュアルレビューヤー(検査員): コードが実行され、ビデオが生成されます。レビューヤーはビデオを見て、「待てよ、ロボットが机をすり抜けて浮いている。これは間違っている」と言います。
  4. 物理アナリスト(エンジニア): このエージェントは数学を検証します。「机が軽すぎるか、ロボットが重すぎる。コードを修正する必要がある」と言います。
  5. ループ: コーダーがコードを修正し、再度実行します。シミュレーションが完璧に機能し、物理法則に従うまで、これを繰り返します。

なぜこれが重要なのか

この論文は、単にビデオフレームを予測するのではなく、実行可能なコードを通じて世界を構築することで、シミュレーションが以下のようなものになると主張しています。

  • 物理的に正確: コードが実際の物理法則を強制するため、物体は衝突し、落下し、跳ね返る際、あるべき通りに動作します。
  • 修正可能: 何か問題が起きた場合、コードを見て間違いを見つけ、修正することができます。物理法則が間違っているビデオを簡単に「修正」することはできません。単に再度描き直すしかありません。
  • 複雑なタスクへの信頼性: チームは、オフィス内のロボット、荒れた地形を走行する軍用車両、そして水面上の浮遊橋を渡る車(固体と液体の物理の複雑な組み合わせ)でこれをテストしました。

結果

彼らは、高度なビデオ生成モデル(WorldModelBench というベンチマークを使用)と比較して、「コーディング・エージェント」方式を評価したところ、以下の点で高いスコアを獲得しました。

  • 指示への忠実度: 求めたことを正確に行いましたか?(はい、コードが明示的に要求されたものを構築するため、可能です。)
  • 物理法則: 車が床をすり抜けましたか?(いいえ、コードがそれを防いでいるため、ありえません。)

課題

この論文は、このシステムはまだ完璧ではないことを認めています。コードを書き、実行し、検証し、修正することを繰り返す必要があるため、(計算能力の観点から)時間とコストがかかる可能性があります。また、AI のライブラリに特定の物体の 3D モデルがない場合、単純な形状で近似する必要があります。

要約: 現実的な世界がどのように見えるかを AI に「推測」させるのではなく、この論文は AI にコードを使って現実的な世界を「構築」することを教えます。これにより、物理法則は単なる錯覚ではなく、実際に機能するものになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →