Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3
本論文は、環境をパラメータ化されたムーアマシンとして定式化し、「能動的抽象化」を用いて実行可能な世界モデルを動的に構築、テスト、および修復することにより、ARC-AGI-3チャレンジへの取り組みを行うコーディングエージェントシステムであるTychoを紹介しており、全183レベルにおいて人間によるリプレイと同等の効率性を達成しつつ、人間のベースラインと比較してアクション数を大幅に削減している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、マニュアルもチュートリアルもなく、助けを求める手段も一切ない、全く新しいビデオゲームの世界に放り込まれました。あなたにできるのは、画面を見ること、ボタンを押すこと、そして次に何が起こるかを観察することだけです。勝つためには、隠されたルールを解き明かし、目的を推測しなければなりません。しかも、すべてのボタン操作がスコアに影響するため、一回の無駄も許されません。これが「能動的抽象化(active abstraction)」の挑戦です。答えを暗記するのではなく、その世界の中で行動することによって、世界の仕組みを学ぶのです。科学者はこれを「スキル獲得(skill acquisition)」と呼んでいます。これは、何百万回も練習する必要はなく、わずか数回の試行から新しいコツを素早く習得する能力のことです。果たしてコンピュータは、観察し、推測し、それらのルールを用いて先読みを行うという、人間のような方法でこれらの謎めいたゲームをプレイすることを学べるのでしょうか?
この論文は、その問いに答えるために「Tycho(ティコ)」と呼ばれるシステムを紹介しています(名前は、天体の法則が発見される基礎となる精密な星図を作成した天文学者、ティコ・ブラーヘに由来します)。Tychoは、「ARC-AGI-3」と呼ばれる一連のトリッキーなパズルをプレイするために設計された「コーディング・エージェント」です。単に次の手を推測するのではなく、Tychoはゲーム自体のシミュレーターとして機能する小さなコンピュータ・プログラムを書こうと試みます。それはゲームを観察し、ボタンを押したら何が起こるかを予測するコードを書き、そのコードが正しいかどうかを確認し、そしてそのコードを使って自身の動きを計画します。研究チームは、Tychoがこのシミュレーターを使用する方法として、完全に無視する、メインの脳自身にコードを書かせる、ヘルパー・ボットにコード作成を依頼する、あるいは間違いが発生するたびに自動的にコードを修正するという、4つの異なる方法をテストしました。
結果は驚くべき、かつ微細なものでした。チームは、単にシミュレーターを持つだけでは不十分であり、いつそれを使用するかという「戦略」こそが最も重要であることを発見しました。最も優れたアプローチは「アクター要求型委譲(actor-requested delegation)」でした。これは、メインのエージェントが、必要だと判断したときにのみ、専門のヘルパーに対してゲーム・シミュレーターの構築を依頼するという手法です。この手法は、初期テストにおいて最も高い効率性を記録しました。この勝利した戦略を、現在利用可能な最も強力な2つのAIモデル(GPT-5.6 SolおよびOpus 5)に適用したところ、結果は驚異的でした。彼らは25個の公開ゲームすべてを、そしてその中の全183レベルを解き明かしたのです。特にOpus 5モデルは非常に効率的で、同じレベルをクリアするために、平均的な人間のプレイヤーよりも61%少ないアクション数で完了しました。
しかし、論文は一般的な罠についても警告しています。ゲームのあらゆるピクセルを完璧に予測するシミュレーター(高精度なモデル)を構築することが、必ずしも勝利を保証するわけではないことを彼らは発見しました。「自動修復(automatic repair)」と呼ばれる一つの戦略は、次に何が起こるかを驚異的に正確に予測するシミュレーターを構築しましたが、エージェントは何を目指すべきか、あるいはいつシミュレーターの使用をやめるべきかを知らなかったため、プレイの結果は芳しくありませんでした。それは、迷路の完璧な地図を持っていても、出口がどこにあるかを知らないようなものです。論文は、真の知性とは単に世界の完璧なモデルを構築することではなく、「いつモデルを構築するか」、「いつそれを信頼するか」、そして「いつモデルを無視してただ行動するか」を決定する「能動的抽象化」であると結論付けています。Tychoは、ゲームを単に解かれるべき「画像」としてではなく、発見しテストされるべき「ルールの集合」として扱うことで、AIが人間のような効率性を持って新しいゲームを学習できることを示しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。