OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions
本論文は、大規模言語モデルが長期間にわたる能動的かつ帰納的な相互作用を行う能力を評価するために設計された、120の標準化されたタスクと極限のストレス・テストからなる新しいベンチマークであるOdysseyArenaを紹介し、最先端のモデルであっても複雑な環境における潜在的な遷移法則を自律的に発見することに苦慮することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いロボットに新しい複雑なボードゲームの遊び方を教えていると考えてください。
旧来の方法(演繹的):
現在のAIテストの多くは、ロボットにゲームを始める前にルールブックを与えるようなものです。「もし赤に止まったら、2マス戻ること。もし6が出たら、前に進むこと」と伝えます。ロボットは単にこれらの明示的な指示に従います。これは命令に従うことには長けていますが、なぜそのルールが存在するのか、あるいはルールブックがない場合にどうやってルールを見つけ出すべきか、という本質的な理解には至りません。
新しい方法(帰納的):
論文『ODYSSEYARENA』は、真の現実世界における知能とは、ルールに従うことではなく、プレイしながらルールを「発見」することであると主張しています。想像してみてください。あなたはロボットにボードゲームを手渡しますが、ルールブックは隠しておきます。ロボットは、実際に駒を動かし、何が起こるかを確認し、混乱し、再び試し、自力で隠されたロジックを少しずつ解明していかなければなりません。これを「帰納的推論」と呼びます。
問題点
研究者たちは、今日の最もスマートなAIモデルでさえ、これには極めて弱いことを発見しました。彼らは指示に従うこと(演繹)には長けていますが、ルールが隠されている場合に経験から学ぶこと(帰納)には苦戦します。彼らはループに陥ったり、学んだことを忘れたり、ゲームが長く複雑になると諦めてしまったりします。
解決策:ODYSSEYARENA
これをテストするために、チームは「ODYSSEYARENA」と呼ばれる新しい「ジム(訓練場)」を構築しました。短くて単純なタスクではなく、AIに「探偵」であることを強いる4つの異なる「ゲーム」を作成しました。これらのゲームは、AIが能動的に探索することを強いるように、長期的なプロセス(数百ステップ)を想定して設計されています。
以下に、4つのゲームを簡単な比喩を用いて説明します。
明かりをつける(論理パズル):
- 設定: 電球の壁があります。ついているものもあれば、消えているものもあります。スイッチを操作できますが、配線は分かっていません。
- 挑戦: 一つのスイッチを入れると、ある電球がつくかもしれませんが、同時に隠れた接続によって他の3つの電球が誤って消えてしまうかもしれません。AIはスイッチを切り替え、その結果を観察し、試行錯誤を通じて隠された配線図を解明しなければなりません。
- メタファー: マニュアルなしで絡まったクリスマスライトを修理しようとするようなものです。どの電球が他のどの電球を制御しているのかを推測しながら進めます。
AIトレーディング(株式市場):
- 設定: AIは、ポートフォリオを持つトレーダーです。毎日、市場は(天気やニュースのような)AIには直接見えない隠れた「要因」に基づいて動きます。AIが見ることができるのは、そのヒントだけです。
- 挑戦: AIは株価とニュースを観察し、それらを結びつける隠れた数学的関係を推測し、将来を予測して利益を上げなければなりません。
- メタファー: 空を直接見ることはできず、「人々がどのように服を着ているか」だけを見て天気を予測しようとするようなものです。「コートを着ている人々」と「雨」の間のパターンを見つけ出す必要があります。
エネルギー・ディスパッチ(電力網):
- 設定: AIは発電所の管理者です。太陽光、風力、石炭を利用して、都市の電力を維持しなければなりません。
- 挑戦: 太陽や風は予測不可能であり、隠れたサイクル(季節など)に従っています。もしAIが3日連続でミスをすると、電力網全体が崩壊します。AIは、電気を灯し続けるために、自然の隠れたリズムを学習しなければなりません。
- メタファー: 嵐の夜にキャンプファイアを完璧に燃やし続けようとするようなものです。風向きは1時間ごとに変わりますが、そのパターンを推測しなければなりません。
Repoシステム(ソフトウェア修正):
- 設定: AIは、ソフトウェアパッケージをインストールしようとしているプログラマーです。
- 挑戦: 一つのソフトウェアをインストールすると、隠れたバージョン競合によって別のソフトウェアが壊れることがあります。AIは、インストールし、テストし、壊し、修正し、再インストールするというプロセスを経て、異なるプログラム間の目に見えない依存関係のネットワークをゆっくりとマッピングしていきます。
- メタファー: 家を建てている最中に、新しいドアを買ったら昨日作った壁が倒れてしまった、というような状況です。進めながら設計図を解明していく必要があります。
研究結果
研究者たちは、世界で最もスマートな15以上のAIモデル(トップクラスの商用およびオープンソースモデルを含む)をこれらのゲームでテストしました。
- 結果: 最も優れたモデルでさえ、長期的なタスクにおいて惨愃たる失敗を喫しました。彼らはループに陥ったり(同じ間違いを何度も繰り返す)、以前に学んだことを忘れたり、隠れたルールを解明することができませんでした。
- ギャップ: もし研究者が事前にルールを提示すれば、モデルは素晴らしい成果を出しました。しかし、ルールを「発見」しなければならない場合、パフォーマンスはほぼゼロにまで低下しました。
- 結論: 現在のAIは、教科書を暗記するのは得意だが、本なしで問題を解こうとすると完全に失敗してしまう学生のようなものです。真に自律的なエージェントを作るための最大のボトルネックは、AIをより大きく、より速くすることではなく、自らの間違いから学び、世界の隠れたパターンを発見する方法を教えることです。
要約すると、ODYSSEYARENAは、「命令に従えるか?」と問うのではなく、「自分自身で世界の仕組みを解明できるか?」と問いかける、新しいAIテストの方法です。今のところ、その答えは「いや、できていない」です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。