Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
本論文は、能動的な実験を通じて隠された視覚的ルールを推論するエージェントの能力を評価するためのインタラクティブな環境であるZendoWorldを紹介し、現在のAIモデルが観測されたデータに対して高い予測精度を示すにもかかわらず、真の帰納的推論と仮説の洗練に苦慮していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、謎めいた目に見えない審判と繰り広げる、高額な賞金がかかった「秘密のルール当て」ゲームをしていると想像してください。あなたはただヒントをじっと眺めているだけではいけません。色とりどりのブロック、くさび形、ピラミッドを使って、自分自身で小さなシーンを作り出し、「これはルールに従っていますか?」と審判に尋ねなければなりません。もし正解すれば、ゲームを続けることができます。もし間違えれば、審判は「反例(あなたの現在の理論には反するが、実際には秘密のルールに従っているシーン)」を提示します。あなたの目標は、誰よりも早く秘密のルールを見つけ出すことです。
これは、AIエージェントがどのように人間のように学習し、実験し、思考できるかをテストするために研究者たちが作成した、新しいデジタル・プレイグラウンド「ZendoWorld」です。彼らは単にAIがパターンを「認識」できるかどうかを見たかったのではありません。AIが実験を構築することによって、いかに「能動的に発見」できるかを調べたかったのです。
大きな驚き:正解することは、理解していることを意味しない
研究者たちは、「赤いブロックが少なくとも3つある」といった単純なものから、「ピースの数が奇数である」や「くさび形がピラミッドよりも多い」といったトリッキーなものまで、22種類の異なる秘密のルールを設定しました。彼らは、単純なニューラルネットワークから、人間の論理と機械の視覚を融合させようとする複雑な「ニューロ・シンボリック」システムに至るまで、さまざまなタイプのAIがどのようにプレイするかを観察しました。
ここでチームを驚かせたひねりがあります。AIが画像のラベル付けに優れているからといって、そのAIが実際にルールを理解しているとは限らないのです。
重力に関する多肢選択式のクイズに対して、完璧に「はい」か「いいえ」を答えられる学生を想像してみてください。それは素晴らしいことです!しかし、もし同じ学生に、重力をテストするための新しい実験を設計するように求めたら、彼らはただ壁に石を投げ、祈るだけかもしれません。論文によると、多くのAIエージェントはそのような学生のようでした。彼らはシーンを見て、「はい、これはルールに従っています」あるいは「いいえ、従っていません」と高い精度で答えることができました。しかし、自分の理論をテストするための新しいシーンを「構築」するとなると、彼らは非常に不得意でした。彼らはすでに見たものと全く同じシーンを提案し続け、新しい情報を一切提供しませんでした。それは、すでに答えを知っている質問ばかりを繰り返して、謎を解こうとしているようなものです。
3つのボトルネック:目、脳、そして手
研究者たちは、AIがどこで躓いているのかを見るために、ゲームを3つの部分に分解しました。
- 知覚(目): AIはブロックを見て、それが赤、青、または黄色であることを理解できるか?
- 帰納(脳): AIはヒントを見て、秘密のルールを推測できるか?
- 実験(手): AIは、新しいことを学ぶための「新しい」シーンを構築できるか?
彼らは、異なるAIエージェントがそれぞれ異なる場所で足踏みしていることを発見しました。
- 「純粋な視覚」エージェント: 画像を見ることができる大規模言語モデルによって駆動されるこれらのエージェントは、ルールを正しく推測することに苦戦しており、エピソードの半分以上で失敗していました。彼らは実験の構築も苦手でした。彼らが提案するシーンは「情報量が極めて少ない」もので、可能性を絞り込むのに役立ちませんでした。彼らは、すでに10回もチェックしたにもかかわらず、「執事が図書室にいますか?」と聞き続ける探偵のようなものでした。
- 「シンボリック(記号的)」エージェント: これらのエージェントは論理には優れていますが、時として世界を正しく「見る」ことに苦労します。研究者がシーンの説明をプレーンテキストで与えたとき(画像部分をスキップしたとき)、これらのエージェントはゲームを解く能力が向上しました。これは、一部のAIにとって、問題は論理ではなく、その「目」がぼやけていることにあることを示唆しています。
- 人間: 本物の人間がゲームをプレイしたとき、彼らは標準的なAIエージェントよりも、特に難解で複雑なルールにおいて大幅に優れた成績を収めました。人間は、標準的なAIエージェントの最高のもの(VLM)が44.5%しか解けなかったのに対し、約**73.3%**のゲームを解くことができました。(注:完璧な視覚と論理を持つ特別な「オラクル」エージェントは95.5%を解いており、大きなアドバンテージがありました)。さらに興味深いことに、人間はゲームの標準的なルールの枠外にある「ワイルドカード」のルールをも解明できましたが、特定のAIエージェント(VLP)もまた、このワイルドカードのタスクを解くことができました。他の視覚エージェントはどれも達成できませんでした。
「過剰修正」の罠
最も遊び心のある発見の一つは、人間とAIが同じ愚かな間違いを犯すことでした。AI(あるいは人間)が正しいルールを思いついたと思っても、その仮説を提出した際に、審判が反例(その特定のルール仮説には反するが、真のルールには従っているシーン)を示したとき、彼らはパニックに陥り、反対方向へと大きく振れてしまいました。
例えば、「すべてのブロックは赤くなければならない」というルールを思いついたとします。あなたがそのルールを提出すると、審判は青いブロックがあるシーンを見せて、「いや、違う」と言います。そのとき、単に「赤」を「青」に変えるのではなく、突然「すべてのブロックは青であり、かつ正確に3つなければならない」と決めてしまうかもしれません。あなたは過剰修正してしまったのです!論文によると、人間もAIもこれを行っており、一度の誤った推測の後、真実からますます遠ざかっていくことが分かりました。
これが将来にとって何を意味するか
この論文は、AIを人間と同じようにすることの問題を解決したと主張しているわけではありません。実際には、現在のAIは依然としてかなり特化していることを示唆しています。視覚に優れたものもあれば、論理に優れたものもありますが、視覚、思考、実験の3つをスムーズにループさせることは、ほとんどありません。
研究者たちは、より良くするためには、AIが「見る」ことと「考える」ことを別々のステップとして扱うのをやめる必要があると考えています。代わりに、AIの現在の最善の推測が、次に「何を見るべきか」を決定する助けとなるべきです。それは、ランダムにすべてを見るのではなく、現在の理論を用いて次にどの手がかりを調べるべきかを判断する探偵のようなものです。
要するに、ZendoWorldは、AIがパターンの認識には非常に長けている一方で、好奇心旺盛な科学者になるにはまだ苦労していることを示しています。AIは、自分が見ているものを説明することはできますが、なぜそれが見えるのかを突き止めるための「正しい問い方」を学ぶことはまだできていません。そして、より良い実験を構築することを学ばない限り、AIは同じ古いシーンを何度も繰り返すことで、秘密のルールを推測し続けることになるでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。