MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
本論文は、視覚的なツール呼び出しエージェントを評価するために、500以上のツールと258の人間による検証済みシナリオを備えたステートフルな環境を特徴とする統一されたフレームワークおよびベンチマークであるMM-ToolSandBoxを紹介し、現在のモデルが視覚的な精度において著しく苦戦していること、および失敗モードが小規模モデルにおける計画の欠如から大規模モデルにおける知覚エラーへと移行することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたが送った画像を読み取り、シミュレーションされたアプリを操作し、タスクを整理できる、超スマートなロボット・アシスタントがいるとしたと。まるで魔法のようですよね?ところが、Appleのチームは、これらのロボットが果たして現実世界の混沌とした視覚的リアリティを本当に扱えるのかを検証するために、MM-ToolSandBoxという巨大でハイテクな遊び場を作り上げました。
ここで明かされるのは、彼らは単にロボットにテキストを読ませただけではありません。彼らはロボットに対して、大規模な視覚的パズルを投げつけたのです。
遊び場:ステートフルなビデオゲーム
MM-ToolSandBoxを、511種類の異なるツール(ショッピングカート、音楽プレーヤー、カレンダー、ファイルマネージャーなど)が16種類の異なるシミュレーション世界に散らばっているビデオゲームだと考えてください。しかし、ここにはひねりがあります。このゲームは「ステートフル」です。つまり、ラウンド1でバナナを買ったら、ラウンド2でもそのバナナは実際にあなたのカートの中に存在しているのです。ロボットは自分が何をしたかを記憶し、変化する世界を把握し続け、あなたが会話の途中で考えを変えた場合のマルチターン(多段階)の会話にも対応しなければなりません。
さらに面白いことに、ロボットはあなたが送る画像を見なければなりません。例えば、コンサートのポスターの写真を撮って、「このチケットを買って!」と言ったり、乱雑なスプレッドシートのスクリーンショットを送って、「合計金額を見つけて」と言ったりします。ロボットは画像を読み取り、どのツールを使うべきかを判断し、このシミュレーション環境の中で実際にそのタスクを実行しなければならないのです。
テスト:258のトリッキーなシナリオ
研究者たちは、ただランダムなタスクを作ったわけではありません。彼らは258の人間による検証済みシナリオ(インタラクティブな画面用の特別なシナリオ50個を含む)を生成するマシンを構築しました。これらは決して簡単なものではありませんでした。以下のような内容が含まれています:
- 逐次的な到着: 会話の途中で写真が送られてくる場合、ロボットはそれを後で利用するために覚えておく必要があります。
- ゴールの変更: 「フライトを予約して」と言った直後に、「やっぱり、今はいいや、代わりにビーチに行こう」と言うケース。
- エラーの修正: あなたが写真の中の誤った日付をうっかり伝えてしまった場合、ロボットはそれを検知しなければなりません。
彼らは、小さなオープンソースモデルから、最大かつ最も高価な「フロンティア」システムに至るまで、世界で最も賢い12のAIモデルをテストしました。
大きな発表:ロボットはまだ不器用である
ここでの結論はこうです。世界最高のロボットでさえ、半分以上の確率で失敗したということです。
トップの成績を収めたモデルであるClaude 4.5 Opusでさえ、成功率はわずか**48.8%**でした。つまり、半分以上のシナリオで失敗したことを意味します。論文では、これらのモデルが「視覚的なツール呼び出し(visual tool calling)」を解決したという考えを明確に否定しています。彼らは依然として苦戦しているのです。
「なぜ」なのか:二つの失敗の物語
研究者たちは、なぜロボットが失敗するのかを深く掘り下げ、モデルの規模によって変化する興味深いパターンを発見しました。
小さなロボット(「何をすればいいの?」問題):
小さなモデル(40億パラメータ程度のもの)は、主に**計画(プランニング)**ができずに失敗しました。彼らは画像を見て、ユーザーが何を望んでいるかは理解していましたが、どのボタンを押すべきか、あるいはどのツールを使うべきかというプロセスで迷子になってしまいました。彼らは、ケーキを焼く必要があることは分かっているけれど、どうやってオーブンをつけるのかを知らない子供のような状態でした。大きなロボット(「何が見えているの?」問題):
巨大なモデル(3970億パラメータなどのもの)は、計画を立てる能力には非常に優れていました。どのツールをどの順番で使うべきかも正確に把握していました。しかし、彼らは画像を正しく読み取れないために失敗したのです。- 統計: 最も優れたモデルにおける失敗の**53%**は「事実に関するエラー(factual errors)」でした。
- 比喩: 完璧なレシピを知っている天才的なシェフを想像してください。彼らは材料を手に取り、完璧に混ぜ、焼き上げます。しかし、あなたが送ったチョコレートバーの写真を見たとき、ラベルを読み間違えて、チョコレートではなくバターを掴んでしまったのです。彼らは、視覚的な手がかりを読み取る点を除けば、すべてを正しくこなしていました。
これは、「クロスオーバー効果」を示唆しています。モデルが大きくなるにつれて、彼らは「計画」で失敗することをやめ、「知覚」で失敗するようになるのです。
「UI」の悪夢
研究者たちは、ロボットがあなたのためにクリック可能な画面を描画して操作できるようにするモードも試しました(ミニアプリのようなもの)。これはさらに困難でした。最高のモデルであっても、このモードでの成功率はわずか**26%**にまで低下しました。ロボットが画面を読み取るだけでなく、新しい機能を持つ動作する画面を即座に「描画」することさえ、まだ克服できていない巨大な課題であることが判明しました。
まとめ
この論文は、ロボットに考えさせたり計画させたりする方法は向上しているものの、私たちは視覚的な精密さという壁に突き当たっていることを示唆しています。ロボットは「何をすべきか」を知るほど賢くなっていますが、送られてきた写真の細かい文字を読み取るには、まだあまりに不器用なのです。
著者らは、視覚的なツール呼び出しは決して解決されたわけではないと結論づけています。今日の最も強力なモデルでさえ的を外しており、これを解決するには、単に「より強く考える」ことではなく、「より鮮明に見る」ことに焦点を当てた新しい種類の研究が必要であるとしています。このフレームワークとテスト結果は公開されており、他の科学者たちがロボットが世界をより良く読み取れるように手助けできるようになっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。