✨ 要約🔬 技術概要
非常に賢いものの、少し不器用な個人アシスタント「InfantAgent-Next」という存在を想像してみてください。
コンピュータ自動化の世界において、現在のアシスタントの多くは、一つのことだけを非常に上手にこなす専門家か、あるいは何でもやろうとするがしばしば混乱する一般職のどちらかのようです。
一部のアシスタントは司書 のようです:彼らは特定のツールリスト(「ウェブを検索する」や「ファイルを開く」など)を使うのが得意ですが、これまで見たことのない画面のボタンをクリックするように頼むと、その特定のボタンに対応するツールを持っていないため、固まってしまいます。
別のアシスタントは芸術家 のようです:彼らは画面を見て「何があるか」を認識できますが、複雑な数学計算やコード作成は苦手です。なぜなら、彼らは電卓やテキストエディタを使わず、目だけで全てをこなそうとしているからです。
InfantAgent-Next は異なります。これは単一の人物を雇うのではなく、スイスアーミーナイフチーム を雇うようなものです。
仕組み:「脳と手」のチーム
すべてをこなそうとする巨大な脳ではなく、InfantAgent-Next はあらゆる作業を小さなステップに分解し、それぞれのステップを最も適した専門家へ送ります。
マネージャー(プランナー): 「このウェブページをブックマークに保存して」と頼むと、高レベルの「マネージャー」モデルがリクエストを読み取ります。マネージャーは自らマウスをクリックしようとはしません。代わりに、「よし、ブラウザを開き、ブックマークボタンを探して、それをクリックする必要がある」と言います。
専門家たち: マネージャーは次に、その仕事にふさわしい適切な専門家を手配します。
目(視覚的グラウンディング): 「赤いボタンをクリックする」というタスクの場合、専用の視覚モデルが画面を見て、その赤いボタンの正確なピクセル座標を見つけ、システムにどこをクリックすべきかを伝えます。これは、目が見えない弓使いを鋭い目を持つ見張り役が導くようなものです。
計算機(コード実行): 「この Excel ファイルを分析する」というタスクの場合、マネージャーはファイルをコーディングの専門家に渡します。専門家は画面を見て行数を数えるのではなく、即座に計算を行うスクリプトを書きます。
耳(音声分析): 録音ファイルをアップロードして「何ページ目と言及されているか?」と尋ねると、専用の音声モデルがファイルを聞き取り、答えを抽出します。
記憶: システムは共有のノートブックを保持します。専門家がステップを完了するたびに、それを記録します。次の専門家はノートブックを受け取り、何が起こったかを読み、物語を続けます。これにより、チームが目標を見失うことがなくなります。
なぜこれが重要なのか(「魔法」のトリック)
この論文は、このシステムが解決する 2 つの主要な問題を強調しています。
「クリック」の問題: 多くの AI エージェントは、画面の正しい場所をクリックするのが苦手です。ボタンを 5 ピクセル左にクリックして見逃してしまうかもしれません。InfantAgent-Next は**「ズームイン」技術**を使用します。ボタンをクリックする必要がある場合、単に推測するのではなく、画面の写真を撮り、大まかな領域を見つけ、その領域を切り取って拡大し、再度ボタンを見つけ、再度切り取ってから、そして クリックします。これは、干し草の山から針を見つけるために虫眼鏡を使うようなもので、クリックが正確であることを保証します。
「編集」の問題: テキストファイルを編集する際、AI は行番号を間違えることがよくあります(例えば、本来は 6 行目であるべきなのに「5 行目を変更」と言ってしまうなど)。InfantAgent-Next には**「二重チェック」システム**があります。変更を提案した後、実際のテキストを見て、「5 行目は本当に私が考えていることを言っているか?」を確認します。そうでない場合、編集を行う前に計画を調整し、厄介なミスを防ぎます。
できること(証拠)
研究者たちは、この「専門家チーム」を、3 種類の課題において他のトップクラスの AI エージェントと比較してテストしました。
現実世界のデスクトップタスク(OSWorld): エージェントに「ファイルをダウンロードする」「ドキュメントを編集する」「ウェブサイトを移動する」などの作業を依頼しました。InfantAgent-Next は、有名な「Claude Computer Use」エージェントを**7.27%**上回りました。人間の助けなしに実際に仕事を完了させる点で優れていました。
コーディングとバグ修正(SWE-Bench): エージェントに、実際のソフトウェアプロジェクトで壊れたコードを修正するよう依頼しました。その性能は、多くの高価なクローズドソースの商用エージェントと同等か、それ以上でした。
一般知識と論理(GAIA): ウェブを検索し、ファイルを読み、推論することを必要とする複雑な質問を投げかけました。InfantAgent-Next は、すべてのオープンソースエージェントの中で 2 位となり、厄介な多段階の論理処理を扱えることを証明しました。
結論
InfantAgent-Next は、何でもになろうとする単一の巨大な AI モデルではありません。それは、いつ「目」、「耳」、「コーダー」、あるいは「マウスクリック役」を呼ぶべきかを正確に知っているモジュール型の指揮者 です。各専門家が最も得意とすることを行うことを可能にすることで、システム全体はより賢く、正確になり、私たちが毎日コンピュータで直面する厄介な現実世界のタスクを処理できるようになります。
研究者たちは、この「専門家チーム」のコードを誰でも利用・研究できるように公開しており、将来さらに優れたコンピュータアシスタントを構築する手助けとなることを願っています。
以下は、論文「InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction」の詳細な技術的サマリーです。
1. 問題提起
現在のコンピュータ操作における自動化 AI エージェントは、汎用性 と精度 の間で根本的なトレードオフに直面しています:
ツールベースのエージェント (例:OpenHands、AutoGPT):特定のタスクでの精度向上のために、定義済みのツール(コード、検索など)に依存しています。しかし、新しいシナリオごとにツールの手動統合が必要となるため、脆く、範囲が限定されます。ツールセットに含まれていないソフトウェアに遭遇すると、しばしば失敗します。
純粋なビジョンエージェント (例:UI-TARS、Aguvis):ツールなしで GUI を直接制御するために、ビジョン言語モデル(vLLM)を使用しています。非常に汎用性が高い一方で、高解像度の推論に苦しみ、UI 要素の誤った位置特定(間違った座標をクリックする)や、単純なツール呼び出しで十分であるファイル編集やコード操作などの精密なタスクで失敗することが多いです。
ギャップ :既存の解決策は、多様で非構造化されたタスクを処理する柔軟性に欠けるか、複雑でツールを多用する操作を確実に実行する精度に欠けています。ツールベースの実行の精度と、純粋なビジョン制御の適応性を統合するハイブリッドパラダイム の必要性があります。
2. 手法:InfantAgent-Next アーキテクチャ
InfantAgent-Next は、統一された対話コンテキスト内でツールベースと純粋なビジョンのアプローチを統合する、高度にモジュール化されたマルチモーダルな汎用エージェント を導入します。単一のモノリシックモデルに依存するのではなく、サブタスクをそれぞれの強みに基づいて専門モデルにルーティングします。
コアアーキテクチャ
このシステムは、それぞれが異なるモデルによって駆動される可能性のある 3 つの明確な役割からなる反復ループで動作します:
プランナー :ユーザーのリクエストと現在の状態を分析し、高レベルのタスク計画を生成します。
ツールセレクター :キュレーションされたライブラリから、最も適切なツールキット(例:ファイル編集、ウェブブラウジング、コンピュータ操作)を動的に選択します。
エグゼキューター :選択されたツールを呼び出し、環境からのフィードバックを収集します。
主要な技術的コンポーネント :
モジュール化されたワークフローとメモリ :エージェントは統一された対話履歴を維持しますが、特別なタグ(<thought>、<task>、<toolkit>、<execute_bash> など)を使用して応答を解析します。これにより、現在のサブタスク(計画対実行)に特化したコンテキストを再構築でき、コンテキストウィンドウの肥大化や無関係なコンテンツの生成を防ぎます。
動的ツールセット :システムはツールを 7 つのツールキット(ファイル読み取り、検索、編集、ウェブブラウジング、コンピュータ操作、コード実行、高度なツール)に分類します。推論コストと LLM への認知的負荷を軽減するため、各ステップで関連するツールのサブセットを動的に選択します。
マルチモーダル統合 :エージェントはテキスト、画像、音声、ビデオをサポートします。音声分析を専門の音声モデルへ、視覚的グラウンディングをビジョンモデルへ、論理的推論を高度な LLM へルーティングできます。
革新的な改善
この論文は、SOTA エージェントにおける既知の失敗点を解決するための特定のアルゴリズムを導入しています:
マウスクリックのための反復領域クロッピング(アルゴリズム 1) :モデルが座標を誤って特定する「視覚的グラウンディング」の問題を解決するため:
エージェントはフルスクリーンのスクリーンショットを取得します。
視覚的グラウンディングモデルが候補座標を予測します。
システムはその座標周辺の小さな領域を切り出します。
このプロセスを n n n 回繰り返します(検索領域を反復的に狭めます)。
最終的に洗練された座標がクリックに使用されます。これにより、無関係なピクセルからの干渉が大幅に減少します。
堅牢なファイル編集(アルゴリズム 2) :行番号ベースのファイル編集におけるエラーを処理するため:
エージェントは開始/終了行と期待されるコンテンツを含む計画を生成します。
実際のファイルコンテンツが期待される境界と一致するか検証します。
ミスマッチが発生した場合(例:オフ・バイ・ワンエラー)、フォールバック戦略 に切り替えます:期待されるコンテンツ文字列をファジー化し、ファイル内で最良の一致するスパンを検索し、変更を適用する前に編集リクエストを動的に更新します。
3. 主要な貢献
InfantAgent-Next フレームワーク :ツールベースと純粋なビジョンのパラダイムを橋渡しし、テキスト、画像、音声、ビデオ入力をサポートするオープンソースのマルチモーダル汎用エージェント。
詳細なモジュール化 :計画、ツール選択、実行を分離する革新的なアーキテクチャ。これにより、異なるモデル(推論、視覚的グラウンディング、音声分析)が統一されたコンテキスト内でシームレスに連携できます。
強化された実行メカニズム :高精度な GUI 操作のための反復領域クロッピング の導入と、信頼性の高いファイル編集のためのファジーマッチフォールバック の導入。これらは現在のエージェントの 2 つの主要な失敗モードに対処します。
オープンソースツールキット :将来の研究を支援するための、最適化されたエージェントツール群と隔離された実行環境(VM ベース)のリリース。
4. 実験結果
このエージェントは、ビジョン、論理、一般タスクを網羅する 3 つの主要なベンチマークで評価されました:
OSWorld(視覚的推論) :
指標 :369 のオープンエンドなデスクトップタスクの精度。
結果 :InfantAgent-Next は(50 ステップで)35.3% の精度 を達成し、Claude-Computer-Use(26.0%)を 7.27% 上回り 、Agent-S2 などの他のオープンソースフレームワークをも凌駕しました。自然言語指示を GUI 要素にグラウンディングする能力が優れていることを示しました。
SWE-Bench(論理的推論とコード) :
指標 :現実世界の GitHub 課題の解決。
結果 :SWE-Bench-Verified (50 ケース)のサブセットでは、66% の精度 を達成し、Amazon Q Developer Agent(54%)などのいくつかのクローズドソースエージェントを上回りました。SWE-Bench-Lite では**31.67%**を達成し、トップクラスのオープンソースエージェントにランクインしました。
GAIA(一般タスクパフォーマンス) :
指標 :3 つの難易度レベルにわたるオープンエンドな質問。
結果 :InfantAgent-Next はオープンソースエージェントの中で2 位 (平均 56.97%)にランクインし、OWL の次に位置しました。レベル 2(中級)の難易度の質問において、最先端のパフォーマンスを達成しました。
アブレーション研究 :
反復領域クロッピング メカニズムは、3 回目の反復で精度が収束することが示されました。2 回の反復が性能とコストの間の最適なトレードオフを提供しました。
ファイル編集 ロジックは、SWE-Bench タスクで90.4% の総成功率 を達成し、失敗した試みの 84.3% を正常に修復しました(例:オフ・バイ・ワン行エラーの修正)。
5. 意義
InfantAgent-Next は、汎用コンピュータエージェント における重要な前進を表しています。「単一のモデルがすべてを行う」または「硬直したツールチェーン」というアプローチから脱却し、モジュール化されたマルチモデルアーキテクチャ が、専門的なグラウンディングと編集ロジックによる実行の高精度さと、動的なツール選択およびマルチモーダル理解による広範な適応性の両方を達成できることを実証しています。
この研究は以下のことを証明しています:
ハイブリッド化が鍵である :LLM の推論能力と、専門的なビジョンおよびツールモジュールの精度を組み合わせることは、モノリシックモデルを上回ります。
反復的洗練が機能する :反復的クロッピングのような単純なアルゴリズム的改善は、視覚的エージェントを悩ませる「幻覚化した座標」の問題を劇的に解決できます。
スケーラビリティ :このフレームワークは、コード、ウェブブラウジング、ファイル操作を含む複雑な多段階ワークフローを処理するのに十分な堅牢性があり、現実世界の自動化タスクの実現可能な候補となります。
コード、モデル、評価スクリプトのオープンソース化は、コミュニティがマルチモーダルエージェントシステムをさらに発展させるための強力な基盤を提供します。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×