← 最新の論文
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

本論文は、OSWorld、GAIA、SWE-Bench などの多様なベンチマークにおいて最先端の性能を達成し、ツールベースの機能と純粋な視覚機能とを統合して協調的なステップごとのコンピュータ操作を可能にする、高度にモジュール化されたマルチモーダル汎用エージェントである InfantAgent-Next を紹介する。

原著者: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

公開日 2026-05-04
📖 1 分で読めます☕ さくっと読める

原著者: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの、少し不器用な個人アシスタント「InfantAgent-Next」という存在を想像してみてください。

コンピュータ自動化の世界において、現在のアシスタントの多くは、一つのことだけを非常に上手にこなす専門家か、あるいは何でもやろうとするがしばしば混乱する一般職のどちらかのようです。

  • 一部のアシスタントは司書のようです:彼らは特定のツールリスト(「ウェブを検索する」や「ファイルを開く」など)を使うのが得意ですが、これまで見たことのない画面のボタンをクリックするように頼むと、その特定のボタンに対応するツールを持っていないため、固まってしまいます。
  • 別のアシスタントは芸術家のようです:彼らは画面を見て「何があるか」を認識できますが、複雑な数学計算やコード作成は苦手です。なぜなら、彼らは電卓やテキストエディタを使わず、目だけで全てをこなそうとしているからです。

InfantAgent-Nextは異なります。これは単一の人物を雇うのではなく、スイスアーミーナイフチームを雇うようなものです。

仕組み:「脳と手」のチーム

すべてをこなそうとする巨大な脳ではなく、InfantAgent-Next はあらゆる作業を小さなステップに分解し、それぞれのステップを最も適した専門家へ送ります。

  1. マネージャー(プランナー): 「このウェブページをブックマークに保存して」と頼むと、高レベルの「マネージャー」モデルがリクエストを読み取ります。マネージャーは自らマウスをクリックしようとはしません。代わりに、「よし、ブラウザを開き、ブックマークボタンを探して、それをクリックする必要がある」と言います。
  2. 専門家たち: マネージャーは次に、その仕事にふさわしい適切な専門家を手配します。
    • 目(視覚的グラウンディング): 「赤いボタンをクリックする」というタスクの場合、専用の視覚モデルが画面を見て、その赤いボタンの正確なピクセル座標を見つけ、システムにどこをクリックすべきかを伝えます。これは、目が見えない弓使いを鋭い目を持つ見張り役が導くようなものです。
    • 計算機(コード実行): 「この Excel ファイルを分析する」というタスクの場合、マネージャーはファイルをコーディングの専門家に渡します。専門家は画面を見て行数を数えるのではなく、即座に計算を行うスクリプトを書きます。
    • 耳(音声分析): 録音ファイルをアップロードして「何ページ目と言及されているか?」と尋ねると、専用の音声モデルがファイルを聞き取り、答えを抽出します。
  3. 記憶: システムは共有のノートブックを保持します。専門家がステップを完了するたびに、それを記録します。次の専門家はノートブックを受け取り、何が起こったかを読み、物語を続けます。これにより、チームが目標を見失うことがなくなります。

なぜこれが重要なのか(「魔法」のトリック)

この論文は、このシステムが解決する 2 つの主要な問題を強調しています。

  • 「クリック」の問題: 多くの AI エージェントは、画面の正しい場所をクリックするのが苦手です。ボタンを 5 ピクセル左にクリックして見逃してしまうかもしれません。InfantAgent-Next は**「ズームイン」技術**を使用します。ボタンをクリックする必要がある場合、単に推測するのではなく、画面の写真を撮り、大まかな領域を見つけ、その領域を切り取って拡大し、再度ボタンを見つけ、再度切り取ってから、そしてクリックします。これは、干し草の山から針を見つけるために虫眼鏡を使うようなもので、クリックが正確であることを保証します。
  • 「編集」の問題: テキストファイルを編集する際、AI は行番号を間違えることがよくあります(例えば、本来は 6 行目であるべきなのに「5 行目を変更」と言ってしまうなど)。InfantAgent-Next には**「二重チェック」システム**があります。変更を提案した後、実際のテキストを見て、「5 行目は本当に私が考えていることを言っているか?」を確認します。そうでない場合、編集を行う前に計画を調整し、厄介なミスを防ぎます。

できること(証拠)

研究者たちは、この「専門家チーム」を、3 種類の課題において他のトップクラスの AI エージェントと比較してテストしました。

  1. 現実世界のデスクトップタスク(OSWorld): エージェントに「ファイルをダウンロードする」「ドキュメントを編集する」「ウェブサイトを移動する」などの作業を依頼しました。InfantAgent-Next は、有名な「Claude Computer Use」エージェントを**7.27%**上回りました。人間の助けなしに実際に仕事を完了させる点で優れていました。
  2. コーディングとバグ修正(SWE-Bench): エージェントに、実際のソフトウェアプロジェクトで壊れたコードを修正するよう依頼しました。その性能は、多くの高価なクローズドソースの商用エージェントと同等か、それ以上でした。
  3. 一般知識と論理(GAIA): ウェブを検索し、ファイルを読み、推論することを必要とする複雑な質問を投げかけました。InfantAgent-Next は、すべてのオープンソースエージェントの中で 2 位となり、厄介な多段階の論理処理を扱えることを証明しました。

結論

InfantAgent-Next は、何でもになろうとする単一の巨大な AI モデルではありません。それは、いつ「目」、「耳」、「コーダー」、あるいは「マウスクリック役」を呼ぶべきかを正確に知っているモジュール型の指揮者です。各専門家が最も得意とすることを行うことを可能にすることで、システム全体はより賢く、正確になり、私たちが毎日コンピュータで直面する厄介な現実世界のタスクを処理できるようになります。

研究者たちは、この「専門家チーム」のコードを誰でも利用・研究できるように公開しており、将来さらに優れたコンピュータアシスタントを構築する手助けとなることを願っています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →