PANDO: Efficient Multimodal AI Agents via Online Skill Distillation
PANDO は、構造化されたスキルライブラリを維持し、進捗の振り返りやキャッシュを考慮したプロンプト作成などの手法を採用することで、マルチモーダル Web エージェントがパフォーマンスを向上させ、トークン消費を削減することを可能にする効率的なオンラインスキル蒸留フレームワークを導入し、既存の手法と比較して推論コストを大幅に削減しながら VisualWebArena において 58.3% の成功率を達成します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、PANDO論文の説明を、比喩を用いて日常言語に翻訳したものです。
大きな問題:「クリック課金」の罠
あなたがオンラインショッピングを手伝ってくれる、非常に賢いけれど高価なアシスタントを雇っていると想像してください。彼がウェブページを見るたびに、何をすべきか考えたり、ボタンをクリックしたりするたびに、あなたは彼に少額の料金(「トークン」と呼ばれる)を支払わなければなりません。
現在、ほとんどの AI エージェントは、より多くのお金をかけることによって、仕事をより上手にこなそうとしています。失敗すれば、もう一度試します。行き詰まれば、第二の意見を求めます。同じタスクを 10 回実行し、最も良い結果を選びます。これは機能しますが、それは食料品店に行くためにタクシーを呼び、財布を忘れたかどうか確認するために戻って 2 台目のタクシーを呼び、さらに価格を再確認するために 3 台目のタクシーを呼ぶようなものです。仕事は片付きますが、信じられないほど高価で遅いものです。
この論文の著者たちは、こう問いかけました:「AI が動くたびに単にお金をかけ続けるのではなく、より多く働くほど、より安く、より速くなるエージェントは作れるだろうか?」
解決策:PANDO(「巨大なアスペン」エージェント)
研究者たちはPANDOという名前のエージェントを構築しました。その名前は、ユタ州にある「パンド」と呼ばれるアスペンの森に由来しています。
- 比喩: パンドは 47,000 本の別々の木のように見えますが、実際には地下の1 つの単一の根系ですべてが繋がっています。1 本の木が成長すると、他の木に栄養を共有します。1 本の木が枯れても、根系はそれを記憶し、森全体を生き続けさせます。
- AI 版: PANDO は、共有された「記憶の根系」(スキルライブラリ)を持つ AI エージェントです。新しいタスクを毎回全く新しい問題として扱うのではなく、過去のタスクから学んだことを記憶し、その教訓を新しい問題の解決に活用します。
PANDO の仕組み(4 段階のループ)
PANDO は単に推測して確認するだけではありません。次のサイクルに従います:計画 → 実行 → 振り返り → 学習。
- 計画: 「脳」(賢く高価な AI)が、大きなタスク(例:「500 ドル以下の最安値のギターを見つける」)を小さなステップに分解します。
- 実行: 「手」(安価で高速な AI)が実際にボタンをクリックします。
- 振り返り: 「マネージャー」が、ステップが機能したかを確認します。価格フィルターは本当にリストを変更しましたか?もしそうでなければ、なぜですか?
- 学習(魔法のパート): ここで PANDO が賢くなります。
- スキルライブラリ: エージェントが安価なギターを正常に見つけると、レシピを書き留めます。「安価なアイテムを見つけるには、『価格順』をクリックし、次に『安値順』をクリックする」。これをルールまたはルーチンとして保存します。
- スキルの再利用: 次にエージェントが「最も高価な」アイテムを見つける必要があるとき、必死に考える必要はありません。ライブラリを見てルールを確認し、「高値順」にスイッチを切り替えるだけです。
- 降格(クリーンアップ): ルールが機能しなくなった場合(例:ウェブサイトのレイアウトが変わったなど)、エージェントはそれを「壊れた」とマークし、使用を停止します。これにより、古い壊れた指示を使い続けてループに陥るのを防ぎます。
なぜこれがゲームチェンジャーなのか
この論文は、PANDO を910 種類の異なるウェブタスク(ショッピング、classifieds、Reddit)でテストしました。その結果は以下の通りです。
- 成功率: PANDO は**58.3%**の成功率を達成しました。これは現在のトップエージェント(約 54%)よりも優れています。
- コスト: これが最大の勝利です。PANDO は、次に良いエージェントよりも58% 少ないトークン(お金)を使用しました。
- 「無料のランチ」効果:
- 初期段階: PANDO はルールを学習しているため、少し遅いです。
- 後期段階: スキルライブラリを構築するにつれ、より速く、より安くなります。テストの終わりには、開始時よりも少ないステップと少ないお金でタスクを解決していました。
- 比喩: 数学のテストを受ける学生を想像してください。
- 従来のエージェント: 新しい問題を見るたびに、公式をゼロから再導出します。時間がかかります。
- PANDO: 最初に問題を見ると、それを解いて公式をカンニングペーパーに書き留めます。次の 99 回では、カンニングペーパーを見るだけです。テストは早く終わり、脳力も少なくて済みます。
PANDO が回避する「隠れたコスト」
この論文は、他のエージェントがコストを 2 つの方法で隠している点を指摘しています。
- 事前評価での発見: 一部のエージェントは、テストが始まる前に数週間「トレーニング」したりツールを「発見」したりします。PANDO はテスト中に学習するため、隠れた初期コストはありません。
- ロールアウトのスケーリング: 一部のエージェントは単にタスクを 10 回試し、勝者を選びます。PANDO は 1 回だけ試しますが、その 1 回を記憶を使って価値あるものに変えます。
結論
PANDO は、AI をより良くするために、より多くのお金を投じる必要がないことを証明しています。構造化された記憶(スキルライブラリ)と、悪い記憶を整理する方法(降格)を与えることで、エージェントはより多く働くほど効率的になります。
それは、毎日すべてを忘れ、常に再教育を受けなければならない労働者と、「やり方」をメモしたノートを持ち、毎日一歩ずつ速くなる労働者の違いです。
重要なポイント: PANDO は単に賢くなるだけでなく、経験を得るにつれて、運用コストが安くなります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。