✨ 要約🔬 技術概要
ロボットにインターネットで買い物に行く方法を教えているところを想像してみてください。あなたはこう思うかもしれません。「『赤いシャツを買って』といったテキストの指示を与えれば、ロボットはウェブサイトを読み取り、ボタンをクリックしてくれるはずだ」と。しかし、ここに落とし穴があります。ウェブサイトは単なるテキストの壁ではありません。それは画像やレイアウト、デザインに満ちた、色彩豊かで視覚的な場所なのです。もし人間に特定の靴を探すよう頼んだら、その人は単に説明文を読むだけではありません。色やスタイル、形を確認するために、写真に目を向けます。長い間、ウェブをナビゲートしようとしてきた最も賢いコンピュータプログラムたちは、まるで「盲目の買い物客」のようでした。彼らはテキストを完璧に読むことはできても、画像を「見る」ことはできなかったのです。この論文は、人工知能の世界、特に「ウェブ・ナビゲーション・エージェント」に焦点を当てています。これらは、自然言語のコマンドを理解し、商品の購入やチケットの予約といった実際のウェブサイト上でのタスクを実行するように設計されたデジタルヘルパーです。研究者たちが投げかけている大きな問いは、「私たちは、人間と同じように、これらのエージェントに『目』(画像を見る力)と『脳』(テキストを読む力)を同時に使う方法を教えることができるだろうか?」ということです。
MELLONというプロジェクトに取り組んでいるこの研究者たちは、このアイデアを検証するために、「WebShop」と呼ばれるシミュレーション上のオンラインストアでテストを行うことにしました。彼らは、AIエージェントに商品の写真を見せることで、テキストの説明とともに提示することが、より良い意思決定に役立つかどうかを確認したいと考えました。彼らはただ推測したわけではなく、このパズルを解くために3つの異なる実験的ツールを構築しました。最初で、かつ最も成功したのが、MELLON自体です。MELLONを、視覚的な世界をAIの脳が理解できる言語へと翻訳する特別なメガネをかけた、超スマートな買い物客だと考えてください。チームは、このエージェントをわずか1ラウンド(1エポック)学習させるだけで、仕事の精度が大幅に向上することを発見しました。具体的には、テキストのみを参照する基本バージョンと比較して、タスク完了の正確性が9.26%上昇しました。これは、システムにはまだ成長痛があるものの、視覚とテキストを組み合わせることは、AIがウェブをナビゲートするのを助ける強力な方法であることを示唆しています。
しかし、物語は決して「マルチモーダル(多峰性)は常に勝利である」という単純な勝利宣言ではありません。チームは他にも2つの独創的なアプローチを試みましたが、期待したほどの結果は得られませんでした。一つのアイデアは、ショッピングのタスクを「視覚的質問応答(Visual Question Answering)」ゲーム(VQAgent)のように扱うことでした。これは、AIが画像と質問を見て、正しい答えを選ぶというものです。彼らは、ショッピングは画像に関する質問に答えることと似ているため、これが機能すると考えました。しかし、WebShopという雑多な現実世界のコンテキストにおいては、画像よりもテキストの説明の方が重要な手がかりを持っていることを発見しました。AIは画像に大きく依存するように訓練されていたため、テキストこそが解決の鍵である場合に混乱してしまったのです。それは、答えが細かい文字の中に隠れているのに、絵をじっと見つめることで謎を解こうとしているようなものです。
3番目の試みは、「マルチモーダル・ランカー(Multimodal Ranker)」を用いたものでした。これは、最初に見つけたものをすぐに掴むのではなく、ページ上のあらゆるアイテムを注意深く比較して立ち止まるように設計されたツールです。この追加の思考時間が、より良い結果につながると期待されました。しかし、実験の結果、この慎重さは逆にエージェントを遅くさせ、精度を低下させることが分かりました。研究者たちは、画像とテキストの類似性を測定するために使用されるツール(BERTおよびCLIPスコアと呼ばれます)が、ゲームのスコアリングシステムにおける「良い一致」の実態と、うまく一致していないことを発見しました。結局のところ、すべての選択肢をランク付けしようとすることは、店中のシャツを1時間かけて比較した挙렵、結局は間違ったシャツを買ってしまう買い物客のようなものだったのです。
では、このデジタル・ショッピングの冒険から得られる最終的な教訓は何でしょうか?この論文は、AIエージェントにウェブを「見る」能力を与えることは有望な道ではあるものの、魔法の杖ではないことを示唆しています。MELLONエージェントは、画像とテキストを整合させることがパフォーマンスを向上させることを証明しましたが、他の実験は、単に複雑な視覚的推論を追加したり、エージェントにすべてを見させたりすることが、必ずしも正しい戦略ではないことを示しました。研究者たちは、視覚的な手がかりとテキストの手がかりをどのように最適に組み合わせるかを、例えばエージェントをもっと長く訓練したり、将来的にさらにスマートな「脳」(大規模言語モデル)を使用したりすることで、探索を続ける必要があると結論付けています。今のところ、彼らは「少しの視覚が大きな進歩をもたらす」ことを示しましたが、AIは、いつ写真を見るべきで、いつ細かい文字を読むべきかを、まだ学ぶ必要があるのです。
技術要約: MELLON - オンラインナビゲーションのためのマルチモーダル強化型LLM
問題提起
ウェブナビゲーションエージェントは、自然言語の指示に基づいてウェブサイト上でタスクを自律的に実行するように設計されています。現在のベースラインの多くは、その推論能力を活用するために大規模言語モデル(LLM)を利用していますが、それらは主に単一様式(unimodal)で動作しており、テキスト(HTMLやアクセシビリティツリー)のみに依存し、視覚情報を無視しています。著者らは、これが特に WebShop のようなeコマース環境において決定的な制限になると主張しています。なぜなら、製品の仕上げ、色、スタイルといった視覚的な手がかりには、テキストによる説明には欠落している定性的な情報が含まれていることが多いからです。既存のマルチモーダルなアプローチは、強力な推論能力を欠いているか、あるいは、定義されたアクションスペースからの逸脱がタスクの失敗につながる、動的で制約のあるウェブナビゲーションの性質に苦慮しています。
手法
本論文は、これらの課題に対処するために3つの異なるマルチモーダル・アプローチを提案しており、その中心となるのがMELLON (Multimodal Enhanced LLM for Online Navigation)です。
1. MELLON (Multimodal Enhanced LLM for Online Navigation)
MELLONは、強化された推論とプランニングのために視覚とテキストのモダリティを統合するように設計されたウェブエージェントです。そのアーキテクチャは、以下の3つの核心的な革新から構成されています。
優れたエンコーダー: 本モデルは、画像エンコーディングを生成するために、事前学習済みのVision Transformer (ViT)バックボーンと Q-Former を組み合わせて利用しています。従来のCNN(例:ResNet)とは異なり、ViTは画像パッチをトークンとして扱うことで、空間的な関係をより効果的に捉えます。
テキストと画像の整合および効率的な学習: 視覚エンコーダーとLLMの間のギャップを埋めるために、単一の**投影層(projection layer)**が採用されています。この層は、視覚的な埋め込みをLLMの入力空間に整合させます。
学習戦略: 著者らは、LLM(CodeLlama)とViTを**凍結(frozen)**したまま、投影層とQ-Formerのみを学習させるパラメータ効率の高い手法を採用しています。
損失関数: モデルは、マルチモーダルな入力と成功したアクションのペアを用いたクロスエントロピー生成損失を用いて学習されます。WebShopの完了スコアが損失関数に統合され、推論とアクションの整合性を共同で最適化します。
拡張されたReActプロンプト: 標準的なReAct(Reasoning + Acting)プロンプトは、整合された視覚表現(<ImageHere>を介して挿入)を含むように再設計されました。プロンプトエンジニアリングは、エージェントが疎な推論を行い、有効な空間(A ′ = A ∩ L A' = A \cap L A ′ = A ∩ L )からアクションを選択できるように、24 GBのGPUメモリ制約内に収まるよう高度に最適化されました。
2. VQAgent
このアプローチは、WebShopのタスクを、「答え」がアクションに対応するマルチホップの**視覚的質問応答(VQA)**問題として再定義します。
アーキテクチャ: 最先端の視覚言語モデルであるBEiT3 モデルを利用しています。
適応: 標準的なVQA(生成タスク)とは異なり、WebShopは分類タスクとして扱われます。モデルは、BEiT3を用いて、観測事項(画像、製品説明、指示)とすべての可能なアクションを個別にエンコードします。これらの埋め込みは、バイアテンション層と線形層を通じて処理され、アクションのスコアが算出されます。
学習: 人間の軌跡を用いた**模倣学習(Imitation Learning)**を通じて、正しいアクション選択を模倣するように学習されます。
3. マルチモーダル・ランカー (Multimodal Ranker)
このコンポーネントは、最初の結果のみを選択するのではなく、意思決定を行う前にすべての利用可能なオプションを体系的に評価することで、探索的行動を改善することを目的としています。
メカニズム: 指示と製品タイトルの間のテキスト的類似性を測定するBERTスコア と、画像とテキストの適合性を測定するCLIPスコア を組み合わせます。
学習: 学習可能なパラメータがこれら2つの次元のバランスを取り、ランカーはWebShopの完了スコアをラベルとしてMSE(平均二乗誤差)損失を用いて学習されます。
主な結果
MELLONのパフォーマンス
精度の向上: MELLONをわずか1エポック 学習させただけで、単一様式のViT+CodeLlama推論ベースラインと比較して、ステップごとのタスク完了精度が9.26%向上 しました(5.11%から14.37%へ上昇)。
アブレーション研究:
ResNetベースラインをViT + 学習可能なQ-Formerに置き換えた場合、同等のスコア(39.92)を得ましたが、成功率はResNetと比較してわずかに低くなりました(9.8% vs 9.6%)。これは、単純なモデルが特定の文脈では十分であるか、あるいはタスクが限定的なマルチモーダル・コンテキストを必要としていることを示唆しています。
CodeLlama は、ハルシネーション(幻覚)が少なく、タスク形式への遵守が優れているため、Vicuna-7Bよりも好まれました。ただし、CodeLlamaであっても、空の出力や無効な出力を生成することが時折ありました。
定性的分析: 特定のケース(例:「ウッドフィニッシュ」のラブシートの選択)において、MELL型は視覚的な手がかりを利用して正しい製品を特定することに成功しましたが、単一様式のベースラインは視覚的な理解が不足していたため失敗しました。
VQAgentおよびマルチモーダル・ランカーのパフォーマンス
VQAgent: このモデルはベースラインを下回り、スコア31.26、成功率5.7%を記録しました(ベースラインは39.92、成功率9.8%)。著者らは、これを情報の密度の不一致に起因すると考えています。標準的なVQAタスクでは視覚情報が支配的ですが、WebShopではテキストによる説明に重要な情報が含まれていることが多いためです。
マルチモーダル・ランカー: ランキングアルゴリズムの統合により、パフォーマンスが低下 しました(スコア:28.13、成功率:8.6%)。著者らは、WebShopの広大な探索空間において徹底的な探索は非効率であり、BERT/CLIPの類似度スコアがWebShop環境の特定の報酬基準と信頼性高く相関していないことを示唆しています。
意義と主張
本論文は、以下の点において初であると主張しています:
動的なウェブのアクションスペースへのオープンエンドな生成のマッピングというエンジニアリング上の課題があるにもかかわらず、LLM を組み込んだマルチモーダル・ウェブナビゲーションエージェントを開発したこと。
投影層 を介して視覚的およびテキスト的表現をLLMに整合させ、効率的な学習戦略(LLMとViTの凍結)を実証したこと。
視覚表現を含むようにReActプロンプトを再設計 することで、マルチモーダルな設定における強力な推論とプランニングを可能にしたこと。
著者らは、MELLONが最小限の学習(1エポック)で顕著な有望性を示している一方で、その結果はマルチモーダルなアプローチへのさらなる探求の必要性を浮き彫りにしていると強調しています。彼らは、LLMとViTが凍結されている性質や、WebShop環境におけるエンジニアリング上の課題を含む現在の限界を認めています。本研究は、より広範な学習、より大きなメモリリソース、そして潜在的にはLLMのファインチューニングを行うことで、マルチモーダルなエージェントがウェブナビゲーションタスクにおいて大幅に高い有効性を達成できる可能性があることを示唆しています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×