← 最新の論文
🤖 AI

MELLON - Multimodal Enhanced LLM for Online Navigation

本論文は、テキストと画像を整合させることで推論とプランニングを向上させ、わずか1エポックの学習で9.26%の精度向上を達成し、WebShopベンチマークにおけるウェブナビゲーションエージェントの性能を大幅に高めるマルチモーダルフレームワークであるMELLONを紹介している。

原著者: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにインターネットで買い物に行く方法を教えているところを想像してみてください。あなたはこう思うかもしれません。「『赤いシャツを買って』といったテキストの指示を与えれば、ロボットはウェブサイトを読み取り、ボタンをクリックしてくれるはずだ」と。しかし、ここに落とし穴があります。ウェブサイトは単なるテキストの壁ではありません。それは画像やレイアウト、デザインに満ちた、色彩豊かで視覚的な場所なのです。もし人間に特定の靴を探すよう頼んだら、その人は単に説明文を読むだけではありません。色やスタイル、形を確認するために、写真に目を向けます。長い間、ウェブをナビゲートしようとしてきた最も賢いコンピュータプログラムたちは、まるで「盲目の買い物客」のようでした。彼らはテキストを完璧に読むことはできても、画像を「見る」ことはできなかったのです。この論文は、人工知能の世界、特に「ウェブ・ナビゲーション・エージェント」に焦点を当てています。これらは、自然言語のコマンドを理解し、商品の購入やチケットの予約といった実際のウェブサイト上でのタスクを実行するように設計されたデジタルヘルパーです。研究者たちが投げかけている大きな問いは、「私たちは、人間と同じように、これらのエージェントに『目』(画像を見る力)と『脳』(テキストを読む力)を同時に使う方法を教えることができるだろうか?」ということです。

MELLONというプロジェクトに取り組んでいるこの研究者たちは、このアイデアを検証するために、「WebShop」と呼ばれるシミュレーション上のオンラインストアでテストを行うことにしました。彼らは、AIエージェントに商品の写真を見せることで、テキストの説明とともに提示することが、より良い意思決定に役立つかどうかを確認したいと考えました。彼らはただ推測したわけではなく、このパズルを解くために3つの異なる実験的ツールを構築しました。最初で、かつ最も成功したのが、MELLON自体です。MELLONを、視覚的な世界をAIの脳が理解できる言語へと翻訳する特別なメガネをかけた、超スマートな買い物客だと考えてください。チームは、このエージェントをわずか1ラウンド(1エポック)学習させるだけで、仕事の精度が大幅に向上することを発見しました。具体的には、テキストのみを参照する基本バージョンと比較して、タスク完了の正確性が9.26%上昇しました。これは、システムにはまだ成長痛があるものの、視覚とテキストを組み合わせることは、AIがウェブをナビゲートするのを助ける強力な方法であることを示唆しています。

しかし、物語は決して「マルチモーダル(多峰性)は常に勝利である」という単純な勝利宣言ではありません。チームは他にも2つの独創的なアプローチを試みましたが、期待したほどの結果は得られませんでした。一つのアイデアは、ショッピングのタスクを「視覚的質問応答(Visual Question Answering)」ゲーム(VQAgent)のように扱うことでした。これは、AIが画像と質問を見て、正しい答えを選ぶというものです。彼らは、ショッピングは画像に関する質問に答えることと似ているため、これが機能すると考えました。しかし、WebShopという雑多な現実世界のコンテキストにおいては、画像よりもテキストの説明の方が重要な手がかりを持っていることを発見しました。AIは画像に大きく依存するように訓練されていたため、テキストこそが解決の鍵である場合に混乱してしまったのです。それは、答えが細かい文字の中に隠れているのに、絵をじっと見つめることで謎を解こうとしているようなものです。

3番目の試みは、「マルチモーダル・ランカー(Multimodal Ranker)」を用いたものでした。これは、最初に見つけたものをすぐに掴むのではなく、ページ上のあらゆるアイテムを注意深く比較して立ち止まるように設計されたツールです。この追加の思考時間が、より良い結果につながると期待されました。しかし、実験の結果、この慎重さは逆にエージェントを遅くさせ、精度を低下させることが分かりました。研究者たちは、画像とテキストの類似性を測定するために使用されるツール(BERTおよびCLIPスコアと呼ばれます)が、ゲームのスコアリングシステムにおける「良い一致」の実態と、うまく一致していないことを発見しました。結局のところ、すべての選択肢をランク付けしようとすることは、店中のシャツを1時間かけて比較した挙렵、結局は間違ったシャツを買ってしまう買い物客のようなものだったのです。

では、このデジタル・ショッピングの冒険から得られる最終的な教訓は何でしょうか?この論文は、AIエージェントにウェブを「見る」能力を与えることは有望な道ではあるものの、魔法の杖ではないことを示唆しています。MELLONエージェントは、画像とテキストを整合させることがパフォーマンスを向上させることを証明しましたが、他の実験は、単に複雑な視覚的推論を追加したり、エージェントにすべてを見させたりすることが、必ずしも正しい戦略ではないことを示しました。研究者たちは、視覚的な手がかりとテキストの手がかりをどのように最適に組み合わせるかを、例えばエージェントをもっと長く訓練したり、将来的にさらにスマートな「脳」(大規模言語モデル)を使用したりすることで、探索を続ける必要があると結論付けています。今のところ、彼らは「少しの視覚が大きな進歩をもたらす」ことを示しましたが、AIは、いつ写真を見るべきで、いつ細かい文字を読むべきかを、まだ学ぶ必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →