← 最新の論文
🤖 machine learning

Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

本論文は、PlanAhead フレームワークを導入し、自然言語による計画表現の選択(逐次的なサブゴール、物語形式、疑似コード、またはチェックリストなど)と基盤となる大規模言語モデルの両方が、WebArena の困難なタスクにおけるマルチモーダル Web エージェントのロバスト性と成功率に決定的な影響を与えることを実証的に示す。

原著者: Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いけれど、少し不器用なロボットにオンラインショッピングを任せていると想像してください。「歯ぎしりのためのマウスガードを買ってきて」と指示を出します。ロボットはウェブサイトをナビゲートし、商品を見つけ、決済まで行う必要があります。

時にはロボットは成功しますが、他の時にはループに陥ったり、間違ったものを買ったり、完全に諦めてしまったりします。

この論文は、シンプルな問いを投げかけます:指示の書き方によって結果は変わるのでしょうか?

多くの人は、ロボットに明確なステップバイステップのリスト(レシピのようなもの)を与えれば、それが最善だと考えています。しかし、この研究の研究者たちは疑問に思いました:もしロボットが物語やチェックリスト、あるいはコンピュータのコードスクリプトの方が得意だとしたらどうでしょうか?

以下に、彼らの研究を簡単に解説します。

1. 問題:ロボットは迷子になる

最高の AI の頭脳を持っていても、ウェブエージェント(インターネットを閲覧するロボット)はよく失敗します。重要なステップを見逃したり、ポップアップに混乱したり、何をやろうとしていたかを忘れたりすることがあります。研究者たちは、ロボットに与えられた計画の形式が原因だと疑いました。

2. 実験:「PLANAHEAD」キッチン

研究者たちはPLANAHEADと呼ばれるテスト用キッチンを作成しました。彼らは新しいロボットを発明したのではなく、既存のロボットに与えるレシピを変えただけです。

彼らは 158 の非常に困難なタスク(複雑なウェブサイトでの特定商品の購入など)を、さまざまな AI モデルに与えました。しかし、ロボットが作業を開始する前に、4 つの異なる「言語」のいずれかで計画を与えました。

  • レシピ(逐次的なサブゴール): 標準的な方法。「ステップ 1:ここへ行く。ステップ 2:それをクリックする。」
  • 物語(ナラティブ): 旅路を記述する段落。「マウスガードを得るためには、まず検索することから始めるべきだ…」
  • チェックリスト(要件): 必ず実行されなければならないもののリストだが、順序は問わない。「カートに商品が入っていること。住所が入力されていること。」
  • コード(疑似コード): 「if/then」ルールを含む論理スクリプト。「商品が見つかったら購入をクリックする。見つからなければ再度検索する。」

3. 新しいスコアカード:「成功/失敗」を超えて

通常、研究者はロボットがタスクを完了した回数を数えるだけ(成功率)です。しかし、AI は予測不能です。時には運よく成功し、時には不運で失敗します。

著者たちは、ロボットを評価する 2 つの新しい方法を考案しました。

  • 達成率(AR): 「5 回試行させた場合、ロボットはいつかこのタスクを成功させたでしょうか?」これは、そのロボットにとってタスクが可能かどうかを測定します。
  • 解決タスクの一貫性(STC): 「ロボットが成功した場合、どのくらいの頻度で成功しましたか?」これは信頼性を測定します。100% 正解したのか、それとも 20% だけだったのか?

4. 驚くべき結果

この研究は、万能な方法は存在しないことを発見しました。「最良」の指示の与え方は、使用するどのロボットの頭脳かによって完全に異なります。

  • 「物語を語る」ロボット: あるモデル(GPT-4.1-mini)は、物語形式で与えられた場合に最もよく機能しました。それは、乾燥したステップのリストよりも、タスクの「物語」を理解しているように見えました。
  • 「リスト作成」ロボット: 他のモデル(Qwen)はチェックリストを好みました。順序に関係なく、満たすべき要件を正確に知っていることに活き活きとしていました。
  • 「コーディング」ロボット: 3 つ目のモデル(Gemini)は、人間向けに書かれていない疑似コードで驚くほどよく機能しました。論理的な「if/then」構造が好きだったようです。

大きな教訓:
研究者たちはまた、1 つのロボットを使うよりも、2 つのロボットに仕事を分割する方がよく機能することも発見しました。

  • プランナー: あるロボットが目標を読み取り、計画(レシピ)を作成します。
  • エグゼキューター: 2 番目のロボットがその計画を読み、実際にボタンをクリックします。
  • なぜ機能するか: これは、レシピを書くシェフと、実際に調理するサブシェフがいるようなものです。シェフは玉ねぎを切ることに気を取られず、調理人はメニューに混乱しません。

5. 結論

この論文は、計画の立て方が重要であると結論付けています。
AI エージェントに成功させたいのであれば、単に一般的なステップのリストを投げつけるだけではなりません。使用する AI モデルの個性に合わせて、計画の形式を一致させる必要があります。時には物語の方がリストより優れ、時にはチェックリストの方が物語より優れています。

これらの異なる形式をテストすることで、研究者たちは、単に彼らとの会話の仕方を変えるだけで、これらのデジタルエージェントをより堅牢で信頼性の高いものに変えることができることを示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →