← 最新の論文
💬 NLP

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

本論文は、LLMエージェントが実現可能で制約を遵守した旅程を生成する能力を評価するために、決定論的な評価器と大規模な合成旅行データセットを特徴とする、厳格かつ完全に再現可能なベンチマークであるTREKを紹介し、最先端のモデルであっても多重制約のプランニングや明示されていないユーザーニーズへの充足において著しく苦戦することを明らかにしている。

原著者: Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットに休暇の計画を立てる方法を教えようとしているところだと想像してください。人工知能の世界では、これらのロボットは「LLMエージェント」と呼ばれています。彼らはデジタル旅行代理店のようなもので、あなたの乱雑なテキストメッセージを読み取り、あなたの望みを理解し、そしてインターネットへ繰り出して航空券を予約し、ホテルを見つけ、観光のスケジュールを組むことができます。しかし、ここに落とし穴があります。ロボットが完璧な旅について「語れる」からといって、実際にそれを「構築できる」とは限らないのです。実際の休暇計画は繊細なパズルのようなものです。すべてのフライトが実在しなければならず、ホテルは営業していなければならず、都市間の移動に要する時間が一日の時間内に収まっていなければならず、そして総費用があなたの財布に収まるものでなければなりません。もしロボットが架空の便名を捏造したり、美術館が午後5時に閉まることを忘れたりすれば、計画全体が崩壊してしまいます。長い間、私たちはこれらのロボットを、旅についての物語を書かせることでテストしてきましたが、彼らの計画が現実世界で実際に機能するかどうかを確認するための厳格な方法を持っていませんでした。

ここで、TREK(Travel Reasoning and Evaluation Kit)と呼ばれる新しい研究が登場します。TREKを、旅行計画ロボットのための大規模でハイステークスな「フライトシミュレーター」だと考えてください。ロボットに推測させる代わりに、研究者たちは、375の都市にわたる212,530件のフライト、ホテル、およびアトラクションの記録を持つ、完全に一貫した架空の世界を構築しました。そして、15種類のAIエージェントに800個の旅行チャレンジを与えました。いくつかのチャレンジは可能でしたが、中には(空港のない都市へ飛ぼうとするような)不可能なものもありました。ロボットたちは、計画を構築するために特別なツールセットを使用しなければなりませんでした。そして、コンピュータベースの厳格な審判(寛大な判断を下す人間やAIの「ジャッジ」は存在しません)が、あらゆる詳細をチェックしました。目標は、ロボットが単なる「素敵な物語」ではなく、旅行者の隠れたニーズ(車椅子対応であることやペット可であることなど)を尊重した、完全に実行可能でエラーのない旅程を作成できるかどうかを見ることでした。

結果は、厳しい現実を突きつけるものでした。この特定の2027年の研究において、最も強力なモデルであるGPT-5.6でさえ、可能な旅行のうち完全に完璧で利用可能な計画を作成できたのはわずか**46.2%でした。平均的なロボットはそれよりもはるかに成績が悪く、中央値の成功率はわずか6.6%であり、中には完全に失敗して0.0%**を記録したものもありました。研究によると、ロボットは「退屈な」作業については非常に優れていました。彼らは架空のフライトを捏造すること(ハルシネーション)は滅多になく、旅行が不可能であることを通常は判断できました。しかし、彼らは「人間」を理解することにおいて巨大な壁にぶつかりました。最大のボトルネックは、「暗黙のニーズ」、つまり「私は美食家なのでミシュラン星付きレストランの近くに泊まりたい」や「私は障害のある旅行者なのでスロープのあるホテルが必要だ」といった、言葉にされない要望を満たすことでした。最高のロボットであっても、これらの隠れたニーズを満たせないことが半分以上の確率で発生しました。

研究者たちは、ロボットに「考える」ためのより多くの時間を与えたり、より多くのコンピュータパワーを使わせたりすることが助けになるかどうかについてもテストしました。驚くべきことに、そうではありませんでした。比較できた唯一のモデルのペアにおいて、より多くの時間を「推論」に費やしたモデルは、指示に従うだけだったモデルよりも成績が悪かったのです。さらに、より多くのコンピュータ・トークンにお金をかけることが、より良い計画を保証するわけでもありませんでした。最も弱いロボットの中には最も高価なものもあり、一方で最も優れたものは驚くほど効率的でした。この研究は、AIエージェントはルールに従うことには長けてきているものの、複雑な人間の制約を同時に完璧にバランスさせることはまだできないため、真に信頼できる旅行プランナーになるにはまだ苦戦していると結論付けています。ロボットが旅について「語る」ことと、完璧なものを「予約する」ことの間のギャップは、依然として大きく開いたままなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →