← 最新の論文
💻 computer science

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents

本論文は、堅牢なトラベル・サンドボックス、階層的報酬モデリング、およびリプライ拡張型トレーニングを活用することで、自律的な旅行計画エージェントが、正確で実現可能な旅程を生成する上で最先端の大型言語モデルや既存のフレームワークを凌駕することを可能にする、エンドツーエンドのエージェンティック強化学習フレームワークであるDeepTravelを導入するものである。

原著者: Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

公開日 2026-07-15
📖 1 分で読めます☕ さくっと読める

原著者: Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

完璧な休暇を計画しようとしている場面を想像してみてください。特定の都市へ飛び、素敵なホテルに滞在し、万里の長城のようなクールなスポットを巡りたい。それも予算内で。かつて、コンピュータがこのような計画を立てようとすると、それはまるで「くしゃくしゃになった地図を持った、神経質な観光客」のようでした。彼らは厳格に書き込まれた指示(「プロンプト」と呼ばれます)に従うだけで、もし航空券の価格が変わったり、ホテルが満室になったりすると、立ち往生したり、架空の旅程を提示したりしてしまいました。彼らは本当の意味で「考え」たり、即座に適応したりすることはできなかったのです。

そこで登場したのが、単にスクリプトに従うのではなく、人間と同じように、間違いを犯し、それを修正し、再び挑戦することで旅行の方法を学ぶ、新しいタイプの旅行代理店であるDeepTravelです。

旧来の手法の問題点

著者らは、従来の手法はあまりにも硬直的であると主張しています。それらは「手作業で作られたプロンプト」に依存していますが、これはロボットにルールのリストを与えるようなものです。もしロボットが、予期せぬ事態(突然の列車のキャンセルなど)に遭遇した場合、明示的に教えられていなければ、しばしば失敗します。論文では、これらの固定された、あらかじめ書かれたワークフローが、真に自律的な旅行プランナーを構築するための最善策であるという考えを明確に否定しています。それらは適応するのが遅すぎ、そして問題が発生した際にあまりにも脆弱なのです。

解決策:「トラベル・サンドボックス」と「スマート・コーチ」

コンピュータに現実世界の混沌に惑わされることなく旅行計画を教えるために、研究者たちは**堅牢なトラベル・サンドボックス(Robust Travel Sandbox)**を構築しました。

このサンドボックスを、旅行の世界をシミュレートした巨大で超高速なビデオゲームだと考えてください。現実世界では、コンピュータに航空券の価格をチェックさせようとしても、ウェブサイトの動作が遅かったり、価格が毎秒変化したりすることがあります。これは学習中のコンピュータにとって悪夢です。しかし、このサンドボックス内では、コンピュータは「タイムマシン」と「魔法のキャッシュ」を持っています。現実を模倣しながらも、決してクラッシュしたり予期せず変化したりすることのない、保存されたライブラリから航空券、列車、ホテルのデータを検索できるのです。これにより、エージェントは現実世界の不具合に阻まれることなく、何百万回もの練習を行うことができます。

エージェントがサンドボックスに入ったら、次はそれがうまくやれているかどうかを伝える「コーチ」が必要です。論文では、二段階の審判として機能する**階層型報酬モデリング(Hierarchical Reward Modeling)**システムを導入しています。

  1. 全体像の審判(軌跡レベル): まず、この審判は旅全体が理にかなっているかをチェックします。エージェントが存在しない都市へ行こうとしていませんか? 美術館が開館する前に美術館を訪れようとしていませんか? もし全体像が間違っていれば、エージェントには即座に「ゼロ」のスコアが与えられます。
  2. 詳細の審判(ターンレベル): 全体像が問題なければ、この審判はズームアップします。エージェントは、さきほど言った通りのホテルを本当に予約しましたか? 今しがた調べた正しい列車の時刻表を使用していますか? これにより、エージェントが事実を捏造(ハルシネーション)しないようにします。

失敗から学ぶ:「リプレイ」のトリック

最もエキサイティングな部分は、エージェントがどのように学ぶかという点です。研究者たちは、**リプレイ拡張強化学習(Replay-Augmented Reinforcement Learning)**と呼ばれる手法を用いました。

自転車に乗る練習をしているところを想像してください。もし転んだとしても、ただ諦めるのではなく、どこでバランスを崩したのかを記憶し、再び挑戦します。DeepTravelも同じです。エージェントが旅行計画に失敗したとき、システムはその「失敗体験」を特別なバッファに保存します。その後、エージェントはこれらの失敗した試行を「リプレイ(再生)」することを強制され、どうすれば修正できるかを突き止めようとします。これにより、間違いが強力な学習ツールへと変わるのです。

この手法を用いることで、たとえ小さくて安価なコンピュータの脳(320億パラメータのモデルなど)であっても、以前は最高峰であった巨大で高価なスーパーコンピュータ(6710億パラメータのDeepSeek-R1など)よりも優れた旅行プランナーになれることを、論文は示しています。

結果:現実世界での証明

チームはこれをシミュレーション内だけでテストしたわけではありません。彼らはDiDi Enterprise Solutionsアプリ(企業向けの配車・旅行アプリ)に展開しました。実ユーザーを対象に3ヶ月間のテストを実施しました。

結果は以下の通りです。

  • 正確性: DeepTravelエージェントは、現実世界において有効な旅行日程を生成する**82%**の正確性を達成しました。
  • 巨人を打ち負かす: オフラインテストにおいて、この小さなDeepTravelモデル(32B)は、OpenAI o1/o3DeepSeek-R1といった最先端のモデルを大幅に上回りました。例えば、制約のない困難なタスクにおいて、DeepTravel-32Bは**69.34%の合格率に達しましたが、巨大なDeepSeek-R1は45.55%**しか達成できませんでした。
  • 人間 vs 機械: 人間が結果を検証したところ、コンピュータのスコアリングと人間の判断は**82%の割合で一致しました。人間によるエラーを調整した後、コンピュータのスコアリングは人間の「ゴールドスタンダード(正解基準)」に対して約89%**の精度がありました。

まだできないこと(注意点)

論文は、エージェントがいまだに苦戦している部分についても正直に述べています。旅の構造化や基本的なリクエストの理解には優れていますが、複雑な個人的嗜好(スコアは76.62%)については依然として課題があり、時折事実に関するハルシネーション(事実を誤る割合は15.58%)も発生します。ただし、これは学習前のベースモデルのエラー率(50%)からは大幅な改善です。

結論

DeepTravelは、優れた旅行プランナーになるために、必ずしも巨大で高価な脳は必要ないことを証明しています。必要なのは、安全なサンドボックスの中で練習するための賢い方法、間違いをチェックするための厳格なコーチ、そして失敗から学ぶ意欲です。この「エージェンティック強化学習(agentic reinforcement learning)」のアプローチを用いることで、著者らは、より小さく効率的なモデルが、現実世界の旅行計画において、最も有名で巨大なAIモデルを実際に凌駕できることを示しました。これはすべてを完璧に解決する魔法の杖ではありませんが、旅行計画を真に自律的なものにするための大きな飛躍です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →