← नवीनतम पेपर
💻 computer science

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents

यह शोधपत्र DeepTravel को प्रस्तुत करता है, जो एक एंड-टू-एंड एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो एक सुदृढ़ यात्रा सैंडबॉक्स, पदानुक्रमित पुरस्कार मॉडलिंग और रिप्लाई-ऑगमेंटेड प्रशिक्षण का उपयोग करता है ताकि स्वायत्त यात्रा नियोजन एजेंटों को सटीक, व्यवहार्य यात्रा कार्यक्रम उत्पन्न करने में फ्रंटियर लार्ज लैंग्वेज मॉडल्स और मौजूदा ढांचों से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

मूल लेखक: Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

प्रकाशित 2026-07-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक आदर्श छुट्टी की योजना बनाने की कोशिश कर रहे हैं। आप एक विशिष्ट शहर की उड़ान भरना चाहते हैं, एक अच्छे होटल में रुकना चाहते हैं, और ग्रेट वॉल जैसी शानदार जगहों पर जाना चाहते हैं, और यह सब एक बजट के भीतर करना चाहते हैं। अतीत में, यात्रा करने की कोशिश करने वाले कंप्यूटर एक घबराए हुए पर्यटक की तरह थे जिसके पास एक मुड़ा हुआ नक्शा था: वे सख्त, पहले से लिखे गए निर्देशों (जिन्हें "प्रॉम्प्ट्स" कहा जाता है) का पालन करते थे और यदि उड़ान की कीमत बदल जाती या होटल भर जाता, तो वे अटक जाते या आपको एक फर्जी यात्रा कार्यक्रम दे देते। वे वास्तव में "सोच" नहीं सकते थे या मौके पर बदलाव नहीं कर सकते थे।

यहाँ आता है DeepTravel, एक नए प्रकार का ट्रैवल एजेंट जो केवल एक स्क्रिप्ट का पालन नहीं करता—बल्का यह गलतियाँ करके, उनसे सीखकर और फिर से प्रयास करके यात्रा करना सीखता है, ठीक वैसे ही जैसे एक इंसान करता है।

पुरानी पद्धति के साथ समस्या

लेखकों का तर्क है कि पुरानी विधियाँ बहुत कठोर हैं। वे "हस्तनिर्मित प्रॉम्प्ट्स" (hand-crafted prompts) पर निर्भर करती हैं, जो एक रोबोट को नियमों की सूची देने जैसा है। यदि रोबोट किसी ऐसी स्थिति का सामना करता है जिसके बारे में उसे स्पष्ट रूप से नहीं बताया गया है—जैसे कि अचानक ट्रेन रद्द होना—तो वह अक्सर विफल हो जाता है। शोध पत्र स्पष्ट रूप से इस विचार को खारिज करता है कि ये निश्चित, पहले से लिखे गए वर्कफ़्लो वास्तव में स्वायत्त यात्रा योजनाकार बनाने का सबसे अच्छा तरीका हैं। वे अनुकूलन करने में बहुत धीमे हैं और चीजें गलत होने पर बहुत नाजुक साबित होते हैं।

समाधान: एक "ट्रैवल सैंडबॉक्स" और एक "स्मार्ट कोच"

कंप्यूटर को वास्तविक दुनिया की उथल-पुथल से भ्रमित हुए बिना यात्रा की योजना बनाना सिखाने के लिए, शोधकर्ताओं ने एक Robust Travel Sandbox बनाया।

इस सैंडबॉक्स को यात्रा की दुनिया के एक विशाल, सुपर-फास्ट वीडियो गेम सिमुलेशन के रूप में समझें। वास्तविक दुनिया में, यदि आप कंप्यूटर को उड़ान की कीमतें जांचने के लिए कहते हैं, तो वेबसाइट धीमी हो सकती है, या कीमतें हर सेकंड बदल सकती हैं। यह सीखने वाले कंप्यूटर के प्रशिक्षण के लिए एक बुरा सपना है। लेकिन इस सैंडबॉक्स में, कंप्यूटर के पास एक "टाइम मशीन" और एक "जादुई कैश" (magic cache) है। यह उड़ान, ट्रेन और होटल के डेटा को एक सहेजे गए पुस्तकालय से देख सकता है जो वास्तविक जीवन की नकल करता है लेकिन कभी क्रैश नहीं होता या अप्रत्याशित रूप से नहीं बदलता। यह एजेंट को बिना किसी वास्तविक दुनिया के ग्लिच के लाखों बार अभ्यास करने की अनुमति देता है।

एक बार जब एजेंट सैंडबॉक्स में होता है, तो उसे एक कोच की आवश्यकता होती है जो उसे बताए कि वह अच्छा काम कर रहा है या नहीं। शोध पत्र एक Hierarchical Reward Modeling प्रणाली पेश करता है, जो एक दो-स्तरीय रेफरी की तरह कार्य करती है:

  1. बड़ी तस्वीर वाला रेफरी (ट्रैजेक्टरी-लेवल): सबसे पहले, यह रेफरी जाँचता है कि क्या पूरी यात्रा समझ में आने योग्य है। क्या एजेंट ने ऐसे शहर की उड़ान भरने की कोशिश की जो अस्तित्व में ही नहीं है? क्या उन्होंने संग्रहालय खुलने से पहले वहां जाने की कोशिश की? यदि बड़ी तस्वीर गलत है, तो एजेंट को तुरंत "जीरो" स्कोर मिलता है।
  2. विवरण वाला रेफरी (टर्न-लेवल): यदि बड़ी तस्वीर ठीक है, तो यह रेफरी ज़ूम इन करता है। क्या एजेंट ने वास्तव में वही होटल बुक किया जिसका उन्होंने उल्लेख किया था? क्या उन्होंने उसी ट्रेन के शेड्यूल का उपयोग किया जिसे उन्होंने अभी देखा था? यह सुनिश्चित करता है कि एजेंट केवल तथ्य मनगढ़ंत (hallucinating) न बना रहा हो।

विफलता से सीखना: "रीप्ले" का तरीका

सबसे रोमांचक हिस्सा यह है कि एजेंट कैसे सीखता है। शोधकर्ताओं ने Replay-Augmented Reinforcement Learning नामक विधि का उपयोग किया।

कल्पना कीजिए कि आप साइकिल चलाना सीख रहे हैं। यदि आप गिरते हैं, तो आप केवल हार नहीं मानते; आप याद रखते हैं कि आपने अपना संतुलन कहाँ खोया था और फिर से प्रयास करते हैं। DeepTravel भी ऐसा ही करता है। जब एजेंट यात्रा की योजना सही ढंग से बनाने में विफल होता है, तो सिस्टम उस "विफलता के अनुभव" को एक विशेष बफर में सहेज लेता है। बाद में, एजेंट को इन विफल प्रयासों को "रीप्ले" करने के लिए मजबूर किया जाता है, यह पता लगाने के लिए कि उन्हें कैसे ठीक किया जाए। यह गलतियों को एक शक्तिशाली सीखने के उपकरण में बदल देता है।

शोध पत्र दिखाता है कि यह विधि यहाँ तक कि छोटे, सस्ते कंप्यूटर दिमागों (जैसे कि 32 बिलियन पैरामीटर्स वाला मॉडल) को उन विशाल, महंगे सुपर-कंप्यूटरों (जैसे कि 671-बिलियन पैरामीटर वाला DeepSeek-R1) से बेहतर यात्रा योजनाकार बना देती है जो पहले सर्वश्रेष्ठ थे।

परिणाम: वास्तविक दुनिया का प्रमाण

टीम ने इसे केवल एक सिमुलेशन में परीक्षण नहीं किया; उन्होंने इसे DiDi Enterprise Solutions ऐप (एक वास्तविक राइड-हेलिंग और ट्रैवल ऐप जिसका उपयोग कंपनियाँ करती हैं) में तैनात किया। उन्होंने वास्तविक उपयोगकर्ताओं पर तीन महीने तक परीक्षण चलाया।

यहाँ उन्हें क्या मिला:

  • सटीकता: DeepTravel एजेंट ने वास्तविक दुनिया में वैध यात्रा कार्यक्रम बनाने में 82% सटीकता दर हासिल की।
  • दिग्गजों को पछाड़ना: ऑफलाइन परीक्षणों में, छोटा DeepTravel मॉडल (32B) OpenAI o1/o3 और DeepSeek-R1 जैसे सीमावर्ती मॉडलों से काफी बेहतर प्रदर्शन करता है। उदाहरण के लिए, कठिन कार्यों पर बिना बाधाओं के, DeepTravel-32B ने 69.34% पास रेट हासिल किया, जबकि विशाल DeepSeek-R1 केवल 45.55% ही प्रबंधित कर सका।
  • मानव बनाम मशीन: जब मनुष्यों ने परिणामों की जाँच की, तो वे कंप्यूटर के स्कोरिंग के साथ लगभग 82% बार सहमत थे। मानवीय त्रुटि के लिए समायोजन करने के बाद, कंप्यूटर की स्कोरिंग वास्तव में मानव "गोल्ड स्टैंडर्ड" के मुकाबले लगभग 89% सटीक थी।

जो वे अभी नहीं कर सकते (सीमाएँ)

शोध पत्र ईमानदार है कि एजेंट अभी भी कहाँ संघर्ष कर रहा है। हालांकि यह यात्रा को व्यवस्थित करने और बुनियादी अनुरोधों को समझने में बहुत अच्छा है, लेकिन इसे जटिल व्यक्तिगत प्राथमिकताओं (76.62% स्कोर के साथ) के साथ कठिनाई होती है, और कभी-कभी अभी भी तथ्यात्मक मतिभ्रम (hallucinations) होता है (तथ्यों को गलत बताने की दर 15.58% है, हालांकि यह प्रशिक्षण से पहले के 50% त्रुटि दर से एक बड़ा सुधार था)।

निष्कर्ष

DeepTravel यह सिद्ध करता है कि एक महान यात्रा योजनाकार बनने के लिए आपको एक विशाल, महंगे दिमाग की आवश्यकता नहीं है। आपको बस एक सुरक्षित सैंडबॉक्स में अभ्यास करने का एक स्मार्ट तरीका, अपने काम की जाँच करने के लिए एक सख्त कोच और अपनी विफलताओं से सीखने की इच्छा चाहिए। इस "एजेंटिक रीइन्फोर्समेंट लर्निंग" दृष्टिकोण का उपयोग करके, लेखकों ने दिखाया है कि छोटे, अधिक कुशल मॉडल वास्तव में वास्तविक दुनिया की यात्राओं की योजना बनाने में सबसे बड़े, सबसे प्रसिद्ध AI मॉडलों से बेहतर प्रदर्शन कर सकते हैं। यह कोई जादुई छड़ी नहीं है जो सब कुछ पूरी तरह से हल कर दे, लेकिन यह यात्रा योजना को वास्तव में स्वायत्त बनाने की दिशा में एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →