From Feasibility to Desirability: Plan, Learn, Adapt (PLA) Framework for Personalized On-Device Itinerary Generation
यह शोध पत्र 'प्लान, लर्न, अडैप्ट' (PLA) फ्रेमवर्क पेश करता है, जो एक तीन-चरणीय ऑन-डिवाइस सिस्टम है जो व्यवहार्य और अत्यधिक वांछनीय व्यक्तिगत यात्रा कार्यक्रम (itineraries) उत्पन्न करने के लिए हल्के प्लानर्स के एक समूह को एक कॉम्पैक्ट रिवॉर्ड मॉडल के साथ जोड़ता है, जो मानव मूल्यांकन में सिंगल प्लानर्स और फ्रंटियर LLMs दोनों से बेहतर प्रदर्शन करते हुए प्रोडक्शन-ग्रेड लेटेंसी और व्यवहार्यता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अंतरिक्ष यान के कप्तान हैं, लेकिन आप सितारों के बीच नहीं, बल्कि एक हलचल भरे शहर में रास्ता खोज रहे हैं ताकि एक आदर्श छुट्टी की योजना बनाई जा सके। यह यात्रा नियोजन (trip planning) की दुनिया है, एक ऐसी पहेली जो दो बहुत अलग वैज्ञानिक दुनियाओं के मिलन बिंदु पर स्थित है। एक तरफ, आपके पास कॉम्बिनेटोरियल ऑप्टिमाइज़ेशन (combinatorial optimization) है, जो एक सख्त गणित के शिक्षक की तरह है जो यह सुनिश्चित करता है कि आप नियमों को न तोड़ें: संग्रहालय शाम 5 बजे बंद हो जाता है, ट्रेन 6 बजे निकलती है, और आप एक ही जगह दो बार नहीं जा सकते। दूसरी ओर, आपके पास प्रेफरेंस लर्निंग (preference learning) है, जो एक भविष्यवक्ता की तरह है जो यह अनुमान लगाने की कोशिश करता है कि आप वास्तव में क्या महसूस करना चाहते हैं—क्या आप एक आरामदायक दिन चाहते हैं या एक रोमांचक साहसिक कार्य? पेचीदा बात यह है कि ये दोनों दुनिया अक्सर आपस में लड़ती हैं। एक गणितीय रूप से पूर्ण कार्यक्रम उबाऊ लग सकता है, और एक स्वप्निल, मजेदार कार्यक्रम वास्तव में लागू करना असंभव हो सकता है। बड़ा सवाल यह है कि: हम एक ऐसा यात्रा गाइड कैसे बनाएं जो पालन करने के लिए कानूनी रूप से संभव भी हो और अनुभव करने में वास्तव में सुखद भी हो, और वह भी आपके फोन पर बिना इंटरनेट के चल सके?
यह शोध पत्र एक चतुर नए सिस्टम को पेश करता है जिसे PLA (Plan, Learn, Adapt) कहा जाता है, जो इसी समस्या को हल करने की कोशिश करता है। लेखकों ने FlyEnjoy नामक एक ट्रैवल ऐप के साथ काम करते हुए महसूस किया कि मौजूदा तरीके दो विशिष्ट तरीकों से विफल हो रहे थे। कुछ पुराने तरीके नियमों का पालन करने में तो माहिर थे लेकिन मानवीय पसंद को समझने में बहुत खराब थे, जिससे वे ऐसे यात्रा कार्यक्रम बनाते थे जो रोबोटिक लगते थे। वहीं दूसरी ओर, सबसे नए और चमकदार AI उपकरण (जैसे कि विशाल लैंग्वेज मॉडल्स जिनके बारे में हर कोई बात कर रहा है) मददगार लगने में तो बहुत अच्छे थे, लेकिन यात्रा के बुनियादी गणित में पूरी तरह विफल रहे; अपने परीक्षणों में, इन AI मॉडल्स ने ऐसे यात्रा कार्यक्रम बनाए जो पूरी तरह से अव्यवset (infeasible) थे (0% सफलता दर), जिसमें एक सांख्यिकीय ऊपरी सीमा (statistical upper bound) ने सुझाव दिया कि वे 4% से भी कम समय के लिए वैध रहे होंगे, जिससे खुलने के घंटे और यात्रा के समय का उल्लंघन हुआ।
इसे ठीक करने के लिए, टीम ने एक तीन-चरणीय "फैक्ट्री" बनाई जो पूरी तरह से आपके फोन पर चलती है:
- प्लान (विचारों की फैक्ट्री): केवल एक तरीके पर निर्भर रहने के बजाय, उन्होंने पांच अलग-अलग "प्लानर्स" की एक टीम बनाई (जैसे कि एक लालची शेफ, एक सावधान मुनीम, और एक रचनात्मक कलाकार)। प्रत्येक एक शून्य से एक वैध यात्रा बनाने की कोशिश करता है। क्योंकि वे अलग तरह से सोचते हैं, वे जाने वाली जगहों की बहुत अलग सूचियाँ तैयार करते हैं, जिससे यह सुनिश्चित होता है कि उनके पास चुनने के लिए विविध "व्यवहार्य" (नियमों का पालन करने वाले) विकल्प मौजूद हों।
- लर्न (स्वाद परीक्षक): टीम ने केवल यह अनुमान नहीं लगाया कि लोग क्या पसंद करते हैं; उन्होंने मनुष्यों से पूरे दिन के यात्रा कार्यक्रमों के जोड़ों की तुलना करने के लिए कहा। उन्होंने ऐसे 2,500 से अधिक तुलनात्मक अध्ययन एकत्र किए। इस डेटा का उपयोग करके, उन्होंने एक छोटे, सुपर-फास्ट "रिवॉर्ड मॉडल" (एक डिजिटल स्वाद-परीक्षक) को प्रशिक्षित किया, जिसने एक महान यात्रा के अदृश्य गुणों को पहचानना सीखा, जैसे कि अच्छी गति और गतिविधियों का एक अच्छा संतुलन, न कि केवल यह गिनना कि कितने संग्रहालयों का दौरा किया गया।
- अडैप्ट (स्थानीय परिष्कृतकर्ता): एक बार जब सबसे अच्छा यात्रा कार्यक्रम चुन लिया जाता है, तो यह चरण इसमें छोटे, सुरक्षित बदलाव करता है। यह एक शेफ की तरह है जो सूप चखता है और उसमें चुटकी भर नमक डालता है, लेकिन एक सख्त नियम के साथ: हर एक बदलाव को रेसिपी को वैध रखना होगा। यदि कोई बदलाव शेड्यूल को बिगाड़ देता है (जैसे कि आपको किसी बंद दुकान पर पहुँचा देना), तो उसे तुरंत हटा दिया जाता है। यह इतना तेज़ होता है कि इसमें औसतन केवल 109.9 मिलीसेकंड लगते हैं, जिसका अर्थ है कि आपको तुरंत एक व्यक्तिगत योजना मिलती है, भले ही आप बिना वाई-फाई के विमान में हों, क्योंकि सिस्टम को ऑफलाइन-फर्स्ट उपयोग के लिए डिज़ाइन किया गया है।
परिणाम प्रभावशाली हैं। जब उन्होंने अपने सिस्टम का परीक्षण सबसे अच्छे एकल प्लानर के विरुद्ध किया, तो "प्लान, लर्न, अडैप्ट" की टीम मानव न्यायाधीशों के विरुद्ध 67.8% बार जीती। इसके विपरीत, जब उन्होंने तीन सबसे उन्नत AI मॉडल्स (GPT-5, Claude Opus 4.5, और Gemini 3 Pro) से उन्हीं सख्त नियमों के तहत यात्रा कार्यक्रम बनाने के लिए कहा, तो उनमें से एक भी (0%) एक भी वैध यात्रा नहीं बना सका। नया सिस्टम अच्छी तरह से सामान्यीकरण (generalize) भी कर सका, जो उन 100 से अधिक विभिन्न अमेरिकी शहरों में सटीक रूप से काम करता था जिन्हें उसने पहले कभी नहीं देखा था।
वास्तविक दुनिया में, जब उन्होंने इस सिस्टम को FlyEnjoy ऐप में तैनात किया, तो परिणाम ठोस थे। उपयोगकर्ताओं ने अपनी यात्रा की योजना बनाना 83% अधिक बार शुरू किया, और 91% अधिक लोगों ने वास्तव में अपने यात्रा कार्यक्रम पूरे किए। सिस्टम ने केवल योजनाएं ही नहीं बनाईं; इसने पूरे अनुभव को अधिक सहज बनाया, यह साबित करते हुए कि आप एक ऐसा यात्रा गाइड बना सकते हैं जो गणितीय रूप से पूर्ण और पूरी तरह से मजेदार दोनों हो, और वह भी आपकी जेब में समाए हुए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।