← नवीनतम पेपर
🤖 machine learning

LLM-ODDR: A Large Language Model Framework for Joint Order Dispatching and Driver Repositioning

यह शोध पत्र LLM-ODDR को प्रस्तुत करता है, जो एक नया ढांचा है जो प्लेटफॉर्म राजस्व, ड्राइवर आय निष्पक्षता और गतिशील शहरी वातावरण के अनुकूलनशीलता को संतुलित करते हुए राइड-हेलिंग ऑर्डर डिस्पैचिंग और ड्राइवर रिपोजिशनिंग को संयुक्त रूप से अनुकूलित करने के लिए एक फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल का लाभ उठाता है, जो वास्तविक मैनहट्टन टैक्सी डेटा पर पारंपरिक तरीकों की तुलना में बेहतर प्रदर्शन और व्याख्यात्मकता प्रदर्शित करता है।

मूल लेखक: Tengfei Lyu, Siyuan Feng, Hao Liu, Hai Yang

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tengfei Lyu, Siyuan Feng, Hao Liu, Hai Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक व्यस्त शहर की कल्पना करें जो एक विशाल, अराजक डांस फ्लोर की तरह है। एक तरफ, लोग (यात्री) अपने घर ले जाने के लिए एक साथी की तलाश में हैं। दूसरी ओर, डांसर (ड्राइवर) अपने साथी का इंतज़ार कर रहे हैं। लक्ष्य एक राइड-हेलिंग ऐप के माध्यम से सही मिलान करना है ताकि हर कोई जल्दी घर पहुँच सके, डांसरों की अच्छी कमाई हो सके, और डांस फ्लोर किसी एक जगह पर बहुत अधिक भरा हुआ या बहुत खाली न हो जाए।

वर्षों तक, इस डांस फ्लोर के "प्रबंधकों" ने इन मिलानों को करने के लिए कठोर नियमपुस्तिकाओं (पारंपरिक गणित) या परीक्षण-और-त्रुटि सीखने (रिनफोर्समेंट लर्निंग) का उपयोग किया है। लेकिन ये प्रबंधक अक्सर संघर्ष करते हैं जब संगीत अचानक बदल जाता है, वे हमेशा पूरी तस्वीर नहीं देख पाते, और कभी-कभी वे डांसरों के साथ अनुचित व्यवहार करते हैं।

यह शोध पत्र एक नए प्रकार के प्रबंधक को पेश करता है: LLM-ODDR। इसे एक स्मार्ट, अनुभवी कॉन्सर्ट डायरेक्टर (कंसर्ट निर्देशक) के रूप में समझें जो एक लार्ज लैंग्वेज मॉडल (जैसे कि एक बहुत ही उन्नत AI जो मानव भाषा को पढ़ और समझ सकता है) का उपयोग करके शो का संचालन करता है।

यह नया सिस्टम कैसे काम करता है, यहाँ तीन सरल भागों में दिया गया है:

1. "वैल्यू जज" (ऑर्डर वैल्यू रिफाइनमेंट - मूल्य निर्णायक)

समस्या: एक पारंपरिक प्रबंधक केवल इस बात पर ध्यान दे सकता है कि अभी एक सवारी कितनी पैसे देती है। वह एक लंबी, महंगी सवारी को अनदेखा कर सकता है क्योंकि यात्री लंबे समय से प्रतीक्षा कर रहा है, या वह एक छोटी सवारी को मिस कर सकता है जो बाद में ड्राइवर को एक व्यस्त क्षेत्र में ले जा सकती है।
समाधान: नया AI डायरेक्टर केवल कीमत के टैग को नहीं देखता। यह एक फूड क्रिटिक (भोजन समीक्षक) की तरह काम करता है जो व्यंजन का स्वाद चखता है। यह पूछता है:

  • "इस यात्री ने कितनी देर तक प्रतीक्षा की है?" (तत्परता/Urgency)
  • "इस सवारी से कितना पैसा बनता है?" (लाभ/Profit)
  • "यदि यह ड्राइवर यह सवारी लेता है, तो वह कहाँ पहुँचेगा? क्या वह बाद में और ग्राहकों को खोजने के लिए एक अच्छी जगह है?" (भविष्य की क्षमता/Future potential)

AI एक "सेल्फ-चेक" लूप का उपयोग करता है। यह एक सवारी के मूल्य के बारे में एक पहला अनुमान लगाता है, फिर एक दूसरा "AI जज" उस अनुमान की समीक्षा करता है कि क्या वह तर्कसंगत है। यदि पहला अनुमान बहुत अधिक या बहुत कम था, तो AI खुद को सुधारता है। यह सुनिश्चित करता है कि हर सवारी का मूल्य केवल तत्काल नकदी के आधार पर नहीं, बल्कि पूरी तस्वीर के आधार पर निष्पक्ष रूप से तय किया जाए।

2. "फेयरनेस कोच" (फेयरनेस-अवेयर डिस्पैचिंग - निष्पक्षता कोच)

समस्या: कभी-कभी, एक प्रबंधक कुछ भाग्यशाली ड्राइवरों को सभी बेहतरीन, उच्च-भुगतान वाली सवारियाँ दे देता है, जबकि अन्य खाली बैठे रहते हैं और कुछ भी नहीं कमा पाते। इससे नाखुश ड्राइवर काम छोड़ देते हैं।
समाधान: AI डायरेक्टर एक फेयरनेस कोच (निष्पक्षता कोच) की तरह कार्य करता है। सवारी आवंटित करने से पहले, यह ड्राइवर के "रिपोर्ट कार्ड" को देखता है। यह जाँचता है: "इस ड्राइवर ने आज कितनी कमाई की है? वह कितनी देर से प्रतीक्षा कर रहा है?"
यदि किसी ड्राइवर ने अपने साथियों की तुलना में कम कमाया है, तो AI उसे अगली अच्छी सवारी के लिए प्राथमिकता देता है। यह कंपनी के लिए पैसा बनाने की आवश्यकता और ड्राइवरों को खुश रखने तथा उन्हें उचित वेतन दिलाने की आवश्यकता के बीच संतुलन बनाता है। यह केवल सबसे तेज़ मिलान नहीं चुनता; यह वह मिलान चुनता है जो टीम को एकजुट रखता है।

3. "क्रिस्टल बॉल" (स्पैटियोटेम्पोरल रीपोजिशनिंग - भविष्यदृष्टि)

समस्या: जब एक ड्राइवर सवारी पूरी करता है, तो वह बस वहीं बैठा रह सकता है। इस बीच, एक संगीत कार्यक्रम स्थल (कंसर्ट वेन्यू) से 10 मिनट दूर लोगों की एक बड़ी भीड़ जमा हो सकती है, और वहाँ यात्रियों को उठाने के लिए कोई ड्राइवर नहीं होता।
समाधान: AI डायरेक्टर के पास एक क्रिस्टल बॉल (भविष्य देखने वाला गोला) है। यह वर्तमान में हो रहे मिलानों को देखता है और भविष्यवाणी करता है कि अगले 15 मिनट में खाली ड्राइवर कहाँ समाप्त होंगे। यह इसे एक "इतिहास की पुस्तक" के साथ जोड़ता है कि भीड़ आमतौर पर कहाँ जाती है।
यदि AI देखता है कि एक विशिष्ट पड़ोस में भीड़ होने वाली है (लेकिन वर्तमान में वहां कोई ड्राइवर नहीं है), तो वह खाली ड्राइवरों को बताता है: "यहाँ इंतज़ार मत करो; अभी उस पड़ोस की ओर ड्राइव करो।" वह खाली डांसरों को संगीत शुरू होने से पहले सही जगह पर पहुँचा देता है, ताकि जब भीड़ आए तो वे तैयार रहें।

परिणाम: यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने इस नए "कॉन्सर्ट डायरेक्टर" का परीक्षण मैनहट्टन (न्यूयॉर्क सिटी) में टैक्सी सवारी के वास्तविक डेटा का उपयोग करके किया। उन्होंने इसकी तुलना निम्नलिखित से की:

  • पुराने नियमपुस्तिकाएं: पारंपरिक गणितीय तरीके।
  • लर्निंग बॉट्स: वह AI जो परीक्षण और त्रुटि द्वारा सीखता है।
  • अन्य AI मॉडल: अन्य लार्ज लैंग्वेज मॉडल जिन्हें विशेष रूप से इस काम के लिए प्रशिक्षित नहीं किया गया है।

निष्कर्ष स्पष्ट थे:

  • अधिक पैसा: इस नए सिस्टम ने अन्य किसी भी तरीके की तुलना में प्लेटफॉर्म के लिए अधिक कुल पैसा (GMV) बनाया।
  • अधिक सवारियाँ: इसने सफलतापूर्वक यात्रियों को ड्राइवरों के साथ अधिक कुशलता से मिलाया (ऑर्डर रिस्पांस रेट)।
  • अधिक निष्पक्ष भुगतान: इसने ड्राइवरों को समान राशि कमाने में मदद करने में बेहतर काम किया, जिससे थकान और काम छोड़ने की समस्या को रोका जा सका।
  • उभार (Surges) को संभालना: जब अचानक भीड़ बढ़ी (जैसे किसी कॉन्सर्ट के खत्म होने पर), तो नया AI तुरंत अनुकूलित हो गया, जबकि पुराने तरीके भ्रमित हो गए और लोगों को तेज़ी से मिलाने में विफल रहे।
  • व्याख्यात्मक (Explainable): "ब्लैक बॉक्स" लर्निंग बॉट्स के विपरीत, जो केवल एक उत्तर देते हैं, यह AI समझा सकता है कि उसने कोई निर्णय क्यों लिया (जैसे, "मैंने ड्राइवर A को ज़ोन B में इसलिए भेजा क्योंकि...")।

कमी (The Catch)

एक नुकसान है। यह सुपर-स्मार्ट डायरेक्टर पुराने, सरल कैलकुलेटरों की तुलना में सोचने में थोड़ा अधिक समय लेता है। एक निर्णय चक्र (decision cycle) पूरा करने में इसे लगभग 17 से 30 सेकंड लगते हैं, जबकि पुराने तरीके तात्कालिक होते हैं। लेखक स्वीकार करते हैं कि यह वास्तविक समय के उपयोग के लिए एक बाधा है, लेकिन वे सुझाव देते हैं कि बेहतर तकनीक (जैसे, AI को छोटा और तेज़ बनाना) के साथ, इसे ठीक किया जा सकता है।

संक्षेप में: यह शोध पत्र एक स्मार्ट, भाषा-समझने वाले AI का उपयोग करके राइड-हेलिंग को प्रबंधित करने का प्रस्ताव देता है। यह एक कठोर रोबोटिक मैनेजर से एक मानव-समान निर्देशक में अपग्रेड करने जैसा है जो तात्परता को समझता है, निष्पक्षता की परवाह करता है, और पूरे शहर को सुचारू रूप से चलाने के लिए भविष्य की भविष्यवाणी कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →