← नवीनतम पेपर
🔬 physics

Large Language Models as Delivery Rider: Generating Instant Food Delivery Riders' Routing Decision with LLM Agent Framework

यह शोध पत्र LLM-DR प्रस्तुत करता है, जो एक नवीन एजेंट फ्रेमवर्क है जो वास्तविक दुनिया के गतिशील, इंस्टेंट डिलीवरी परिदृश्यों में डिलीवरी राइडर्स के विषम, रणनीतिक रूटिंग निर्णयों को सिम्युलेट करने के लिए लार्ज लैंग्वेज मॉडल्स के भीतर अनुभवजन्य रूप से आधारित राइडर पर्सोना और चेन-ऑफ-थॉट रीजनिंग का लाभ उठाता है।

मूल लेखक: Chengbo Zhang, Zuopeng Xiao

प्रकाशित 2026-03-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengbo Zhang, Zuopeng Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हलचल भरे शहर के मेयर हैं, और आप यह समझना चाहते हैं कि हजारों फूड डिलीवरी राइडर्स अपने दैनिक निर्णय कैसे लेते हैं। क्या वे हर ऑर्डर के लिए भागदौड़ करते हैं? क्या वे बड़े बंडलों (एक साथ कई ऑर्डर्स) का इंतज़ार करते हैं? क्या वे पूरे दिन काम करते हैं या केवल लंच के समय?

आमतौर पर, इसका अध्ययन करने के लिए, आपको असली राइडर्स की जासूसी करनी होगी, जो कठिन है क्योंकि उनका डेटा निजी और अव्यवस्थित होता है। इसके बजाय, इस शोध पत्र के लेखकों ने आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करके एक डिजिटल "सिम्युलेटर" बनाया है, जो नकली राइडर्स से भरा एक आभासी शहर बनाता है जो बिल्कुल असली राइडर्स की तरह व्यवहार करते हैं।

यहाँ उनके प्रोजेक्ट, LLM-DR, का विवरण सरल शब्दों में दिया गया है:

1. समस्या: हम केवल गणित का उपयोग क्यों नहीं कर सकते?

पारंपरिक कंप्यूटर मॉडल सभी राइडर्स को समान रोबोट की तरह मानते हैं। वे मान लेते हैं कि प्रत्येक राइडर एक ही सरल नियम का पालन करता है: "सबसे करीबी ऑर्डर लो।"

लेकिन असली इंसान रोबोट नहीं होते।

  • राइडर A एक "वर्कहॉर्स" (Workhorse) हो सकता है जो किराया चुकाने के लिए लगातार 12 घंटे काम करना चाहता है।
  • राइडर B एक "स्टूडेंट" (Student) हो सकता है जो केवल लंच रश के दौरान जल्दी पैसा कमाने के लिए काम करता है।
  • राइडर C एक "स्ट्रैटेजिस्ट" (Strategist) हो सकता है जो छोटे ऑर्डर्स को अनदेखा करता है और एक बड़े बंडल (जैसे 5 ऑर्डर्स जो एक ही इलाके के हों) का इंतज़ार करता है, ताकि वह प्रति ट्रिप अपना मुनाफा अधिकतम कर सके।

यदि आपका सिम्युलेशन उन सभी के साथ एक जैसा व्यवहार करता है, तो आपके परिणाम गलत होंगे। आपको मानवीय व्यक्तित्व (Human Personality) को सिम्युलेट करने के तरीके की आवश्यकता है।

2. समाधान: "डिजिटल एक्टर" विधि

लेखकों ने LLM-DR नामक एक प्रणाली बनाई है। इसे एक नाटक कास्ट करने जैसा समझें। उन्होंने केवल कोड नहीं लिखा; उन्होंने चार अलग-अलग प्रकार के अभिनेताओं (राइडर्स) के लिए स्क्रिप्ट लिखी और उन्हें एक सुपर-स्मार्ट AI दिमाग (एक लार्ज लैंग्वेज मॉडल) दिया ताकि वे अपनी लाइनों और कार्यों में सुधार (improvise) कर सकें।

चरण 1: "पात्रों" को खोजना (Personas)

सबसे पहले, शोधकर्ताओं ने हजारों वास्तविक राइडर्स के वास्तविक डेटा को देखा। उन्होंने राइडर्स को चार विशिष्ट व्यक्तित्व प्रकारों में समूहबद्ध करने के लिए "क्लस्टरिंग" नामक एक कंप्यूटर तकनीक का उपयोग किया:

  1. फुल-टाइम वर्कहॉर्स (The Full-time Workhorse): एक स्थिर व्यक्ति। पूरे दिन काम करता है, जो भी आता है उसे लेता है, और चलता रहता है।
  2. लंच-पीक स्पेशलिस्ट (The Lunch-Peak Specialist): एक पार्ट-टाइमर। केवल सुबह 11 बजे से दोपहर 2 बजे के बीच आता है, छोटे ट्रिप्स लेता है, और चला जाता है।
  3. सुपर स्टैकर (The Super Stacker): एक जुआरी या रणनीतिकार। छोटे ऑर्डर्स को अनदेखा करता है। एक "वेव" (लहर) का इंतज़ार करता है जहाँ एक ही इलाके के कई ऑर्डर्स हों, ताकि वह एक ही यात्रा में 4 भोजन डिलीवर कर सके और मुनाफा बढ़ा सके।
  4. डिनर-पीक कोर (The Dinner-Peak Core): शाम का रश संभालने वाला। डिनर की भीड़ पर ध्यान केंद्रित करता है, आमतौर पर साधारण, एकल ऑर्डर लेता है।

चरण 2: उन्हें दिमाग देना (The AI Agent)

एक बार जब उन्होंने इन चार पात्रों को परिभाषित कर दिया, तो उन्होंने प्रत्येक को एक लार्ज लैंग्वेज मॉडल (जैसे कि वह AI जिससे आप अभी बात कर रहे हैं) द्वारा संचालित "दिमाग" दिया।

  • प्रॉम्प्ट (The Prompt): AI को बताया जाता है, "तुम एक सुपर स्टैकर हो। तुम्हें छोटे ऑर्डर्स पसंद नहीं हैं। तुम्हें बड़े बंडल पसंद हैं। यहाँ अभी 4 ऑर्डर्स उपलब्ध हैं। तुम क्या करोगे?"
  • तर्क (Reasoning - Chain-of-Thought): AI केवल अनुमान नहीं लगाता। वह बैकग्राउंड में सोचता है:
    • "हम्म, ऑर्डर 1 छोटा है। ऑर्डर 2 छोटा है। लेकिन ऑर्डर 2 और 4 एक ही जगह जा रहे हैं! अगर मैं इंतज़ार करता हूँ, तो मैं दोनों को ले सकता हूँ और दोगुना पैसा कमा सकता हूँ। मैं अभी के लिए छोटे ऑर्डर्स को अस्वीकार कर दूँगा।"
  • निर्णय (The Decision): AI अपने "व्यक्तित्व" के आधार पर एक चुनाव करता है।

3. सिम्युलेशन: एक आभासी शहर

उन्होंने एक आभासी शहर (बीजिंग पर आधारित) बनाया और इन चार AI राइडर्स को इसमें डाल दिया।

  • खेल (The Game): हर 10 मिनट में, सिस्टम नए फूड ऑर्डर्स "ब्रॉडकास्ट" करता है।
  • क्रिया (The Action): राइडर्स ऑर्डर्स देखते हैं। "वर्कहॉर्स" सब कुछ उठा लेता है। "स्पेशलिस्ट" लंच के समय के बाहर कुछ भी नहीं लेता। "स्टैकर" एक परफेक्ट बंडल के लिए इंतज़ार करता है।
  • परिणाम (The Result): AI राइडर्स शहर में घूमते हैं, खाना उठाते हैं और डिलीवर करते हैं, ठीक वैसे ही जैसे असली इंसान करते हैं।

4. उन्होंने क्या सीखा?

जब उन्होंने सिम्युलेशन चलाया, तो परिणाम बहुत दिलचस्प थे क्योंकि राइडर्स अपने व्यक्तित्व के आधार पर अलग-अलग व्यवहार कर रहे थे:

  • वर्कहॉर्स ने सबसे अधिक दूरी तय की और लगातार पैसा कमाया, जिससे उसने पूरे शहर को कवर किया।
  • लंच स्पेशलिस्ट ने बहुत कुशलता से काम किया लेकिन केवल कुछ घंटों के लिए, और एक व्यस्त जिले में ही रहा।
  • सुपर स्टैकर ने कम दूरी तय की लेकिन कई ऑर्डर्स वाले लंबे और जटिल ट्रिप्स लेकर अच्छा पैसा कमाया।
  • डिनर कोर ने शाम के रश पर प्रभुत्व जमाया।

बड़ी सीख:
यदि आप एक शहर योजनाकार या डिलीवरी ऐप के बॉस हैं, तो आप केवल "औसत" राइडर्स को देखकर काम नहीं चला सकते। आपको यह समझने की आवश्यकता है कि आपका वर्कफोर्स विभिन्न "व्यक्तित्वों" का मिश्रण है।

  • यदि आप भुगतान संरचना (pay structure) बदलते हैं, तो "स्टैकर" काम छोड़ सकता है, लेकिन "वर्कहॉर्स" बना रहेगा।
  • यदि बारिश होती है, तो "जोखिम से बचने वाला" (Risk-Averse) राइडर काम करना बंद कर सकता है, जबकि "वर्कहॉर्स" काम जारी रखेगा।

"जादुई" रूपक (The Magic Metaphor)

कल्पना कीजिए कि आप एक शहर में ट्रैफिक की भविष्यवाणी करने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप मान लेते हैं कि प्रत्येक ड्राइवर एक रोबोट है जो हमेशा सबसे छोटा रास्ता लेता है। आपका ट्रैफिक प्रेडिक्शन ठीक है, लेकिन यह वास्तविक जीवन की अराजकता (chaos) को मिस कर देता है।
  • इस पेपर का तरीका: आप चार अलग-अलग अभिनेताओं को ड्राइवर बनने के लिए काम पर रखते हैं। एक लापरवाह किशोर है, एक सतर्क दादी है, एक जल्दी में रहने वाला टैक्सी ड्राइवर है, और एक पर्यटक है। आप उन्हें एक आभासी शहर में गाड़ी चलाने देते हैं। अचानक, आपका सिम्युलेशन उस वास्तविक अराजकता, बाधाओं और अजीब मोड़ों को पकड़ लेता है जो इसलिए होते हैं क्योंकि इंसान अप्रत्याशित होते हैं।

यह क्यों मायने रखता है?

यह एक बड़ी सफलता है क्योंकि यह AI को केवल "चैटिंग" से आगे बढ़ाकर वास्तविक समय के बाजारों में जटिल मानवीय व्यवहार को सिम्युलेट करने की ओर ले जाता है। यह हमें बेहतर डिलीवरी ऐप्स डिजाइन करने, बेहतर शहर यातायात योजना बनाने और दुनिया भर के लाखों गिग वर्कर्स के लिए निष्पक्ष नीतियां बनाने में मदद करता है।

संक्षेप में: उन्होंने AI को एक डिलीवरी राइडर की तरह "अभिनय" करना सिखाया, और इन डिजिटल अभिनेताओं को देखकर, हमने असली राइडर्स को समझने का तरीका सीखा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →