Large Language Model based Interactive Decision-Making for Autonomous Driving
यह शोध पत्र एक लार्ज लैंग्वेज मॉडल-आधारित ढांचे का प्रस्ताव करता है जो सिमेंटिक सीन मॉडलिंग के लिए ऑब्जेक्ट-प्रोसेस मेथोडोलॉजी, निर्णय लेने के लिए इंटेंट-अवेयर रीजनिंग, और सुरक्षा, दक्षता एवं मानव-समान इंटरैक्शन में सुधार के लिए एक बाहरी ह्यूमन-मशीन इंटरफेस के माध्यम से नेचुरल-लैंग्वेज कम्युनिकेशन का उपयोग करके जटिल मिश्रित-ट्रैफिक परिदृश्यों में स्वायत्त ड्राइविंग को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप न्यूयॉर्क या शंघाई जैसे शहर के एक व्यस्त, अराजक चौराहे से गुजर रहे हैं। आप केवल नियमों का पालन नहीं कर रहे हैं; आप अपने आस-पास के लोगों को लगातार "पढ़" रहे हैं। आप देखते हैं कि एक ड्राइवर ने आपकी ओर देखा और अपनी गति धीमी कर दी, तो आपको एहसास होता है कि वह आपको रास्ता दे रहा है। आप देखते हैं कि दूसरा ड्राइवर आक्रामक रूप से गति बढ़ा रहा है, इसलिए आप रुकने का निर्णय लेते हैं। आप वास्तव में बातचीत के एक निरंतर, अनकहे नृत्य (dance) का हिस्सा हैं।
वर्तमान सेल्फ-ड्राइविंग कारें इस नृत्य में बहुत खराब हैं। वे एक बहुत ही विनम्र, बहुत घबराहट वाले छात्र चालक की तरह हैं: यदि कोई अप्रत्याशित रूप से हिलता है, तो कार जम जाती है या अचानक ब्रेक लगा देती है क्योंकि वह सामाजिक संकेतों (social cues) को "समझ" नहीं पाती है।
यह शोध पत्र एक तरीका पेश करता है जिससे सेल्फ-ड्राइविंग कारों को लार्ज लैंग्वेज मॉडल्स (जैसे ChatGPT के पीछे की तकनीक) का उपयोग करके एक "सोशल ब्रेन" (सामाजिक मस्तिष्क) दिया जा सके। इसे करने का तरीका यहाँ चार सरल चरणों में दिया गया है:
1. "अनुवादक" (गणित को अर्थ में बदलना)
कंप्यूटर दुनिया को संख्याओं के एक विशाल स्प्रेडशीट के रूप में देखते हैं: वाहन A निर्देशांक X पर है, गति Y से चल रहा है। यह प्रोसेस करने के लिए बहुत अधिक "शोर" (noise) है।
शोधकर्ताओं ने OPM नामक एक प्रणाली बनाई है। इसे एक अनुवादक के रूप में समझें जो एक अस्त-व्यस्त स्प्रेडशीट को एक स्पष्ट कहानी में बदल देता है। यह कहने के बजाय कि "ऑब्जेक्ट 42, 10.5, 20.2 पर है," सिस्टम कार को बताएगा: "एक नीला ट्रक (ऑब्जेक्ट) वर्तमान में बाईं ओर मुड़ रहा है (प्रक्रिया), जो आपके साथ टकराव का जोखिम (संबंध) पैदा करता है।" यह कार को केवल बिंदुओं के समूह के बजाय एक तार्किक कहानी के रूप में दृश्य को "देखने" की अनुमति देता है।
2. "मन का पाठक" (इरादे का अनुमान लगाना)
एक बार जब कार कहानी समझ लेती है, तो उसे यह अनुमान लगाने की आवश्यकता होती है कि अन्य ड्राइवरों के मन में क्या चल रहा है। शोधकर्ता LLM का उपयोग एक डिजिटल मनोवैज्ञानिक के रूप में करने के लिए करते हैं।
यह देखने के लिए कि एक मानव चालक कैसे व्यवहार कर रहा है—क्या वे आक्रामक हैं? क्या वे हिचकिचा रहे हैं? क्या वे जल्दी में हैं?—LLM उनके "अनकहे इरादे" को समझता है। यह कुछ ऐसा है जैसे यह महसूस करना कि, "वह ड्राइवर थोड़ा लहरा रहा है; वह शायद जल्दी में है और मुझे काटने की कोशिश कर सकता है।" यह कार को केवल वर्तमान में जो हो रहा है, उसके बजाय इस बात के लिए तैयार करता है कि क्या हो सकता है।
3. "निर्णय लेने वाला" (आंतरिक बहस)
अब कार को तय करना है कि क्या करना है। यह केवल एक विकल्प नहीं चुनती; यह अपने दिमाग में एक छोटी बहस करती है। यह कई विकल्पों पर विचार करती है: क्या मुझे गति बढ़ानी चाहिए? क्या मुझे धीमा होना चाहिए? क्या मुझे अपने मार्ग पर बने रहना चाहिए?
यह इन विकल्पों को तीन चीजों के विरुद्ध तौलती है:
- सुरक्षा: "क्या मैं टकरा जाऊँगा?"
- दक्षता (Efficiency): "क्या मैं यहाँ हमेशा के लिए फंस जाऊँगा?"
- आराम (Comfort): "क्या यह चाल इतनी झटकेदार होगी कि यात्रियों की गर्दन में मोच आ जाए?"
LLM इस बहस में न्यायाधीश की भूमिका निभाता है, और वह चाल चुनता है जो सबसे अधिक "मानवीय" और तार्किक महसूस होती है।
4. "संवाद करने वाला" (वापस बात करना)
यह सबसे अनूठा हिस्सा है। आमतौर पर, कारें शांत रहती हैं, जिससे इंसान घबरा जाते हैं। यदि कोई कार अचानक चलती है, तो आपको पता नहीं चलता कि वह क्यों चल रही है।
शोधकर्ताओं ने एक बाहरी स्क्रीन (eHMI) के माध्यम से कार को एक आवाज दी है। केवल चलने के बजाय, कार सरल टेक्स्ट के माध्यम से अपने आस-पास के लोगों से "बोल" सकती है। यह कह सकती है, "मैं धीमा हो रहा हूँ; कृपया आगे बढ़ें।" यह कार को एक रहस्यमय रोबोट से एक अनुमानित पड़ोसी में बदल देता है। यह चक्र को पूरा करता है: कार आपको समझती है, निर्णय लेती है, और फिर वह जो कर रही है वह आपको बताती है ताकि आप हैरान न हों।
परिणाम: कारों के लिए "ट्यूरिंग टेस्ट"
यह देखने के लिए कि क्या यह काम कर रहा है, उन्होंने कार को एक सिम्युलेटर में रखा और एक ट्यूरिंग टेस्ट (मशीन यह देखने का प्रसिद्ध परीक्षण कि क्या वह इंसान होने का ढोंग कर सकती है) चलाया। उन्होंने वास्तविक मनुष्यों को कार के साथ बातचीत करने के लिए रखा और फिर उनसे पूछा: "क्या वह एक इंसान था या कंप्यूटर?"
इंसान अक्सर भ्रमित थे! वे अंतर नहीं कर सके। इसका मतलब है कि कार केवल सुरक्षित रूप से नहीं चल रही थी; वह स्वाभाविक रूप से चल रही थी।
संक्षेप में: यह शोध पत्र हमें "नियमों का पालन करने वाले रोबोटों" से दूर और "सामाजिक शिष्टाचार समझने वाले डिजिटल ड्राइवरों" की ओर ले जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।