AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models
AutoTraces एक नवीन ऑटोरिग्रेसिव विजन-लैंग्वेज-ट्रैजेक्टरी मॉडल है जो मानव-आबाद वातावरण में स्टेट-ऑफ-द-आर्ट, लॉन्ग-होरिजन रोबोट ट्रैजेक्टरी फोरकास्टिंग प्राप्त करने के लिए एक विशेष ट्रैजेक्टरी टोकनाइजेशन स्कीम और ऑटोमेटेड चेन-ऑफ-थॉट रीजनिंग के साथ मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त शॉपिंग मॉल में बिना किसी से टकराए चलना सिखा रहे हैं। रोबोट को यह अनुमान लगाने की आवश्यकता है कि अगले कुछ सेकंड में लोग कहाँ होंगे ताकि वह सुचारू रूप से और सुरक्षित रूप से चल सके। यह ट्रैजेक्टरी फोरकास्टिंग (trajectory forecasting) की चुनौती है।
लंबे समय तक, रोबots ने इसे "प्रयास और त्रुटि" (जैसे एक बच्चा चलना सीखता है) के माध्यम से या कठोर गणितीय नियमों का पालन करके सीखने की कोशिश की। लेकिन ये तरीके जटिल, भीड़भाड़ वाली जगहों पर अक्सर विफल हो जाते हैं क्योंकि वे वास्तव में मानवीय व्यवहार को "समझ" नहीं पाते हैं।
हाल ही में, वैज्ञानिकों ने रोबोट की मदद करने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs)—वही AI दिमाग जो चैटबॉट्स जैसे मेरे पीछे है—का उपयोग करना शुरू कर दिया है। विचार यह है: "यदि AI भाषा और कहानियों को समझ सकता है, तो शायद वह लोगों के चलने की 'कहानी' को भी समझ सकता है।"
हालाँकि, पिछले प्रयासों में एक बड़ी खामी थी। उन्होंने रोबोट को निर्देशांकों (coordinates) को टेक्स्ट के रूप में "पढ़ने" के लिए प्रशिक्षित करने की कोशिश की (जैसे, "7.133, 3.190" को एक-एक शब्द करके लिखना)। यह GPS निर्देशांकों को एक बार में एक संख्या पढ़कर कार चलाने की तरह था। यह धीमा, अक्षम था और रोबोट अक्सर विवरणों में खो जाता था।
पेश है, AutoTraces।
साउथईस्ट यूनिवर्सिटी के शोधकर्ताओं ने AutoTraces नामक एक नया सिस्टम बनाया है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग करते हैं:
1. "स्पेशल टोकन" शॉर्टकट (जादुई स्टैम्प्स)
रोबोट को हर एक निर्देशांक का नंबर लिखने के बजाय (जो कि केवल "बाएं मुड़ें" कहने के लिए एक उपन्यास लिखने जैसा है), AutoTraces एक विशेष स्टैम्प पेश करता है जिसे <point> कहा जाता है।
- पुराना तरीका: रोबोट एक रास्ता देखता है और उसे टेक्स्ट की एक लंबी स्ट्रिंग जनरेट करनी पड़ती है:
7,.,1,3,3,,,3,.,1,9... यह बोझिल है और इसमें गलतियों की संभावना अधिक है। - AutoTraces का तरीका: रोबोट एक विशेष "स्टैम्प" टोकन का उपयोग करता है। जब वह मैप पर एक बिंदु देखता है, तो वह बस
<point>का स्टैम्प लगा देता है। पर्दे के पीछे, एक छोटा और कुशल अनुवादक (encoder) उस स्टैम्प को तुरंत सटीक गणितीय निर्देशांकों में बदल देता है जिनकी रोबोट को आवश्यकता होती है।
उपमा: कल्पना कीजिए कि आप एक पैकेज भेज रहे हैं।
- पुराना तरीका: आप एक बड़े स्क्रॉल पर पता अक्षर-दर-अक्षर लिखते हैं।
- AutoTraces का तरीका: आप बस बॉक्स पर एक पूर्व-मुद्रित "एड्रेस लेबल" चिपका देते हैं। डिलीवरी सिस्टम (LLM) उस लेबल के साथ ठीक जानता है कि क्या करना है, बिना हर अक्षर को पढ़े। यह रोबोट को बहुत तेज़ और अधिक सटीक बनाता है।
2. "सोचकर बोलना" तंत्र (चेन-ऑफ-थॉट)
इंसान केवल बेतरतीब ढंग से नहीं चलते; हमारे पास कारण होते हैं। "मैं बाईं ओर मुड़ रहा हूँ क्योंकि दाईं ओर भीड़ है।" पिछले AI मॉडल बिना कारण बताए केवल अगले कदम का अनुमान लगाते थे।
AutoTr traces चेन-ऑफ-थॉट (CoT) नामक तकनीक का उपयोग करता है। जाने से पहले, रोबोट "सोचकर बोलता है" (आंतरिक रूप से)।
- यह कैसे काम करता है: सिस्टम स्वचालित रूप से वीडियो और पथ का विश्लेषण करता है, खुद से सवाल पूछता है जैसे: "क्या रास्ता साफ है? क्या व्यक्ति मुड़ रहा है? क्या बाधाएं हैं?"
- जादू: इसे इन विचारों को लिखने के लिए किसी इंसान की आवश्यकता नहीं है। दूसरा AI इन "विचारों" को स्वचालित रूप से उत्पन्न करने में मदद करता है, जिससे रोबोट को यह सिखाया जाता है कि एक निश्चित रास्ता क्यों तर्कसंगत है।
उपमा: एक शतरंज के खिलाड़ी के बारे में सोचें।
- पुराना AI: एक पैटर्न देखकर बेतरतीब ढंग से मोहरा चलता है।
- AutoTraces: एक ग्रैंडमास्टर की तरह जो रुकता है और कहता है, "मैं यहाँ चल रहा हूँ क्योंकि यह उनके हमले को रोकता है और मेरी रानी के लिए रास्ता खोलता है।" यह गहरी समझ इसे उन नई और अजीब स्थितियों को संभालने में मदद करती है जिन्हें इसने पहले नहीं देखा है।
3. "कहानीकार" दृष्टिकोण (ऑटोरेग्रेसिव जनरेशन)
अधिकांश रोबोट एक ही बार में पूरा रास्ता अनुमानित करते हैं (जैसे मैप देखना और पूरी रेखा खींच देना)। यदि वे शुरुआत में गलती करते हैं, तो पूरा रास्ता गलत हो जाता है।
AutoTraces पथ को एक-एक कदम करके अनुमानित करता है, जैसे एक कहानी सुनाना।
- यह अगले कदम का अनुमान लगाता है।
- फिर यह उस नए कदम को लेता है, उसे कहानी में जोड़ता है, और नई स्थिति के आधार पर अगले कदम का अनुमान लगाता है।
- यह जितनी भी आवश्यकता हो (लचीली लंबाई), उतनी देर तक चल सकता है, जबकि अन्य मॉडल निश्चित संख्या में कदमों तक सीमित होते हैं।
उपमा:
- पुराना तरीका: फिल्म के पहले फ्रेम को देखकर पूरी पटकथा एक साथ लिखने की कोशिश करना।
- AutoTraces: फिल्म के हर दृश्य को देखते हुए आगे बढ़ना। हर दृश्य के बाद, यह पूछता है, "ठीक है, आगे क्या होता है?" यह इसे अप्रत्याशित मोड़ आने पर भी अनुकूल होने की अनुमति देता है।
यह एक बड़ी बात क्यों है?
शोध पत्र दिखाता है कि AutoTraces पिछले तरीकों की तुलना में अधिक स्मार्ट, तेज़ और लचीला है।
- यह बेहतर तरीके से सामान्यीकरण (generalizes) करता है: यदि आप इसे मॉल में प्रशिक्षित करते हैं, तो यह बिना दोबारा प्रशिक्षित किए पार्क या सबवे स्टेशन को संभाल सकता है।
- यह लंबे रास्तों को संभालता है: यह भविष्यवाणी कर सकता है कि रोबोट 20 सेकंड बाद कहाँ होगा, न कि केवल 5 सेकंड बाद।
- यह कुशल है: यह समान कार्य करने के लिए कम कंप्यूटर संसाधनों का उपयोग करता है।
संक्षेप में: AutoTraces रोबोट को गति के लिए एक "विशेष शब्दावली" और सामाजिक संकेतों को समझने के लिए एक "सोचने की प्रक्रिया" देकर मानव स्थानों में नेविगेट करना सिखाता है, जिससे वे भीड़ के बीच भी उतने ही स्वाभाविक रूप से चल पाते हैं जितना कि एक इंसान।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।