← नवीनतम पेपर
💻 computer science

TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving

TPS-Drive एक नवीन फ्रेमवर्क पेश करता है जो VLM-आधारित स्वायत्त ड्राइविंग (autonomous driving) के लिए एजेन्ट-सेंट्रिक टोकेनाइज़र (agent-centric tokenizer) के माध्यम से कार्य-निर्देशित प्रतिनिधित्व शुद्धिकरण (task-guided representation purification) का उपयोग करता है ताकि स्थानिक अतिरेक (spatial redundancy) और मतिभ्रम (hallucinations) को समाप्त किया जा सके, जिससे एक विच्छेदित तर्क पाइपलाइन (decoupled reasoning pipeline) सक्षम होती है जो ओपन-लूप और क्लोज्ड-लूप दोनों बेंचमार्क पर अत्याधुनिक सुरक्षा और पूर्वानुमान प्रदर्शन प्राप्त करती है।

मूल लेखक: Jiaxiang Li, Yumao Liu, Ke Ma

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaxiang Li, Yumao Liu, Ke Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट को कार चलाना सिखा रहे हैं। यह रोबोट एक विज़न-लैंग्वेज मॉडल (VLM) है: यह मानचित्र पढ़ने, ट्रैफिक संकेतों को समझने और जो वह देख रहा है उसके बारे में बात करने में माहिर है। हालाँकि, एक बड़ी समस्या है: यह सड़क की सटीक 3D ज्यामिति (geometry) को समझने में बहुत खराब है। यह बिल्कुल वैसा ही है जैसे कोई महान दार्शनिक किसी तूफान का सुंदर कविता में वर्णन तो कर सकता है, लेकिन वह यह नहीं बता सकता कि बारिश की एक बूंद विंडशील्ड पर ठीक कहाँ गिरेगी।

यह शोध पत्र TPS-Drive पेश करता है, जो एक नया सिस्टम है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है—इसे रोबोट को अधिक स्पष्ट और केंद्रित तरीके से "सोचने" के लिए प्रशिक्षित करके।

यह कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है:

समस्या: सड़क का वर्णन करने के दो गलत तरीके

लेखकों का कहना है कि रोबोट को गाड़ी चलाना सिखाने के मौजूदा तरीके दो जाल में फंसते हैं:

  1. "टेक्स्ट ट्रांसलेटर" का जाल (The "Text Translator" Trap): कुछ सिस्टम 3D दुनिया को सरल शब्दों या संख्याओं में बदलने की कोशिश करते हैं (जैसे, "सामने कार है," "x,y,z पर बॉक्स है")।
    • उपमा: कल्पना कीजिए कि आप केवल "गोल," "लंबा," "लाल" जैसे शब्दों की सूची का उपयोग करके एक जटिल मूर्ति का वर्णन करने की कोशिश कर रहे हैं। आप उसका आकार, दूरी और चिकनी वक्रता (curves) खो देते हैं। रोबोट भ्रमित हो जाता है और "हैलुसिनेशन" (ऐसी चीजें देखना जो वहां नहीं हैं या उन्हें गलत जगह पर रखना) करने लगता है।
  2. "ओवरलोडेड कैमरा" का जाल (The "Overloaded Camera" Trap): अन्य सिस्टम रोबोट को पूरे दृश्य का कच्चा (raw), हाई-डेफिनिशन वीडियो या सघन ग्रिड फीड करते हैं।
    • उपमा: कल्पना कीजिए कि आप रोबोट को एक व्यस्त सड़क का 4K वीडियो फीड दे रहे हैं, लेकिन उस वीडियो का 90% हिस्सा स्थिर बैकग्राउंड (जैसे ईंट की दीवार, आकाश, या एक खड़ी कार जो सालों से वहीं है) है। रोबोट का दिमाग इस "शोर" (noise) से भर जाता है। वह इस उबाऊ दीवार को प्रोसेस करने में अपनी सारी ऊर्जा खर्च कर देता है और फुटपाथ से उतरते हुए पैदल यात्री को देखने में चूक जाता है। इसे "रिप्रेजेंटेशन इंटरफेरेंस" (representation interference) कहा जाता है।

समाधान: "टास्क-गाइडेड प्यूरिफिकेशन" फ़िल्टर

TPS-Drive इसे एक विशेष फ़िल्टर पेश करके हल करता है जिसे एजेंट-सेंट्रिक टोकनाइज़र (Agent-Centric Tokenizer) कहा जाता है।

  • रूपक (Metaphor): रोबोट के मस्तिष्क को एक पुस्तकालय (library) के रूप में सोचें। आमतौर पर, पुस्तकालय मौसम, सड़क की सतह का रंग, पेड़ों और कारों जैसी हर चीज़ के बारे में किताबों से भरा होता है। रोबोट महत्वपूर्ण किताबें नहीं ढूंढ पाता।
  • समाधान: TPS-Drive एक "लाइब्रेरियन" (एक फ्रोजन 3D डिटेक्शन हेड) स्थापित करता है जो जानता है कि रोबोट को अभी ठीक क्या जानने की आवश्यकता है। यह लाइब्रेरियन दृश्य को स्कैन करता है और 99% किताबों (स्थिर बैकग्राउंड, आकाश, बनावट) को हटा देता है।
  • परिणाम: रोबोट के पास अब केवल महत्वपूर्ण, चलते-फिरते पात्रों (agents) वाला एक "प्यूरीफाइड स्पेस" (शुद्ध स्थान) बचता है: कारें, पैदल यात्री और साइकिल चालक। अब रोबोट स्पष्ट रूप से "सोच" सकता है क्योंकि वह केवल उसी पर ध्यान केंद्रित कर रहा है जो मायने रखता है।

रोबोट कैसे गाड़ी चलाता है (तीन-चरणीय प्रक्रिया)

एक बार जब रोबोट के पास दुनिया का यह साफ, शुद्ध दृश्य आ जाता है, तो वह तीन-चरणीय तर्क प्रक्रिया (reasoning pipeline) का उपयोग करके गाड़ी चलाता है:

  1. दृश्य समझ (Scene Understanding): रोबोट शुद्ध दृश्य को देखता है और एक संरचित सारांश लिखता है। वह केवल यह नहीं कहता कि "मुझे एक कार दिख रही है"; वह भौतिकी (physics) को समझता है: "10 मीटर आगे एक कार है, जो 5 मील प्रति घंटे की गति से चल रही है, और मुझे ब्रेक लगाने की आवश्यकता है।"
  2. भविष्य का पूर्वानुमान (Future Forecasting): रोबोट भविष्यवाणी करता है कि आगे क्या होगा। वह पूछता है, "यदि मैं चलता रहा, तो 2 सेकंड में वह कार कहाँ होगी?" क्योंकि वह केवल चलते हुए एजेंटों पर ध्यान केंद्रित कर रहा है (शुद्धिकरण फ़िल्टर की मदद से), यह भविष्यवाणी बहुत सटीक होती है।
  3. एक्शन जनरेशन (Action Generation): अंत में, रोबोट तय करता है कि उसे क्या करना है। वह एक "डिफ्यूजन प्लानर" (एक उपकरण जो सुचारू, सुरक्षित पथ बनाता है) का उपयोग करता है ताकि सड़क पर एक रेखा खींची जा सके, जो दिखाती है कि दुर्घटना से बचने के लिए कार को वास्तव में कहाँ जाना चाहिए।

प्रशिक्षण: छात्र से विशेषज्ञ तक

लेखकों ने केवल एक बार रोबोट को प्रशिक्षित नहीं किया; उन्होंने तीन चरणों वाली प्रशिक्षण प्रक्रिया का उपयोग किया:

  1. प्रीट्रेनिंग (Pretraining): "लाइब्रेरियन" (टोकनाइज़र) को शोर को फ़िल्टर करना सिखाना।
  2. सुपरवाइज्ड फाइन-ट्यूनिंग (Supervised Fine-Tuning): रोबोट को फ़िल्टर किए गए दृश्य को पढ़ने और भविष्य की भविष्यवाणी करने के लिए प्रशिक्षित करना, ठीक वैसे ही जैसे एक छात्र परीक्षा के लिए अध्ययन करता है।
  3. रिवॉर्ड-ड्रिवन रिफाइनमेंट (Reward-Driven Refinement): यह सबसे महत्वपूर्ण चरण है। रोबोट एक सिम्युलेटर में गाड़ी चलाने का अभ्यास करता है। यदि वह सुरक्षित रूप से चलता है और नियमों का पालन करता है, तो उसे "रिवॉर्ड" (पुरस्कार) मिलता है। यदि वह दुर्घटनाग्रस्त होता है या लापरवाही से गाड़ी चलाता है, तो उसे दंड मिलता है। रोबोट केवल मानव ड्राइवरों की नकल करने के बजाय सुरक्षा को प्राथमिकता देना सीखता है।

परिणाम: सुरक्षित ड्राइविंग

शोध पत्र का दावा है कि TPS-Drive पिछले तरीकों की तुलना में काफी बेहतर काम करता है:

  • कम दुर्घटनाएं: ओपन-लूप टेस्ट में (जहाँ रोबोट एक पथ की योजना बनाता है लेकिन वास्तव में गाड़ी नहीं चलाता), इसमें अन्य शीर्ष मॉडलों की तुलना में सबसे कम टक्कर दर देखी गई।
  • बेहतर भविष्यवाणियां: यह अन्य कारों और लोगों के भविष्य के बारे में अनुमान लगाने में बहुत बेहतर है।
  • सुरक्षा रिकॉर्ड: क्लोज्ड-लूप टेस्ट में (जहाँ रोबोट वास्तव में एक सिम्युलेटेड वातावरण में गाड़ी चलाता है), इसने नए सुरक्षा रिकॉर्ड स्थापित किए, अपने प्रतिस्पर्धियों की तुलना में दुर्घटनाओं से बचना और ट्रैफिक नियमों (जैसे रेड लाइट पर रुकना) का बेहतर पालन करना।

निचोड़ (The Bottom Line)

TPS-Drive एक स्मार्ट रोबोट को "स्मार्ट चश्मे" देने जैसा है। पूरी दुनिया के धुंधले, शोर वाले दृश्य को देखने के बजाय, ये चश्मे स्वचालित रूप से उबाऊ बैकग्राउंड को धुंधला कर देते हैं और केवल चलती हुई कारों और लोगों को हाइलाइट करते हैं। यह रोबोट को अपना मस्तिष्क उन चीजों पर केंद्रित करने की अनुमति देता है जो वास्तव में मायने रखते हैं, जिससे सुरक्षित और अधिक सटीक ड्राइविंग निर्णय लेना संभव होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →