← नवीनतम पेपर
💻 computer science

FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving

FLARE एक नवीन फ्रेमवर्क है जो एक स्व-पर्यवेक्षित भविष्य फीचर भविष्यवाणी उद्देश्य (self-supervised future feature prediction objective) और ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) के माध्यम से प्री-ट्रेंड विजन-लैंग्वेज मॉडल्स का लाभ उठाकर स्वायत्त ड्राइविंग को सक्षम बनाता है, जो बिना श्रम-गहन भाषा एनोटेशन की आवश्यकता के NAVSIM बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं। आपके पास इसे करने के दो मुख्य तरीके हैं:

  1. "बातूनी शिक्षक" विधि (The "Talkative Teacher" Method): आप रोबोट को एक वीडियो दिखाते हैं और उससे देखते हुए वर्णन करने को कहते हैं ("कार लाल है," "लाइट हरी है"), फिर उससे पूछते हैं कि उसे मुड़ना क्यों चाहिए। अंत में, आप उसे वाक्यों में ड्राइविंग निर्देश लिखने के लिए कहते हैं।

    • समस्या: यह ऐसा है जैसे किसी विदेशी भाषा में लिखी गई नियमावली (manual) पढ़कर कार चलाने की कोशिश करना। रोबोध "शब्दों" को "स्टीयरिंग व्हील की गतिविधियों" में अनुवाद करने में बहुत अधिक समय बिताता है। यह धीमा, अक्षम है, और अक्सर सड़क के सूक्ष्म, अनकहे अहसासों (जैसे कि एक व्यस्त चौराहे का "वाइब") को मिस कर देता है।
  2. "FLARE" विधि (यह शोध पत्र): रोबोट को बोलने के लिए मजबूर करने के बजाय, आप उसे कल्पना करने के लिए कहते हैं।

मूल विचार: "मानसिक सिमुलेशन" (The Core Idea: "Mental Simulation")

लेखकों ने FLARE नामक एक सिस्टम बनाया है। रोबोट को भविष्य के टेक्स्ट विवरण जेनरेट करने के लिए मजबूर करने के बजाय, उन्होंने इसे एक विशेष, उच्च-स्तरीय "मानसिक मानचित्र" में अगला दृश्य कैसा दिखेगा, इसका पूर्वानुमान लगाने के लिए प्रशिक्षित किया।

इसे इस तरह सोचें:

  • पुराना तरीका: रोबोट सड़क को देखता है, सोचता है, "मुझे स्टॉप साइन दिख रहा है, इसलिए मुझे रुकना चाहिए," और फिर उसे लिख देता है।
  • FLARE का तरीका: रोबोट सड़क को देखता है और तुरंत अगले कुछ सेकंडों का दृश्य (visualize) बना लेता है। वह यह नहीं कहता कि "मैं रुकूँगा"; वह बस यह जानता है कि यदि वह रुकता है या चलता रहता है, तो नज़ारा कैसा दिखेगा। वह शब्दों के बजाय अपनी आंतरिक दृष्टि का उपयोग करके "आगे क्या होगा?" के खेल के माध्यम से सीखता है।

यह कैसे काम करता है (तीन जादुई तरकीबें)

1. "फ्यूचर गेज़" (स्व-पर्यवेक्षित शिक्षण - Self-Supervised Learning)
आमतौर पर, रोबोट को सिखाने के लिए इंसानों को "बाएं मुड़ें" या "पैदल यात्री से बचें" जैसे हजारों लेबल लिखने पड़ते हैं। यह महंगा और धीमा है।
FLARE इन मानवीय लेबल को छोड़ देता है। यह कार के वीडियो को देखता है और पूछता है: "यदि कार वही कर रही है जो वह अभी कर रही है, तो 2 सेकंड बाद सड़क कैसी दिखेगी?"
यह एक विस्तृत "मानसिक स्नैपशॉट" (एक फीचर मैप जिसे DINOv2 कहा जाता है) को पुनर्गठित करने की कोशिश करता है। वास्तविक वीडियो के विरुद्ध अपने उत्तर की जांच करके, यह लगातार भविष्य का अनुमान लगाकर, रोबोट बिना किसी के एक भी शब्द बताए ड्राइविंग के भौतिकी (physics) और यातायात के प्रवाह को सीख जाता है। यह भौतिकी की किताब पढ़ने के बजाय गिरकर संभलने के माध्यम से साइकिल चलाना सीखने जैसा है।

2. "स्मार्ट ट्रांसलेटर" (फ्यूजन मॉड्यूल - Fusion Module)
रोबोट के पास दो दिमाग हैं: एक जो दुनिया को देखता है (कैमरा) और दूसरा जो जानता है कि कार कैसा महसूस कर रही है (गति, त्वरण, स्टीयरिंग)।
FLARE इन दोनों दिमागों को मिलाने के लिए एक विशेष "ट्रांसलेटर" का उपयोग करता है। यह केवल सारा डेटा एक साथ नहीं डालता; यह पूछता है, "चूंकि हम 30 mph की गति से बाएं मुड़ रहे हैं, तो इस समय सड़क के चित्र का कौन सा हिस्सा महत्वपूर्ण है?" यह सुनिश्चित करता है कि रोबोट के निर्णय इस बात पर आधारित हों कि वह क्या देख रहा है और कार वास्तव में कैसे चल रही है।

3. "सेफ्टी कोच" (GRPO)
एक बार जब रोबोट बुनियादी बातें सीख जाता है, तो लेखकों ने ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) नामक एक तकनीक का उपयोग किया।
कल्पना कीजिए कि रोबोट अभ्यास कर रहा है। केवल नकल करने (Imitation Learning) के बजाय, रोबोट एक ही स्थिति के लिए छह अलग-अलग संभावित रास्ते बनाता है।

  • पथ A: ट्रक के बहुत करीब से गुजरता है।
  • पथ B: बहुत अचानक रुक जाता है।
  • पथ C: सुचारू, सुरक्षित और लेन का पालन करता है।
    "कोच" (GRPO) इन छह में से सबसे अच्छा (पथ C) चुनता है, और रोबोट को बताता है, "ऐसा अधिक करो, दूसरों को कम करो।" यह रोबोट को केवल मानव के कार्यों की नकल करने के बजाय सुरक्षा और सहजता को प्राथमिकता देने के लिए सिखाता है।

परिणाम

टीम ने इसे NAVSIM नामक एक प्रसिद्ध ड्राइविंग बेंचमार्क पर टेस्ट किया।

  • स्कोर: FLARE ने उन सभी सिस्टम्स में सर्वश्रेष्ठ परिणाम प्राप्त किए जो विज़न-लैंग्वेज मॉडल (VLMs) का उपयोग करते हैं।
  • दक्षता: इसने यह सब केवल एक कैमरे (एक मानक कार की तरह) का उपयोग करके किया, जबकि अन्य कई शीर्ष सिस्टम महंगे 3D सेंसर (LiDAR) या कई कैमरों का उपयोग करते हैं।
  • आश्चर्य: इसने अपने से दोगुने बड़े (8 बिलियन पैरामीटर्स बनाम 4 बिलियन) और भारी मात्रा में मानव-लिखित टेक्स्ट लेबल पर निर्भर सिस्टम्स को भी पीछे छोड़ दिया।

यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि हमें रोबोट को दुनिया को समझने के लिए "बोलने" के लिए मजबूर करने की आवश्यकता नहीं है। उन्हें सीधे भविष्य को देखने (visualize) के लिए प्रशिक्षित करके, हम बड़े AI मॉडल्स के भीतर मौजूद विशाल ज्ञान का लाभ उठा सकते हैं, बिना मानवीय लेबलिंग की भारी लागत के। यह "रोबोट को डायरी लिखने के लिए सिखाने" से बदलकर "रोबोट को सड़क के सपने देखने के लिए सिखाने" की ओर एक बदलाव है।

संक्षेप में: FLARE एक सेल्फ-ड्राइविंग कार को उसके मन में "आगे क्या होगा?" का खेल खेलकर सिखाता है, अपने उत्तरों को एक सेफ्टी कोच के साथ परिष्कृत करता है, और पूरी तरह से टेक्स्ट विवरण लिखने वाले उबाऊ हिस्से को छोड़ देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →