← नवीनतम पेपर
💻 computer science

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

यह शोध पत्र कॉन्ट्रास्टिव कॉन्सेप्टर एक्टिवेशन स्टीयरिंग (COAST) का प्रस्ताव करता है, जो एक हल्का, बिना प्रशिक्षण वाला तरीका है जो कुछ ही उदाहरणों (few-shot examples) से प्राप्त सफलता-महत्वपूर्ण उप-स्थानों (success-critical subspaces) में विजन-लैंग्वेज-एक्शन (VLA) मॉडल के लेटेंट्स को पहचानने और निर्देशित करने के लिए कॉन्सेप्टर्स का उपयोग करता है, जिससे बिना पुन: प्रशिक्षण के विविध आर्किटेक्चरों में कार्य सफलता दर में उल्लेखनीय सुधार होता है।

मूल लेखक: Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "COAST: Contrastive Conceptor Activation Steering" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "तेज़ दिमाग" बनाम "भोंडे हाथ"

कल्पना कीजिए कि आपके पास एक रोबोट है जिसने पूरा इंटरनेट पढ़ लिया है। वह जानता है कि "कप" कैसा दिखता है, वह समझता है कि "दराज खोलने" की अवधारणा क्या है, और वह चीजों के हिलने-डुलने के भौतिक विज्ञान (physics) को भी समझा सकता है। यह एक विज़न-लैंग्वेज-एक्शन (VLA) मॉडल है। इसके पास एक शानदार "दिमाग" (प्री-ट्रेन्ड हिस्सा) है जो दुनिया को पूरी तरह समझता है।

हालाँकि, जब आप इस रोबोट को वास्तव में कोई काम करने के लिए कहते हैं, तो यह अक्सर विफल हो जाता है। यह कप को गिरा सकता है, दराज के हैंडल को मिस कर सकता है, या गलत दिशा में धक्का दे सकता है। यह पेपर सुझाव देता है कि रोबोट का "दिमाग" सही उत्तर जानता है, लेकिन उसके "हाथ" (वह हिस्सा जो विचारों को मोटर कमांड में बदलता है) संदेश को गलत समझ रहे हैं। यह एक ऐसे जीनियस शेफ की तरह है जो जानता है कि केक कैसे बनाना है, लेकिन अपने हाथों के कांपने के कारण अंडे गिरा देता है।

समाधान: COAST (एक "मानसिक धकेल")

लेखकों ने COAST (कॉन्ट्रास्टिव कॉन्सेप्टर एक्टिवेशन स्टीयरिंग) नामक एक विधि प्रस्तावित की है। रोबोट को फिर से प्रशिक्षित (retraining) करने के बजाय (जो धीमा, महंगा और जोखिम भरा है), COAST रोबोट को उसके सोचने के दौरान, हिलने-डुलने से ठीक पहले, एक छोटा सा, तात्कालिक "धकेल" (nudge) देता है।

रोबोट की विचार प्रक्रिया को जटिल चैनलों के एक नेटवर्क से बहती हुई नदी के रूप में सोचें। कभी-कभी पानी "सफलता" (Success) वाले चैनल की ओर बहता है, और कभी-कभी यह "विफलता" (Failure) के दलदल में चला जाता है। COAST एक स्मार्ट बांध या समायोज्य गेट्स (adjustable gates) की तरह कार्य करता है जो नदी को रोकने या परिदृश्य को बदलने के बजाय, पानी को धीरे से वापस सफलता वाले चैनल की ओर धकेलता है।

यह कैसे काम करता है: "सफलता बनाम विफलता" का फिल्टर

इन स्मार्ट गेट्स को बनाने के लिए, रोबोट को कुछ उदाहरण देखने की आवश्यकता है कि उसने क्या सही किया और क्या गलत किया।

  1. "कॉन्सेप्टर" (द फिल्टर): एक छलनी की कल्पना करें। यदि आप रेत (रोबोट के विचार) को एक छलनी से गुजारते हैं, तो बड़े पत्थर (महत्वपूर्ण, अद्वितीय विवरण) रुक जाते हैं, और बारीक धूल (बोरिंग, सामान्य शोर) नीचे गिर जाती है। एक "कॉन्सेप्टर" एक गणितीय छलनी है जो उबाऊ चीजों को छान देती है और किसी कार्य के लिए महत्वपूर्ण विशिष्ट विवरणों को रखती है।
  2. "कॉन्ट्रास्टिव" भाग (अंतर): लेखकों ने महसूस किया कि रोबोट के "विफलता" वाले विचार और "सफलता" वाले विचार कई मायनों में बहुत समान दिखते हैं (दोनों में ही हाथ हिलाना शामिल है)। लेकिन वे कुछ विशिष्ट, महत्वपूर्ण दिशाओं में भिन्न होते हैं।
    • COAST "सफलता" के लिए एक फिल्टर और "विफलता" के लिए एक फिल्टर बनाता है।
    • इसके बाद यह "सफलता" के फिल्टर में से "विफलता" के फिल्टर को घटा देता है।
    • परिणाम एक सुपर-फिल्टर होता है जो केवल उन विचारों को गुजरने देता है जो अद्वितीय रूप से सफल हैं और उन विचारों को रोकता है जो विफलता की ओर ले जाते हैं।

जादुई ट्रिक: प्रवाह को मोड़ना (Steering the Flow)

जब रोबोट कार्य करने वाला होता है, तो COAST उसके वर्तमान विचारों को इस सुपर-फिल्टर से गुजारता है।

  • यदि रोबोट एक ऐसी चाल के बारे में सोच रहा है जो विफलता जैसी दिखती है, तो फिल्टर उस विचार को धीमा (dampen) कर देता है।
  • यदि रोबोट एक ऐसी चाल के बारे में सोच रहा है जो सफलता जैसी दिखती है, तो फिल्टर उसे बढ़ा (amplify) देता है।

यह एक पल के भीतर होता है, बिना रोबोट के दिमाग या उसके प्रशिक्षण को बदले। यह एक चश्मे को पहनने जैसा है जो तुरंत आपकी दृष्टि को ठीक कर देता है ताकि आप उसी पत्थर से दोबारा न टकराएं।

उन्होंने क्या पाया (परिणाम)

पेपर का परीक्षण तीन अलग-अलग प्रकार के रोबोट "दिमाग" और तीन अलग-अलग वातावरणों (सिम्युलेटेड किचन, टेबल और वास्तविक दुनिया के रोबोट) पर किया गया।

  • भारी सुधार: रोबोट अपने कामों में बहुत बेहतर हो गए। सिमुलेशन में, सफलता दर में 20% की वृद्धि हुई। वास्तविक रोबोटों पर, सफलता दर में 40% की उछाल आई।
  • यह केवल एक दिशा नहीं है: पिछले तरीकों ने रोबोट को केवल एक दिशा में धकेलने की कोशिश की (जैसे "ज़ोर से धक्का दो")। COAST ने महसूस किया कि सफलता मन में एक पूरे क्षेत्र या आकार की तरह होती है, न कि केवल एक रेखा की तरह। पूरे आकार को मोड़कर (steering), यह बहुत बेहतर काम करता है।
  • विफलता साझा है, सफलता अद्वितीय है: शोधकर्ताओं ने पाया कि दिलचस्प बात यह है: रोबोट विभिन्न कार्यों में समान तरीकों से विफल होते हैं (उदाहरण के लिए, वे सभी एक ही तरह से हैंडल को मिस करते हैं)। लेकिन वे विशिष्ट कार्यों के आधार पर बहुत अनूठे तरीकों से सफल होते हैं। COAST इस तथ्य का उपयोग करके "साझा विफलता" पैटर्न को ब्लॉक करना सीखता है, जो रोबोट को उन नए कार्यों पर भी सफल होने में मदद करता है जिन्हें उसने पहले नहीं देखा है।

यह क्यों मायने रखता है

आमतौर पर, एक रोबोट को ठीक करने के लिए जो बार-बार विफल हो रहा है, आपको हजारों नए उदाहरणों के साथ उसे हफ्तों तक फिर से प्रशिक्षित करना पड़ता है। COAST दिखाता है कि रोबोट पहले से ही जानता है कि कैसे सफल होना है; उसे बस उस ज्ञान पर ध्यान केंद्रित करने के लिए थोड़ी मदद की आवश्यकता है।

यह एक "प्लग-एंड-प्ले" समाधान है। आपको रोबोट के दिमाग को फिर से बनाने की आवश्यकता नहीं है। आपको बस सफलता और विफलता के कुछ उदाहरण चाहिए, फिल्टर बनाने के लिए कुछ गणित करना है, और फिर रोबोट एक पेशेवर की तरह प्रदर्शन करता है।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप धनुष और बाण से लक्ष्य (bullseye) भेदने की कोशिश कर रहे हैं। आपके पास एक मास्टर तीरंदाज (रोबोट का दिमाग) है जो भौतिकी जानता है, लेकिन आपका हाथ (रोबोट का एक्शन एक्सपर्ट) डगमगा रहा है।

  • पुराना तरीका: आप अपने हाथ को स्थिर रखने के लिए महीनों तक अपनी मांसपेशियों को फिर से प्रशिक्षित करने में बिताते हैं (Fine-tuning)।
  • COAST तरीका: आप अपने धनुष पर एक विशेष साइट (sight) लगाते जो प्रत्यंचा खींचते समय आपके निशाने को स्वचालित रूप से समायोजित करती है, जो आपके पिछले चूकने के अनुभवों के आधार पर आपके डगमगाते हाथ को ठीक करती है। आप अपनी मांसपेशियों को बदले बिना तुरंत लक्ष्य भेद देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →