← नवीनतम पेपर
💻 computer science

Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models

यह शोध पत्र T²VLA को प्रस्तुत करता है, जो एक टेस्ट-टाइम सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो विज़न-लैंग्वेज-एक्शन मॉडल्स को आंतरिक आत्मविश्वास संकेतों और एक ड्यूल-एक्सपर्ट बूटस्ट्रैपिंग तंत्र का लाभ उठाकर स्व-बूटस्ट्रैपिंग पॉलिसी सुधार प्राप्त करने में सक्षम बनाता है, जिससे बाहरी पर्यावरणीय पुरस्कारों की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Siyao Chen, Jiakang Yuan, Jiaxin Wang, Tao Chen

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyao Chen, Jiakang Yuan, Jiaxin Wang, Tao Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई जटिल कार्य करना सिखा रहे हैं, जैसे कटोरे सजाना या कील ठोकना। पारंपरिक रूप से, रोबोट को बेहतर बनाने के लिए, आपको एक मानव शिक्षक या एक आदर्श सिम्युलेटर की आवश्यकता होती है जो हर हरकत को देखे और कहे, "अच्छा काम किया!" या "फिर से कोशिश करो।" यह एक सख्त कोच की तरह है जो केवल तभी बोलता है जब आप कुछ सही या गलत करते हैं।

यह शोध पत्र एक नया तरीका पेश करता है जिससे रोबतों को प्रशिक्षित किया जाता है जिसे T2VLA कहा जाता है। एक कोच का इंतज़ार करने के बजाय, रोबोट अपनी अंतरात्मा की आवाज़ (gut feelings) पर भरोसा करना सीखता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. "अंतरात्मा की आवाज़" की खोज (The "Gut Feeling" Discovery)

शोधकर्ताओं ने एक दिलचस्प बात देखी: जब रोबोट किसी समस्या को हल करने की कोशिश करता है, तो वह एक "कॉन्फिडेंस स्कोर" (एक संख्या जो यह दर्शाती है कि वह अपने अगले कदम के बारे में कितना आश्वस्त है) उत्पन्न करता है।

  • उपमा: इसे एक छात्र द्वारा परीक्षा देने की तरह समझें। बिना उत्तर कुंजी (answer key) के भी, छात्र को पता चल जाता है कि उसने अच्छा किया है यदि उत्तर लिखते समय वह बहुत आत्मविश्वासी महसूस कर रहा था।
  • निष्कर्ष: शोध पत्र दिखाता है कि जब रोबोट अपने कार्यों में अत्यधिक आत्मविश्वास दिखाता है, तो वह आमतौर पर सफल होता है। जब वह अनिश्चित होता है, तो वह आमतौर पर विफल हो जाता है। इसलिए, रोबोट अपने "आत्मविश्वास" को एक रिवॉर्ड सिग्नल के रूप में उपयोग कर सकता है, जो मानव कोच की आवश्यकता को समाप्त कर देता है।

2. "दो विशेषज्ञों" की प्रणाली (The "Dual Expert" System)

रोबोट केवल अनुमान नहीं लगाता; उसके पास एक स्मार्ट सिस्टम है जो यह तय करता है कि उसके अपने प्रयासों में से किन प्रयासों को याद रखने लायक है। कल्पना कीजिए कि रोबोट के पास दो आंतरिक सलाहकार हैं:

  • लोकल स्यूडो-एक्सपर्ट (द "हॉट स्ट्रीक" कोच): यह सलाहकार प्रयासों के वर्तमान समूह को देखता है। यदि रोबोट ने अभी कुछ नया आज़माया है और वह बहुत आत्मविश्वासी महसूस कर रहा है, तो यह सलाहकार कहता है, "यह बहुत बढ़िया था! आइए इसे तुरंत फिर से करने की कोशिश करें।" यह साहसी और नए प्रयोगों को प्रोत्साहित करता है।
  • ग्लोबल एक्सपर्ट पूल (द "हॉल ऑफ फ़ेम"): यह एक मेमोरी बैंक है जो रोबोट द्वारा अतीत में किए गए सर्वश्रेष्ठ प्रयासों को संग्रहीत करता है। यह एक सुरक्षा जाल के रूप में कार्य करता है। यदि रोबोट भ्रमित हो जाता है या कुछ ऐसा आज़माता है जो उसे अस्थिर लगता है, तो यह सलाहकार कहता है, "रुको, याद करो कि पिछले सप्ताह तुमने वह सटीक चाल चली थी? चलो वापस उसी पर चलते हैं।"

दोनों क्यों? यदि रोबोट केवल "हॉट स्ट्रीक" की बात सुनता है, तो वह बहुत उत्साहित होकर गलतियाँ कर सकता है। यदि वह केवल "हॉल ऑफ फ़ेम" की बात सुनता है, तो वह वही पुरानी चीज़ें करते रहने में फंस सकता है और कभी कुछ नया नहीं सीख पाएगा। T2VLA इन दोनों के बीच संतुलन बनाता है ताकि रोबोट सुरक्षित रूप से सुधार कर सके।

3. "लचीला पैमाना" (The "Flexible Ruler" - DTW)

रोबोट हमेशा बिल्कुल एक ही गति से नहीं चलते। एक बार, वह किसी कप को जल्दी उठा सकता है; दूसरी बार, धीरे।

  • समस्या: यदि आप दो गतिविधियों की तुलना एक कठोर पैमाने (rigid ruler) का उपयोग करके करने की कोशिश करते हैं (यह जाँचते हुए कि क्या वे ठीक उसी सेकंड में मेल खाते हैं), तो वे पूरी तरह से अलग दिखते हैं, भले ही उनका रास्ता (path) एक ही हो।
  • समाधान: यह शोध पत्र डायनेमिक टाइम वार्पिंग (DTK/DTW) नामक एक तकनीक का उपयोग करता है।
  • उपमा: कल्पना कीजिए कि दो लोग एक ही रास्ते पर चल रहे हैं लेकिन अलग-अलग गति से। एक कठोर पैमाना कहेगा कि वे एक-दूसरे से दूर हैं क्योंकि एक व्यक्ति कदम 10 पर है जबकि दूसरा कदम 5 पर है। DTW एक खिंचने वाले रबर के पैमाने की तरह है जो उनके कदमों के साथ मुड़ जाता है। यह कहता है, "आह, भले ही आपने अलग-अलग गति से चलना शुरू किया, लेकिन आप दोनों ने एक ही रास्ता तय किया!" यह रोबोट को अच्छे व्यवहार को पहचानने की अनुमति देता है, भले ही उसका समय (timing) थोड़ा अलग हो।

4. परिणाम: कोच के बिना आत्म-सुधार (The Result: Self-Improvement Without a Coach)

इन विचारों को जोड़कर, रोबोट सेल्फ-बूटस्ट्रैपिंग (Self-Bootstrapping) के चक्र में प्रवेश करता है:

  1. वह एक कार्य करने का प्रयास करता है।
  2. वह अपने आत्मविश्वास की जाँच करता है।
  3. वह अपने "हॉल ऑफ फ़ेम" और अपने "हॉट स्ट्रीक" के साथ अपने मूव की तुलना लचीले पैमाने का उपयोग करके करता है।
  4. वह सर्वश्रेष्ठ मिलानों से सीखता है और फिर से प्रयास करता है।

परिणाम:
रोबोट ने विभिन्न प्रकार के कार्यों (जैसे वस्तुओं को सजाना या दो हाथों का उपयोग करना) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • रोबोट ने बिना किसी बाहरी इनाम (कोई मानव स्कोरिंग नहीं, कोई पूर्ण सिम्युलेटर नहीं) के अपने कार्यों में काफी सुधार किया।
  • इसने उन रोबोटों के समान या कभी-कभी उनसे भी बेहतर प्रदर्शन किया जिन्हें बाहरी मदद के साथ प्रशिक्षित किया गया था।
  • यह विभिन्न प्रकार के रोबोटिक दिमागों (जो डिस्क्रीट विकल्प बनाते हैं और जो स्मूथ, निरंतर मूवमेंट करते हैं, दोनों) पर काम करता है।

सारांश

संक्षेप में, T2VLA रोबोट को उनके अपने शिक्षक बनना सिखाता है। अपने आंतरिक आत्मविश्वास पर भरोसा करके, अपने सर्वश्रेष्ठ मूव्स का एक "हॉल ऑफ फ़ेम" रखकर, और कार्यों की तुलना करने के लिए एक लचीले तरीके का उपयोग करके, रोबोट जटिल कार्य अपने आप सीख सकते हैं, बिना किसी इंसान के हाथ पकड़ने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →