← नवीनतम पेपर
🤖 AI

SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models

यह शोधपत्र SCALE प्रस्तुत करता है, जो विजन-लैंग्वेज-एक्शन मॉडलों के लिए एक प्रशिक्षण-मुक्त, सिंगल-पास इन्फरेंस रणनीति है जो विजुअल परसेप्शन और एक्शन निष्पादन दोनों को गतिशील रूप से अनुकूलित करने के लिए सेल्फ-अनसर्टेन्टी (स्व-अनिश्चितता) का लाभ उठाती है, जिससे बिना किसी अतिरिक्त प्रशिक्षण या सत्यापनकर्ता (वेरिफायर) के मजबूती बढ़ती है और मौजूदा टेस्ट-टाइम स्केलिंग विधियों से बेहतर प्रदर्शन करती है।

मूल लेखक: Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। आप उसे एक रेसिपी (भाषा निर्देश) देते हैं और उसे रसोई दिखाते हैं (विजुअल इनपुट)। रोबोट को यह तय करने की आवश्यकता है कि आगे क्या करना है: चाकू उठाना, प्याज काटना, या चूल्हा चालू करना।

वर्तमान रोबोट के दिमाग (जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) स्मार्ट हैं, लेकिन उनमें एक दोष है: वे थोड़े कठोर हैं। एक बार जब वे कोई निर्णय ले लेते हैं, तो वे उस पर टिके रहते हैं, भले ही वे भ्रमित हों। यदि रोबोट एक लाल मिर्च देखता है जो टमाटर जैसी दिख रही है, तो वह गलत चीज़ उठा सकता है और पकवान खराब कर सकता है, और साथ ही पूरे आत्मविश्वास से यह भी कह सकता है, "मुझे पता है कि मैं क्या कर रहा हूँ।"

यह पेपर एक नई विधि पेश करता है जिसे SCALE (सेल्फ-अनसर्टेन्टी कंडिश्न्ड एडेप्टिव लुकिंग एंड एक्जीक्यूशन) कहा जाता है। SCALE को ऐसे समझें जैसे कि यह रोबोट को एक "गट फीलिंग" (अंतर्ज्ञान) मीटर दे रहा है जो उसे बताता है कि कब साहसी होना है और कब सतर्क रहना है।

SCALE कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "कॉन्फिडेंट फूल" (आत्मविश्वासी मूर्ख)

आजकल के अधिकांश रोबोट एक ऐसे छात्र की तरह काम करते हैं जो परीक्षा में उत्तर का अनुमान लगाता है और फिर अपने उत्तर पर अड़ा रहता है, भले ही उसे बीच में एहसास हो जाए कि वह गलत हो सकता है।

  • फिक्स्ड विजन (स्थिर दृष्टि): वे दुनिया को हमेशा एक ही "फोकस" के साथ देखते हैं। यदि वे किसी चमकदार वस्तु (एक डिस्ट्रैक्टर/भटकाने वाली वस्तु) से विचलित हो जाते हैं, तो वे वास्तविक सामग्री को मिस कर सकते हैं जिसकी उन्हें आवश्यकता है।
  • फिक्स्ड एक्शन (स्थिर क्रिया): वे सबसे संभावित क्रिया चुनते हैं और तुरंत उसे करते हैं। यदि वे अनिश्चित हैं, तो भी वे एक चुनते हैं और उम्मीद करते हैं कि सब ठीक होगा।

2. समाधान: "सेल्फ-अनसर्टेन्टी" मीटर (स्व-अनिश्चितता मीटर)

SCALE रोबोट से एक सरल प्रश्न पूछता है: "मैं अभी कितना निश्चित हूँ?"

इसे अपना काम चेक करने के लिए किसी मानव शिक्षक या दूसरे रोबोट की आवश्यकता नहीं है। यह अपने स्वयं के आंतरिक गणित (लॉगिट्स) को देखकर अपने आत्मविश्वास को मापता है।

  • उच्च आत्मविश्वास (कम अनिश्चितता): रोब है सुनिश्चित है कि लाल चीज़ एक टमाटर है। यह एक लेजर बीम की तरह अपने फोकस को संकुचित करता है और तेजी से और सीधे कार्य करता है।
  • कम आत्मविश्वास (उच्च अनिश्चितता): रोबोट दो लाल चीजें देखता है और सुनिश्चित नहीं है कि टमाटर कौन सा है। अनुमान लगाने के बजाय, वह कहता है, "रुको, मैं भ्रमित हूँ।"

3. जादुई ट्रिक: एडेप्टिव लुकिंग एंड एक्टिंग (अनुकूलन योग्य देखना और कार्य करना)

जब रोबोट को एहसास होता है कि वह भ्रमित है, तो SCALE एक साथ दो बदलावों को ट्रिगर करता है:

  • एडेप्टिव लुकिंग (लेंस को चौड़ा करना): कल्पना कीजिए कि रोबोट ने चश्मा पहना हुआ है। जब वह आत्मविश्वासी होता है, तो उसके चश्मे "ज़ूम इन" पर सेट होते हैं ताकि विशिष्ट कार्य पर ध्यान केंद्रित किया जा सके। जब वह भ्रमित होता है, तो उसके चश्मे स्वचालित रूप से "वाइड एंगल" पर स्विच हो जाते हैं। यह रोबोट को पूरी दृश्य को फिर से देखने के लिए मजबूर करता है, उन सुरागों को खोजने के लिए जिन्हें उसने पहले मिस कर दिया होगा (जैसे यह जांचना कि दूसरा लाल ऑब्जेक्ट वास्तव में मिर्च तो नहीं है)।
  • एडेप्टिव एक्टिंग (अधिक विकल्प आज़माना): जब वह आत्मविश्वासी होता है, तो वह सबसे अच्छा कदम चुनता है और कार्य करता है। जब वह भ्रमित होता है, तो वह इतना कठोर नहीं रहता। केवल एक ही चाल चुनने के बजाय, वह कई अलग-अलग संभावनाओं को "सैंपल" करता है (जैसे कि वस्तु को पकड़ने के लिए थोड़ा अलग कोण आज़माना) यह देखने के लिए कि कौन सा सही महसूस होता है।

4. यह क्यों खास है (द "वन-पास" एडवांटेज)

रोबोट को स्मार्ट बनाने के अन्य तरीकों के लिए आमतौर पर निम्नलिखित की आवश्यकता होती है:

  • एक नया शिक्षक प्रशिक्षित करना: आपको रोबोट के काम की जाँच करने के लिए एक अलग AI को प्रशिक्षित करना पड़ता है।
  • टेस्ट को कई बार चलाना: रोबोट अपने दिमाग में कार्य को 10 बार आज़माता है ताकि सबसे अच्छा विकल्प चुन सके, जो कि धीमा है।

SCALE अलग है। यह एक ड्राइवर की तरह है जो सहज रूप से जानता है कि कब धीमा होना है और आसपास देखना है, बिना किसी को-पायलट या दूसरे चक्कर के।

  • कोई अतिरिक्त प्रशिक्षण नहीं: यह रोबोट के मौजूदा दिमाग के साथ काम करता है।
  • कोई दोबारा विचार नहीं: यह एक ही बार में (एक "फॉरवर्ड पास" में) निर्णय लेता है।
  • रियल-टाइम: क्योंकि यह गणनाओं को बार-बार चलाने में समय बर्बाद नहीं करता है, इसलिए यह वास्तविक दुनिया के रोबोट के लिए पर्याप्त तेज़ है।

परिणाम

परीक्षणों में, SCALE का उपयोग करने वाले रोबोट कठिन स्थितियों को संभालने में बहुत बेहतर थे, जैसे कि:

  • ऐसी वस्तुओं को उठाना जो अन्य चीजों के समान दिखती हैं।
  • बाधाओं से टकराए बिना नेविगेट करना।
  • लंबी, जटिल कार्य पूर्ण करना जहाँ शुरुआत में हुई एक छोटी सी गलती सब कुछ खराब कर सकती थी।

संक्षेप में: SCALE रोबोट को अपनी "गट फीलिंग" (अंतर्ज्ञान) को सुनना सिखाता है। जब वे सुनिश्चित होते हैं, तो वे तेज़ और केंद्रित होकर कार्य करते हैं। जब वे अनिश्चित होते हैं, तो वे धीमे हो जाते हैं, अधिक सावधानी से देखते हैं, और विभिन्न दृष्टिकोणों को आज़माते हैं। यह उन्हें बिना किसी अतिरिक्त प्रशिक्षण या धीमे, बार-बार परीक्षण के, अधिक सुरक्षित, स्मार्ट और विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →