← नवीनतम पेपर
⚡ electrical engineering

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

यह शोध पत्र कॉन्सेप्ट-गेटेड विजुअल डिस्टिलेशन (CGVD) प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त, मॉडल-अज्ञेय (मॉडल-एग्नोस्टिक) इन्फरेंस फ्रेमवर्क है जो निर्देशों का विश्लेषण करके व्याकुलता पैदा करने वाले तत्वों (डिस्ट्रैक्टर्स) की पहचान करने और स्वच्छ अवलोकन उत्पन्न करने के लिए फूरियर-आधारित इनपेंटिंग का उपयोग करके विजन-लैंग्वेज-एक्शन मॉडल्स में "प्रिसिजन-रीज़निंग गैप" को दूर करता है, जिससे अत्यधिक अव्यवस्थित वातावरण में रोबोटिक मैनिपुलेशन की सफलता दर में उल्लेखनीय सुधार होता है।

मूल लेखक: Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशिष्ट चम्मच उठाने और उसे तौलिए पर रखने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। रोबोट अविश्वसनीय रूप से बुद्धिमान है; उसने लाखों किताबें पढ़ी हैं और अरबों तस्वीरें देखी हैं, इसलिए वह जानता है कि "चम्मच" और "तौलिया" क्या होता है।

हालाँकि, एक समस्या है। आप चम्मच को एक मेज पर रखते हैं जो बिखरी हुई (messy) है। वहाँ कांटे, चाकू, कैंची और अन्य चम्मच हर जगह बिखरे हुए हैं।

जब रोबोट इस बिखराव को देखता है, तो वह भ्रमित हो जाता है। वह लक्षित चम्मच को देखता है, लेकिन वह अन्य सभी चमकदार धातु की वस्तुओं को भी देखता है। उसका "दिमाग" विजुअल शोर (visual noise) से अभिभूत हो जाता है। वह गलत चम्मच उठा सकता है, या वह हिचकिचाकर वस्तु को गिरा सकता है। शोधपत्र में, लेखक इसे "प्रिसिजन-रीज़निंग गैप" (Precision-Reasoning Gap) कहते हैं। रोबोट जानता है कि उसे क्या करना है (Reasoning), लेकिन वह इसे इतनी सटीकता से नहीं देख पाता (Precision) क्योंकि बैकग्राउंड बहुत शोर भरा है।

समाधान: CGVD (द "स्मार्ट नॉइज़-कैंसलिंग" ग्लासेस)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे कॉन्सेप्ट-गेटेड विजुअल डिस्टिलेशन (CGVD) कहा जाता है। इसे एक नया कौशल सिखाने के बजाय, एक स्मार्ट, नॉइज़-कैंसलिंग चश्मे के रूप में सोचें जिसे रोबोट केवल तभी पहनता है जब कार्य करने का समय होता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग करके चरण-दर-चरण दिया गया है:

1. "गेस्ट लिस्ट" (इंस्ट्रक्शन पार्सिंग)

सबसे पहले, रोबोट निर्देश पढ़ता है: "चम्मच को तौलिए पर रखो।"
पूरी तस्वीर को देखने के बजाय, CGVD एक क्लब के सख्त बाउंसर की तरह काम करता है। यह एक "सेफ लिस्ट" (चम्मच, तौलिया और रोबोट का हाथ) और एक "डिस्ट्रैक्टर लिस्ट" (बाकी सब कुछ: कांटे, चाकू, अव्यवस्था) बनाता है।

2. "डबल-चेक" (टू-लेयर रिफाइनमेंट)

कभी-कभी, एक कांटा इतना अधिक चम्मच जैसा दिखता है कि रोबोट की आँखें धोखा खा जाती हैं। इसे ठीक करने के लिए, CGVD दो-चरणीय सत्यापन प्रक्रिया का उपयोग करता है:

  • चरण A: यह पूछता है, "क्या यह वस्तु निश्चित रूप से एक चम्मच है?"
  • चरण B: यह पूछता है, "क्या यह वस्तु एक कांटा भी है?"
    यदि कोई वस्तु चम्मच जैसी दिखती है लेकिन वास्तव में एक कांटा है, तो सिस्टम उसे एक "नेगेटिव स्कोर" देता है और उसे नकली घोषित कर देता है। यह सुनिश्चित करता है कि रोबोट गलती से असली चम्मच को न मिटा दे या किसी नकली को न रख ले।

3. "मैजिक इरेज़र" (इनपेंटिंग)

यह सबसे शानदार हिस्सा है। एक बार जब सिस्टम जान जाता है कि किसे रखना है और किसे हटाना है, तो यह केवल खराब चीजों को धुंधला नहीं करता है। यह डिस्ट्रैक्टर्स (विचलित करने वाली वस्तुओं) के ऊपर पेंट करने के लिए एक डिजिटल मैजिक इरेज़र (जिसे LaMa कहा जाता है) का उपयोग करता है।

  • कल्पना करें कि आप एक बिखरे हुए कमरे को देख रहे हैं। CGVD एक फोटो लेता है, डिजिटल रूप से सारी अव्यवस्था को बैकग्राउंड की दीवार के रंग से पेंट कर देता है, और फिर इस "साफ" फोटो को रोबट को दिखाता है।
  • अब रोबोट को केवल चम्मच और तौलिए के साथ एक साफ मेज दिखाई देती है। भ्रमित करने वाला शोर गायब हो गया है।

4. "घोस्ट इमेज" (टेम्पोरल कंसिस्टेंसी)

आप सोच सकते हैं: "क्या होगा अगर रोबोट हिलता है और बैकग्राउंड बदल जाता है?"
CGVD इस मामले में स्मार्ट है। यह भारी "सफाई" का काम केवल शुरुआत में एक बार करता है। उसके बाद, यह साफ, पेंट किए गए बैकग्राउंड को लाइव वीडियो फीड के साथ मिला देता है। यह एक वीडियो गेम में पारदर्शी ओवरले (transparent overlay) रखने जैसा है। रोबोट वास्तविक दुनिया को चलते हुए देखता है, लेकिन विचलित करने वाली वस्तुएं स्थायी रूप से "घोस्ट आउट" (अदृश्य) कर दी जाती हैं ताकि वे रोबोट के दिमाग को भ्रमित न करें।

यह क्यों मायने रखता है?

शोधपत्र में बहुत ही अव्यवस्थ वातावरण में रोबोटों पर इसका परीक्षण किया गया।

  • CGVD के बिना: जब कई भ्रमित करने वाली वस्तुएं थीं, तो रोबोट लगभग 57% बार विफल रहा। वह शोर में खो गया।
  • CGVD के साथ: रोबोट 77.5% बार सफल रहा।

रोबोट के सोचने की कोशिश करने से पहले उसके विजुअल इनपुट को साफ करके, रोबोट अपना पूरा "दिमागी बल" कार्य पर केंद्रित कर सकता है।

कमी (सीमाएं)

यह विधि पूर्ण नहीं है। यह मानती है कि बैकग्राउंड मुख्य रूप से स्थिर (जैसे एक मेज) है। यदि कोई व्यक्ति काम करते समय अव्यवस्था को हिला देता है, तो "साफ" की गई छवि वास्तविकता के साथ तालमेल से बाहर हो सकती है। इसके अलावा, यदि अव्यवस्था वास्तव में रोबोट की मदद करती है (जैसे कि एक विजुअल एंकर प्रदान करना), तो उसे हटाना कभी-कभी चीजों को थोड़ा कठिन बना सकता है।

बड़ी तस्वीर

CGVD को वास्तविक दुनिया और रोबोट के दिमाग के बीच एक अनुवादक (translator) के रूप में समझें। वास्तविक दुनिया अराजक है और इसमें बहुत सारे भटकाव हैं। रोबोट का दिमाग शक्तिशाली है लेकिन आसानी से अभिभूत हो जाता है। CGVD अराजक दुनिया को एक साफ, सरल निर्देश पुस्तिका में अनुवाद करता है, जिससे रोबोट एक सर्जन की सटीकता के साथ जटिल कार्यों को करने में सक्षम होता है, यहाँ तक कि एक अराजक रसोई में भी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →