← नवीनतम पेपर
💻 computer science

Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing

यह शोधपत्र सिलेक्टेड डिफ्यूजन नॉइज़ (SDN) को प्रस्तुत करता है, जो एक ट्रेनिंग-फ्री टेस्ट-टाइम विधि है जो स्प्यूरियस विजुअल कोरिलेशन को कम करने और सिमुलेशन एवं वास्तविक दुनिया के रोबोटिक कार्यों में एक्शन जिटर को कम करने के लिए शोर वेक्टर्स (noise vectors) को गतिशील रूप से चुनकर डिफ्यूजन-आधारित विजन-लैंग्वेज-एक्शन पॉलिसियों की मजबूती और सफलता दर को बढ़ाता है।

मूल लेखक: Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu, Binh Gia Nguyen, Vinh Tong, Anji Liu, Vu N. Duong, Dung D. Le, Daniel Sonntag, Trung Le, Ngan Le, Jan Peter, An Thai Le, Minh Nhat Vu, Mathias Niepert, Khoa
प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu, Binh Gia Nguyen, Vinh Tong, Anji Liu, Vu N. Duong, Dung D. Le, Daniel Sonntag, Trung Le, Ngan Le, Jan Peter, An Thai Le, Minh Nhat Vu, Mathias Niepert, Khoa D. Doan, Duy M. H. Nguyen, Vien Anh Ngo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली रोबोट शेफ है। इस शेफ ने लाखों कुकिंग वीडियो देखे हैं और यह आपके द्वारा मांगी गई लगभग कोई भी डिश बना सकता है। हालाँकि, एक ऐसे इंसान की तरह जिसने रेसिपी तो याद कर ली है लेकिन सामग्री को पूरी तरह से नहीं समझा है, यह रोबोट कभी-कभी भ्रमित हो जाता है।

समस्या: रोबोट के "हैलुसिनेशन" (Hallucinations) और "जिटर्स" (Jitters)
यह पेपर रोबोट के विफल होने के दो मुख्य तरीकों की पहचान करता है:

  1. "घोस्ट" (Ghost) गलती: कभी-कभी, रोबोट मेज की ओर देखता है, एक गाजर देखता है, और उसे प्लेट पर रखने की गति शुरू कर देता है। लेकिन अगर गाजर अचानक गायब हो जाती है (या अगर रोबट को बस ऐसा लगता है कि वह वहां है जबकि वह नहीं है), तो रोबोट फिर भी आगे बढ़ता रहता है। यह वैसा ही है जैसे कोई व्यक्ति कप के लिए हाथ बढ़ा रहा हो जो वहां है ही नहीं, इस विश्वास के साथ कि वह अभी भी उसके हाथ में है। रोबोट "विजुअल शॉर्टकट्स" या गलत अनुमानों पर निर्भर है बजाय इसके कि वह वास्तव में वस्तु को देख रहा हो।
  2. "जिटरी" (Jittery) गलती: भले ही रोबोट को पता हो कि क्या करना है, लेकिन उसकी हरकतें डगमगाती हुई, झटकेदार या हिंसक हो सकती हैं। वह अपने हाथ को इतनी तेजी से हिलाने की कोशिश कर सकता है कि ऐसा लगे जैसे उसे दौरा पड़ रहा हो, जो रोबोट के शारीरिक स्वास्थ्य और सुरक्षा के लिए बुरा है।

समाधान: "सिलेक्टेड डिफ्यूजन नॉइज़" (Selected Diffusion Noise - SDN)
लेखक एक चतुर, मुफ्त अपग्रेड प्रस्तावित करते हैं जिसे SDN कहा जाता है। उस रोबोट के दिमाग को एक रेडियो की तरह समझें जो अगला कदम उठाने का निर्णय लेने के लिए "स्टैटिक नॉइज़" (static noise) से सिग्नल प्राप्त करता है। आमतौर पर, रोबोट जो भी पहला सिग्नल सुनता है, उसे चुन लेता है।

SDN इस खेल को बदल देता है क्योंकि यह उस स्टैटिक नॉइज़ को एक रिमोट कंट्रोल की तरह मानता है। केवल एक सिग्नल सुनने के बजाय, रोबोट कई अलग-अलग "क्या-होता-अगर" (what-if) परिदृश्यों को उत्पन्न करता है (जैसे एक ही क्रिया के 12 अलग-अलग संस्करणों को आज़माना) और फिर सबसे अच्छे वाले को चुनने के लिए एक सख्त संपादक की तरह काम करता है।

यहाँ बताया गया है कि SDN कैसे काम करता है, जिसमें दो सरल फिल्टर शामिल हैं:

फ़िल्टर 1: "क्या मैं चीज़ें देख रहा हूँ?" टेस्ट (ग्राउंडिंग)

रोबोट खुद से पूछता है: "यदि मैं यह मान लूँ कि जिस वस्तु को मुझे पकड़ना है वह वहाँ नहीं है, तो क्या मैं फिर भी उसे पकड़ने की कोशिश करूँगा?"

  • यह कैसे काम करता है: रोबोट एक सिमुलेशन चलाता है जहाँ वह डिजिटल रूप से लक्षित वस्तु को "ब्लैक आउट" कर देता है (जैसे गाजर पर एक काला स्टिकर लगा देना)।
  • तर्क: यदि रोबोट गाजर को पकड़ने की कोशिश करता रहता है भले ही वह ढकी हुई हो, तो वह 'हैलुसिनेट' कर रहा है। वह वास्तविक वस्तु को देखने के बजाय बैकग्राउंड के संकेतों (जैसे प्लेट) पर निर्भर है। SDN इन "हैलुसिनेटिंग" अनुमानों को हटा देता है।
  • परिणाम: रोबोट केवल उन्हीं क्रियाओं को रखता है जो केवल तभी तर्कसंगत होती हैं जब वस्तु वास्तव में दिखाई दे रही हो।

फ़िल्टर 2: "स्मूथ ऑपरेटर" (Smooth Operator) टेस्ट (स्टेबिलिटी)

रोबोट फिर शेष बचे हुए अच्छे अनुमानों को देखता है और पूछता है: "इनमें से कौन सी हरकत सबसे सुचारू (smooth) दिखती है?"

  • यह कैसे काम करता है: यह गति की "झटकेदार प्रकृति" (jerkiness) की गणना करता है। यह किसी भी ऐसी क्रिया को खारिज कर देता है जिसमें अचानक, हिंसक रुकना या शुरू होना शामिल हो।
  • परिणाम: यह उस क्रिया को चुनता है जो पानी की तरह बहती है, जिससे यह सुनिश्चित होता है कि रोबोट हिले या अपने जोड़ों को नुकसान पहुँचाए।

परिणाम
इस दो-चरणीय फिल्टर का उपयोग करके, रोबोट बिना किसी नए प्रशिक्षण या नई चीजें सीखे बहुत अधिक विश्वसनीय हो जाता है।

  • सिमुलेशन में: रोबोट पहले की तुलना में लगभग 8% अधिक बार सफल रहा।
  • वास्तविक दुनिया में: सफलता दर में 10% की वृद्धि हुई, और उसकी हरकतें स्पष्ट रूप से अधिक सुचारू और कम डगमगाती हुई हो गईं।

यह क्यों महत्वपूर्ण है
पिछले अधिकांश तरीकों ने रोबोट को भारी बाहरी कंप्यूटर जोड़कर या रोबोट के दिमाग को बदलकर ठीक करने की कोशिश की (जो महंगा और जोखिम भरा है)। SDN अलग है: यह एक "प्लग-एंड-प्ले" ट्रिक है जो रोबोट के सोचने के दौरान ही होती है। यह रोबोट के दिमाग को नहीं बदलता है; यह बस रोबोट को उन कई विचारों में से सबसे अच्छा विचार चुनने में मदद करता है जो उसके पास पहले से ही मौजूद हैं।

संक्षेप में, SDN रोबोट को कार्य करने से पहले अपनी दृष्टि को दोबारा जांचने और अपनी हरकतों को सुचारू बनाने की शिक्षा देता है, जिससे वह एक सुरक्षित और अधिक सफल कार्यकर्ता बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →