← नवीनतम पेपर
💻 computer science

Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models

यह शोध पत्र पर्सर्बेशन लर्निंग विद डिलेड फीडबैक (PDF) का प्रस्ताव करता है, जो एक वेरीफायर-मुक्त टेस्ट-टाइम एडेप्टेशन फ्रेमवर्क है जो अनिश्चितता-आधारित डेटा ऑग्मेंटेशन, एक्शन वोटिंग और एक हल्के मॉड्यूल के माध्यम से ट्रजेक्टरी ओवरफिटिंग को कम करके विजन-लैंग्वेज-एक्शन मॉडल्स की पर्यावरणीय बदलावों के प्रति मजबूती को बढ़ाता है, जो डिलेड फीडबैक का उपयोग करके एक्शन लॉजिट्स को पूर्वव्यापी रूप से सुधारता है।

मूल लेखक: Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Lium, Jiahuan Zhou, Jiangmeng Li

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Lium, Jiahuan Zhou, Jiangmeng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली रोबोट शेफ है। आपने उसे एक मास्टर शेफ का वीडियो दिखाकर एक बेहतरीन ऑमलेट बनाना सिखाया है। रोबट वीडियो को बिल्कुल सटीक तरीके से फॉलो करने में बहुत माहिर है।

लेकिन यहाँ एक समस्या है: रोबट वीडियो को बहुत ज़्यादा अच्छी तरह से याद कर लेता है।

अगर आप फ्राइंग पैन को बस दो इंच बाईं ओर खिसका देते हैं, या रोशनी थोड़ी बदल जाती है, तो रोबट घबरा जाता है। वह वास्तव में यह नहीं समझता कि वह अंडे को क्यों पलट रहा है; वह बस याद रखता है, "वीडियो में पैन यहाँ था, इसलिए मैं अपने हाथ को उस जगह पर ले जाता हूँ।" अगर पैन वहाँ नहीं होता, तो भी वह अपने हाथ को उसी खाली जगह पर ले जाता रहता है, जिससे वह काउंटर से टकरा जाता है। यह एक ऐसे छात्र की तरह है जिसने गणित के टेस्ट के उत्तर रट लिए हैं लेकिन उसे गणित समझ नहीं आता। यदि प्रश्न में एक संख्या भी बदल दी जाए, तो वह फेल हो जाता है।

AI की दुनिया में, इसे ट्रैजेक्टरी ओवरफिटिंग (Trajectory Overfitting) कहा जाता है। रोबट "लक्ष्य" को समझने के बजाय "रास्ते" (ट्रैजेक्टरी) को याद कर रहा है।

समाधान: "PDF" (परटर्बेशन लर्निंग विद डिलेड फीडबैक)

इस पेपर के लेखकों ने इस समस्या को ठीक करने के लिए PDF नामक एक नया सिस्टम बनाया है। PDF को एक ऐसे शिक्षक के रूप में न देखें जो रोबट को दोबारा पढ़ा रहा है, बल्कि एक स्मार्ट कोच के रूप में देखें जो खेल के दौरान रोबट के बगल में खड़ा है, और रोबट के पूरे दिमाग को फिर से लिखे बिना उसे सलाह दे रहा है।

यहाँ बताया गया है कि PDF कैसे काम करता है, तीन सरल रूपकों (metapole) का उपयोग करके:

1. "स्ट्रेस टेस्ट" (अनसर्टेनिटी-बेस्ड एक्शन वोटिंग)

कल्पना कीजिए कि रोबट एक कटोरा उठाने वाला है। आमतौर पर, वह वही करता है जो उसे लगता है कि सही है। लेकिन PDF पूछता है: "क्या तुम पक्का हो?"

यदि रोबट अनिश्चित है (शायद कटोरा सामान्य से थोड़ा अलग दिख रहा है), तो PDF उसे अंदाज़ा लगाने नहीं देता। इसके बजाय, वह कहता है, "चलो अपनी कल्पना में इसे 5 बार आज़माते हैं!"

  • वह कटोरे के वर्तमान दृश्य को लेता है और उसके 5 थोड़े अलग "भ्रम" (hallucinations) बनाता है (जैसे, थोड़ा गहरा, थोड़ा घुमाया हुआ, थोड़ा धुंधला)।
  • वह रोबट से पूछता है, "तुम इस संस्करण में क्या करोगे? और इस वाले में क्या करोगे?"
  • यदि रोबट 5 में से 4 संस्करणों के लिए "बाएँ पकड़ो" कहता है, लेकिन मूल संस्करण के लिए "दाएँ पकड़ो" कहता है, तो PDF को एहसास होता है कि रोबट भ्रमित है। फिर वह रोबट को सबसे सुसंगत उत्तर पर वोट करने के लिए मजबूर करता है।

उपमा: यह दोस्तों के एक समूह से रास्ता पूछने जैसा है। यदि एक दोस्त कहता है "बाएँ मुड़ें" लेकिन अन्य चार कहते हैं "दाएँ मुड़ें," तो आप बहुमत पर भरोसा करते हैं। यह रोबट को किसी बुरी आदत का आँख मूँदकर पालन करने से रोकता है।

2. "कोच की सीटी" (डिलेड फीडबैक)

कई वीडियो गेम या रोबोट कार्यों में, आपको तब तक पता नहीं चलता कि आप जीते या हारे जब तक कि राउंड खत्म नहीं हो जाता।

  • पुराना तरीका: रोबोट कटोरा उठाने की कोशिश करता है, चूक जाता है, और खाली हवा को पकड़ने की कोशिश करता रहता है क्योंकि उसे लगता है कि वह सही काम कर रहा है। वह आत्मविश्वासी है लेकिन गलत है।
  • PDF का तरीका: रोबोट प्रयास करता है, असफल होता है, और राउंड के अंत में एक "डिलेड फीडबैक" सिग्नल प्राप्त करता है कि "हे, तुम असफल रहे। तुमने कटोरा मिस कर दिया।"

PDF इस "विफलता सिग्नल" का उपयोग राउंड के बाद रोबोट के दिमाग को धीरे से दिशा देने के लिए करता है। यह पूरे रोबोट को फिर से प्रशिक्षित नहीं करता (जिसमें बहुत समय लगता है)। इसके बजाय, यह रोबट की निर्णय लेने की प्रक्रिया में एक छोटा सा "सुधार स्टिकर" जोड़ देता है।

  • उपमा: कल्पना कीजिए कि आप बास्केटबॉल शॉट मार रहे हैं। आप चूक जाते हैं। कोच आपकी मांसपेशियों को फिर से नहीं बनाता; वे बस फुसफुसाते हैं, "अगली बार, थोड़ा ऊपर निशाना लगाओ।" PDF स्वचालित रूप से ऐसा करता है, जिससे रोबट को गलत होने पर कम आत्मविश्वासी होने की सीख मिलती है।

3. "कोई भारी काम नहीं" का नियम (वेरिफायर-फ्री)

रोबोट को ठीक करने के अन्य अधिकांश तरीकों के लिए एक दूसरे, सुपर-स्मार्ट "वेरिफायर" रोबट की आवश्यकता होती है जो पहले वाले को देखता रहे और उसके काम को ग्रेड दे। यह एक खिलाड़ी को देखने के लिए पूरी नई जजों की टीम रखने जैसा है। यह धीमा, महंगा और गणनात्मक रूप से भारी है।

PDF अलग है। यह एक "प्लग-एंड-प्ले" पैच है। इसे दूसरे रोबोट की आवश्यकता नहीं है। इसे मुख्य रोबोट के दिमाग को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह बस एक छोटा, हल्का मॉड्यूल जोड़ता है जो इसके ऊपर बैठता है और वास्तविक समय में त्वरित समायोजन करता है।

यह क्यों मायने रखता है?

पेपर ने इसका परीक्षण दो चीजों पर किया:

  1. वस्तुओं को हिलाने वाले रोबोट्स (LIBERO): रोबोट अक्सर विफल होने के बजाय बहुत अधिक बार सफल हुआ, भले ही वस्तुओं को थोड़ा हिला दिया गया हो।
  2. एटारी (Atari) वीडियो गेम खेलना: रोबोट का स्कोर काफी बढ़ गया, और उसने "ह्यूमन-नॉर्मलाइज्ड" औसत को भी पीछे छोड़ दिया।

मुख्य निष्कर्ष

दुनिया अव्यवस्थित है। वस्तुएं हिलती हैं, रोशनी बदलती है, और चीजें हमेशा वैसी नहीं होतीं जैसी वे प्रशिक्षण वीडियो में थीं।

PDF रोबट को स्क्रिप्ट रटने के बजाय दृश्य को समझने के लिए सिखाता है। यह इसे निम्नलिखित तरीकों से करता है:

  1. अपने स्वयं के निर्णयों का स्ट्रेस-टेस्ट करना (वोटिंग)।
  2. बाद में अपनी गलतियों से सीखना (डिलेड फीडबैक)।
  3. बिना किसी सुपरकंप्यूटर या निगरानी करने वाले दूसरे रोबोट के, इसे तेजी से करना

यह एक ऐसे रोबोट के बीच का अंतर है जो स्क्रिप्ट का पालन करने वाला एक कठोर अभिनेता है, और एक ऐसे लचीले समस्या-समाधानकर्ता के बीच है जो स्क्रिप्ट बदलने पर भी खुद को ढाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →