← नवीनतम पेपर
💻 computer science

Denoising Tells When to Replan: Denoising-Variance Adaptive Chunking for Flow-Based Robot Policies

यह शोध पत्र DVAC का प्रस्ताव करता है, जो एक टेस्ट-टाइम विधि है जो फ्लो-आधारित नीतियों में डीनॉइजिंग वेरिएंस (denoising variance) की निगरानी करके एक्शन चंक निष्पादन लंबाई को अनुकूल रूप से निर्धारित करता है, जिससे विविध मैनिपुलेशन बेंचमार्क में कार्य सफलता में सुधार होता है और अनावश्यक रीप्लानिंग कम होती है।

मूल लेखक: Xiangdong Feng, Yuxuan Cheng, Chen Shi, Boyao Han, Yuxuan Yan, Yitong Hong, Zhuotao Tian, Li Jiang

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangdong Feng, Yuxuan Cheng, Chen Shi, Boyao Han, Yuxuan Yan, Yitong Hong, Zhuotao Tian, Li Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई जटिल कार्य करना सिखा रहे हैं, जैसे कि ब्लॉक्स को एक के ऊपर एक रखना या ड्रिंक डालना। रोबोट की गति को सुचारू बनाने के लिए, कंप्यूटर उसे केवल "हाथ आगे बढ़ाओ" नहीं बताता। इसके बजाय, यह एक साथ भविष्य की गतिविधियों का एक पूरा हिस्सा (chunk) अनुमानित करता है—मान लीजिए अगले 20 कदम—और फिर कंप्यूटर से नए निर्देश मांगने से पहले उन सभी को निष्पादित (execute) करता है।

यह कुशल है, लेकिन इसमें एक दोष है: रोबोट को उन 20 कदमों की सूची पर कब तक भरोसा करना चाहिए?

  • यदि रोबोट एक खाली कमरे में चल रहा है (एक "अनुमानित" चरण), तो वह सुरक्षित रूप से उन 20 कदमों की पूरी सूची पर भरोसा कर सकता है।
  • लेकिन यदि रोबोट एक फिसलन भरे कप को पकड़ने वाला है या चाबी को ताले में डालने वाला है (एक "सटीकता" चरण), तो 20 कदम पहले बनाई गई सूची पर भरोसा करना खतरनाक है। उसे रुकना होगा, फिर से देखना होगा और तुरंत एक नई योजना के लिए पूछना होगा।

वर्तमान में, अधिकांश रोबट एक निश्चित नियम का उपयोग करते हैं: "हमेशा 10 कदम चलाएं, फिर रुकें और एक नई योजना मांगें।" यह कार चलाने और यह तय करने जैसा है कि आप ठीक हर 10 सेकंड में अपने रियरव्यू मिरर को देखेंगे, चाहे आप एक सीधी हाईवे पर हों या एक भीड़भाड़ वाले, घुमावदार बाजार में नेविगेट कर रहे हों।

मुख्य विचार: "रोबोट के मस्तिष्क की बात सुनें"

इस शोध पत्र के लेखकों ने खोजा कि आधुनिक "फ्लो-बेस्ड" रोबट मस्तिष्क कैसे काम करते हैं। ये रोबोट केवल उत्तर नहीं देते; वे एक डिनोइजिंग (denoising) प्रक्रिया से गुजरते हैं। इसे एक मूर्तिकार की तरह समझें जो एक खुरदरे पत्थर के ब्लॉक (शोर/noise) से शुरुआत करता है और धीरे-धीरे अंतिम मूर्ति को प्रकट करने के लिए उसे तराशता है।

जैसे-जैसे रोबोट अपनी योजना को "तराशता" है, वह मध्यवर्ती अनुमान (intermediate guesses) लगाता है। लेखक ने पाया कि:

  1. जब चीजें आसान होती हैं (खाली स्थान में घूमना), तो रोबोट के अनुमान योजना को परिष्कृत (refine) करते समय बहुत स्थिर और सुसंगत होते जाते हैं।
  2. जब चीजें कठिन होती हैं (वस्तुओं को छूना, सटीकता की आवश्यकता होना), तो रोबोट के अनुमान सबसे अच्छे कदम को समझने की कोशिश में बहुत अधिक डगमगाते और उतार-चढ़ाव दिखाते हैं।

अंतर्दृष्टि (Insight): रोबोट की सोचने की प्रक्रिया में "डगमगाहट" (variance) का स्तर हमें यह संकेत देता है कि कब रुकना है और फिर से योजना बनानी है।

समाधान: DVAC (डिनोइजिंग-वेरिएंस एडेप्टिव चंकिंग)

टीम ने DVAC नामक एक विधि बनाई। एक निश्चित टाइमर या स्टेप काउंट का उपयोग करने के बजाय, DVAC एक स्मार्ट सुपरवाइजर की तरह काम करता है जो वास्तविक समय में रोबोट के मस्तिष्क की निगरानी करता है।

  • रूपक (Metaphor): कल्पना करें कि आप एक बच्चे को कहानी सुना रहे हैं।

    • यदि कहानी उबाऊ और अनुमानित है ("बिल्ली चटाई पर बैठी है"), तो आप पूछने से पहले कि "क्या आप और सुनना चाहते हैं?", एक पूरा पैराग्राफ पढ़ सकते हैं।
    • यदि कहानी रोमांचक और भ्रमित करने वाली हो जाती है ("अचानक ड्रैगन दिखाई दिया!"), तो आप तुरंत पढ़ना बंद कर देते हैं, बच्चे की ओर देखते हैं, और पूछते हैं, "अब हमें क्या करना चाहिए?"
  • DVAC कैसे काम करता है:

    1. यह रोबोट के एक्शन प्लान को अंतिम रूप देते समय उसके "डगमगाहट" (variance) पर नज़र रखता है।
    2. यदि डगमगाहट कम है (योजना स्थिर है), तो यह रोबोट को क्रियाओं का एक लंबा हिस्सा निष्पादित करने देता है।
    3. यदि डगमगाहट अचानक बढ़ जाती है (योजना अस्थिर है), तो यह कहता है, "रुको! योजना का वह हिस्सा बहुत अनिश्चित है।" यह सूची के केवल सुरक्षित, स्थिर हिस्से को निष्पादित करता है और तुरंत रोबोट से कठिन हिस्से के लिए एक नई योजना बनाने को कहता है।
    4. यह स्वचालित रूप से अपनी संवेदनशीलता को भी समायोजित करता है। यदि रोबोट एक सामान्य रूप से "डगमगाते" वातावरण में है, तो DVAC अधिक उदार हो जाता है; यदि वह "स्थिर" वातावरण में है, तो यह अधिक सख्त हो जाता है।

उन्होंने क्या पाया

टीम ने कई रोबोट सिमुलेशन बेंचमार्क (जैसे LIBERO, RoboTwin, और CALVIN) और यहाँ तक कि वास्तविक भौतिक रोबोटों पर इसका परीक्षण किया।

  • बेहतर सफलता: रोबोट कार्यों को पूरा करने में बेहतर हुए। उदाहरण के लिए, एक बेंचमार्क पर, सफलता दर 94.75% से बढ़कर 98.00% हो गई।
  • कम चिंता: रोबोटों को बार-बार रुकने और मदद मांगने की आवश्यकता नहीं पड़ी। उन्होंने "रीप्लान" (replan) करने की संख्या में लगभग 43% की कमी की।
  • वास्तविक दुनिया का प्रमाण: क्यूब्स को स्टैक करने या टेस्ट ट्यूब को हिलाने जैसे कार्यों को करने वाले वास्तविक रोबोटों पर, DVAC ने रोबोटों को निश्चित नियमों का उपयोग करने वाले रोबोटों की तुलना में तेज़ और अधिक सफल बनाया।

सारांश

संक्षेप में, यह शोध पत्र कहता है: अनुमान न लगाएं कि कब रुकना है; रोबोट की अपनी सोचने की प्रक्रिया को बताने दें। यह सुनकर कि रोबोट के अनुमान कितने "आत्मविश्वासी" या "डगमगाते" हैं, हम ऐसे रोबोट बना सकते हैं जो अधिक कुशल (बिना रुके अधिक काम करना) और अधिक सावधान (ठीक उसी समय रुकना जब चीजें कठिन हो जाएं) दोनों हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →