← नवीनतम पेपर
🤖 machine learning

DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

DF-ExpEnse एक सैंपल-एफिशिएंट एक्सप्लोरेशन तकनीक है जो प्रीट्रेन जेनरेटिव रोबोटिक पॉलिसियों को फाइनट्यून करने के लिए मल्टीमॉडल मॉडलिंग और क्रिटिक एनसेम्बल्स का लाभ उठाती है ताकि ऑनलाइन डेटा कलेक्शन को ऑप्टिमाइज़ किया जा सके और फ्लीट सेटिंग्स में कोलैबोरेटिव एक्सप्लोरेशन को सक्षम बनाया जा सके।

मूल लेखक: Calvin Luo, Chen Sun, Shuran Song

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Calvin Luo, Chen Sun, Shuran Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट है जिसने हजारों वीडियो देखकर पहले से ही कई कौशल सीख लिए हैं (जैसे ब्लॉक को एक के ऊपर एक रखना या चलना)। यह रोबोट एक प्रतिभाशाली छात्र की तरह है जिसने पाठ्यपुस्तक से कड़ी मेहनत करके पढ़ाई की है। अब, आप इसे वास्तविक दुनिया में अभ्यास करने देकर और भी बेहतर कौशल सिखाना चाहते हैं।

वास्तविक दुनिया में अभ्यास करना महंगा और धीमा है। यदि रोबोट केवल यादृच्छिक (random) चीजें करने की कोशिश करता है, तो वह असफल होकर बहुत सारा समय बर्बाद कर देगा। यदि वह केवल वही करता है जो उसे लगता है कि सबसे अच्छा है, तो वह एक ही ढर्रे में फंस सकता है और चीजों को करने के वास्तव में सबसे अच्छे तरीके को कभी नहीं सीख पाएगा।

DF-ExpEnse एक नया "स्मार्ट प्रैक्टिस" (समझदार अभ्यास) तरीका है जिसे रोबोट को कम प्रयासों से तेजी से सीखने में मदद करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ इसके सरल अवधारणाओं में विवरण दिया गया है:

1. "टेस्टिंग मेनू" (डिफ्यूजन फ़िल्टरिंग - Diffusion Filtering)

सामान्य तौर पर, एक रोबोट को अनंत संभावित गतिविधियों में से एक को चुनना होता है (एक निरंतर एक्शन स्पेस)। यादृच्छिक रूप से चुनना एक ऐसे रेस्टोरेंट में सबसे अच्छे व्यंजन को खोजने जैसा है जिसका मेनू अनंत वस्तुओं का है।

DF-Expense इसे अपने रोबोट के मौजूदा "दिमाग" (प्रीट्रेनड डिफ्यूजन पॉलिसी) का उपयोग करके कैंडिडेट मूव्स (संभावित चालों) की एक छोटी, प्रबंधनीय सूची बनाकर हल करता है—जैसे कि एक शेफ द्वारा 3 या 4 बेहतरीन व्यंजनों का "टेस्टिंग मेनू" पेश करना। ये केवल तुक्के नहीं हैं; ये उच्च-गुणवत्ता वाले विकल्प हैं जिन्हें रोबोट का दिमाग आज़माने लायक समझता है।

2. "आलोचकों का पैनल" (एन्सेम्बल अनसर्टेन्टी - Ensemble Uncertainty)

एक बार जब रोबोट के पास अपनी चालों की संक्षिप्त सूची आ जाती है, तो वह वास्तव में किसे करने का निर्णय लेता है?

  • लालची दृष्टिकोण (The Greedy Approach): बस उस चाल को चुनें जो उसे अभी सबसे अधिक स्कोर देगी। (यह जोखिम भरा है; यह एक "जाल" हो सकता है जो अच्छा दिखता है लेकिन वास्तव में नहीं है)।
  • DF-Expense दृष्टिकोण: यह एक आलोचकों के पैनल (AI न्यायाधीशों का एक समूह) का उपयोग करके शॉर्टलिस्ट की जांच करता है।
    • वे दो प्रश्न पूछते हैं: "यह चाल कितनी अच्छी है?" और "हम उस स्कोर के बारे में कितने निश्चित हैं?"
    • यदि न्यायाधीश सभी एक चाल को महान बताते हैं, तो यह एक सुरक्षित दांव है।
    • यदि न्यायाधीशों के बीच असहमति है (कुछ इसे महान कहते हैं, अन्य इसे बुरा कहते हैं), तो इसका मतलब है कि रोबोट अनिश्चित (uncertain) है। यह अनिश्चितता वास्तव में एक संकेत है कि वह चाल दिलचस्प है और आज़माने लायक है!

DF-Expense उस चाल को चुनता है जो सबसे अच्छा संतुलन प्रदान करती है: यह संभवतः अच्छी है, लेकिन यह भी कुछ ऐसा है जिसे रोबोट ने अभी तक पूरी तरह से समझा नहीं है। यह एक छात्र द्वारा उस विषय को पढ़ने जैसा है जिसमें वह लगभग कुशल है, बजाय इसके कि वह केवल उसी चीज़ को बार-बार पढ़े जिसे वह पहले से ही पूरी तरह जानता है।

3. "ग्रुप हडल" (फ्लीट नॉर्मलाइजेशन - Fleet Normalization)

कल्पना कीजिए कि आपके पास रोबोटों का एक पूरा बेड़ा (एक टीम) है जो एक ही समय में अभ्यास कर रहा है।

  • पुराना तरीका: प्रत्येक रोबोट अकेले अभ्यास करता है। वे सभी गलती से एक ही "सुरक्षित" चाल चुन सकते हैं, जिससे टीम का समय बर्बाद होता है क्योंकि वे बार-बार एक ही डेटा एकत्र कर रहे होते हैं।
  • DF-Expense तरीका: कोई भी चाल चलने से पहले, रोबोट एक-दूसरे से बात करते हैं। वे साझा करते हैं कि उनके "आलोचकों के पैनल" ने उनके विकल्पों के बारे में क्या सोचा।
    • यदि रोबोट A एक ऐसी चाल पर विचार कर रहा है जिसे रोबोट B ने पहले ही आज़माया और उसमें महारत हासिल कर ली है, तो रोबोट A को एहसास होगा, "ओह, यह टीम के लिए नया नहीं है," और वह कुछ और चुनेगा।
    • यह सुनिश्चित करता है कि पूरी टीम मिलकर विभिन्न और विविध रास्तों का पता लगाए, जिससे उनकी सीखने की प्रक्रिया बहुत अधिक कुशल हो जाती है।

4. "सेफ्टी नेट" (BC-SR)

जैसे-जैसे रोबोट किसी कार्य में बेहतर होते जाते हैं, वे कभी-कभी "आलसी" हो जाते हैं और केवल उन्हीं कुछ चालों को आज़माने लगते हैं जिन्हें वे जानते हैं कि वे काम करती हैं। इसे रोकने के लिए, DF-Expense में एक सेफ्टी नेट है। यह कभी-कभी रोबोट को उसके मूल प्रशिक्षण (अभ्यास शुरू करने से पहले) से एक चाल देखने के लिए मजबूर करता है। यह सुनिश्चित करता है कि रोबोट उन विविध तरीकों को न भूले जिनसे उसे मूल रूप से सिखाया गया था, जिससे उसके विकल्प खुले रहते हैं।

परिणाम

इन तीन विचारों को जोड़कर—एक स्मार्ट शॉर्टलिस्ट बनाना, दिलचस्प अनिश्चितताओं को खोजने के लिए न्यायाधीशों के पैनल का उपयोग करना, और टीम के सहयोग को बढ़ावा देना—DF-Expense रोबोटों को नए कौशल बहुत तेज़ी से सीखने में मदद करता है।

पेपर के प्रयोगों में, DF-Expense का उपयोग करने वाले रोबोटों ने मानक तरीकों वाले रोबोटों की तुलना में कम अभ्यास प्रयासों के साथ वस्तुओं (जैसे कैन उठाना या औजार लटकाना) को नियंत्रित करना (चलना या दौड़ना) सीखा। वे कम डेटा के साथ उच्च सफलता दर तक पहुँचे, जिससे सिद्ध हुआ कि "अभ्यास की मात्रा" से अधिक "अभ्यास की गुणवत्ता" मायने रखती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →