← नवीनतम पेपर
💻 computer science

ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models

ActDistill एक सामान्य एक्शन-गाइडेड सेल्फ-डिराइव्ड डिस्टिलेशन फ्रेमवर्क पेश करता है जो डायनेमिक रूटिंग के साथ लाइटवेट विजन-लैंग्वेज-एक्शन मॉडल्स को प्रशिक्षित करने के लिए एक्शन प्रायर्स और एक ग्राफ-स्ट्रक्चर्ड टीचर का लाभ उठाता है, जिससे पूर्ण-पैमाने के मॉडल्स के तुलनीय प्रदर्शन प्राप्त होता है जबकि गणना को 50% से अधिक कम किया जाता है और इन्फरेंस लेटेंसी को काफी कम किया जाता है।

मूल लेखक: Wencheng Ye, Tianshi Wang, Lei Zhu, Fengling Li, Guoli Yang, Hengtao Shen

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wencheng Ye, Tianshi Wang, Lei Zhu, Fengling Li, Guoli Yang, Hengtao Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय रोबोट शेफ है। यह शेफ (शिक्षक/Teacher) एक बिखरी हुई रसोई को देख सकता है, एक जटिल रेसिपी पढ़ सकता है और एक बेहतरीन भोजन बना सकता है। लेकिन एक पेच है: यह शेफ एक विशालकाय है। वे अपने साथ हर संभव सामग्री का एक विशाल पुस्तकालय और अपने सिर में एक सुपरकंप्यूटर लेकर चलते हैं। एक साधारण सैंडविच बनाने के लिए भी, वे चाकू उठाने से पहले ब्रेड के प्रकारों का पूरा विश्वकोश पढ़ने में 10 मिनट खर्च कर सकते हैं।

यही वर्तमान विज़न-लैंग्वेज-एक्शन (VLA) मॉडल्स की समस्या है। वे अविश्वसनीय रूप से स्मार्ट हैं और अद्भुत काम कर सकते हैं, लेकिन वे वास्तविक समय (real-time) में रोबोट (जैसे कि एक रोबोट वैक्यूम या फैक्ट्री आर्म) के उपयोग के लिए बहुत धीमे हैं और उन्हें बहुत अधिक कंप्यूटिंग पावर की आवश्यकता होती है।

ActDistill से मिलिए। इसे एक "स्मार्ट प्रशिक्षु" (apprenticeship) कार्यक्रम के रूप में सोचें जिसे एक हल्के वजन वाले छात्र शेफ (Lightweight Student Chef) को तैयार करने के लिए डिज़ाइन किया गया है, जो वास्तविक खाना बनाने में उतना ही कुशल है, लेकिन उसे उस विशाल पुस्तकालय या सुपरकंप्यूटर की आवश्यकता नहीं है।

ActDistil कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से बताया गया है:

1. समस्या: "अति-विचार करने वाला" (The Over-Thinker)

रोबोट्स के लिए अधिकांश दक्षता युक्तियाँ (efficiency tricks) इस तरह हैं जैसे विशाल शेफ को कहना, "हे, बस किताब के पहले 50 पन्ने पढ़ना छोड़ दो।" इससे थोड़ी मदद तो मिलती है, लेकिन यह एक कुंद उपकरण (blunt instrument) है। यह यह नहीं समझता कि शेफ क्यों पढ़ रहा है।

  • दोष: विशाल शेफ केवल बेतरतीब ढंग से नहीं पढ़ रहा है; वे "विजुअल्स + भाषा" को "एक्शन" में अनुवादित कर रहे हैं। यदि आप केवल पन्ने काट देते हैं, तो आप गलती से उस हिस्से को भी काट सकते हैं जो शेफ को बताता है कि चाकू को कैसे पकड़ना है। रोबलेट रेसिपी तो समझ जाएगा लेकिन अपने हाथ को सही ढंग से चलाने में विफल हो सकता है।

2. समाधान: "एक्शन-गाइडेड मैप" (The Action-Guided Map)

ActDistill खेल बदल देता है। केवल पन्ने काटने के बजाय, यह पूछता है: "शेफ के मस्तिष्क के कौन से हिस्से वास्तव में हाथ हिलाने के लिए आवश्यक हैं?"

यह ग्राफ-स्ट्रक्चर्ड एनकैप्सुलेशन (Graph-Structured Encapsulation) नामक तकनीक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि शेफ का मस्तिष्क एक विशाल, बिखरा हुआ शहर है जिसमें लाखों सड़कें हैं। अधिकांश सड़कें बंद रास्तों (अप्रासंगिक बैकग्राउंड शोर) की ओर ले जाती हैं। ActDistill एक विशेष मानचित्र (ग्राफ) खींचता है जो केवल "रेसिपी" को "हाथ की हरकत" से जोड़ने वाले सीधे, हाई-स्पीड हाईवे को हाइलाइट करता है।
  • यह दर्शनीय मार्गों (scenic routes/background noise) को अनदेखा करता है और पूरी तरह से उस पथ पर ध्यान केंद्रित करता है जो एक्शन की ओर ले जाता है (कप पकड़ना, दराज खोलना)।

3. छात्र: "डायनेमिक राउटर" (The Dynamic Router)

एक बार जब मानचित्र खींच लिया जाता है, तो ActDistill एक छात्र रोबोट बनाता है। यह छात्र छोटा और तेज़ है। लेकिन यहाँ जादू है: छात्र के पास एक डायनेमिक राउटर (एक स्मार्ट ट्रैफिक कंट्रोलर की तरह) है।

  • यह कैसे काम करता है: जब छात्र किसी कार्य को देखता है, तो ट्रैफिक कंट्रोलर "एक्शन मैप" को देखता है।
    • कार्य: "लाल कप उठाओ।" -> कंट्रोलर कहता है, "ठीक है, हमें 'पकड़ने' (grasping) वाले हाईवे की आवश्यकता है, लेकिन हम 'फर्नीचर अरेंजमेंट' वाले हाईवे को छोड़ सकते हैं।"
    • कार्य: "दराज खोलो।" -> कंट्रोलर कहता है, "कप वाले हाईवे को छोड़ो, हैंडल वाले हाईवे पर ध्यान केंद्रित करो।"
  • छात्र अपने मस्तिष्क के केवल उन विशिष्ट हिस्सों को चलाता है जो उस सटीक क्षण के लिए आवश्यक हैं। यह एक ऐसे शेफ की तरह है जो पूरे किचन को सजाकर रखने के बजाय केवल वर्तमान चरण के लिए आवश्यक विशिष्ट उपकरणों को बाहर निकालता है।

4. प्रशिक्षण: "केवल पढ़ने से नहीं, बल्कि करके सीखने से" (Learning by Doing, Not Just Reading)

छात्र शिक्षक के माध्यम से सेल्फ-डिराइव्ड डिस्टिलेशन (Self-Derived Distillation) सीखता है।

  • केवल शिक्षक के अंतिम उत्तर की नकल करने के बजाय, छात्र एक्शन के संबंध में शिक्षक की आंतरिक विचार प्रक्रिया की नकल करने की कोशिश करता है।
  • शिक्षक कहता है, "मैं कप के हैंडल के बारे में सोच रहा हूँ।" छात्र भी वहीं ध्यान केंद्रित करना सीखता है।
  • यदि छात्र एक ऐसा कदम छोड़ देता है जो एक्शन के लिए महत्वपूर्ण है, तो शिक्षक "लाल बत्ती" (दंड) देता है। यदि छात्र एक ऐसा कदम छोड़ देता है जो मायने नहीं रखता, तो शिक्षक "हरी बत्ती" देता है।
  • समय के साथ, छात्र सीख जाता है कि उसके मस्तिष्क के कौन से स्तर रोबोटिक आर्म को चलाने के लिए आवश्यक हैं और कौन से केवल "फालतू" (fluff) हैं।

परिणाम: एक सुपर-एफिशिएंट रोबोट

प्रशिक्षण के बाद, छात्र रोबोट को तैनात किया जाता है।

  • शिक्षक: सोचने में 10 सेकंड लेता है, अपनी 100% मस्तिष्क शक्ति का उपयोग करता है।
  • ActDistill छात्र: 6 सेकंड लेता है, अपनी केवल 40% मस्तिष्क शक्ति का उपयोग करता है, लेकिन बिल्कुल वही मूव्स करता है

संक्षेप में:
ActDistill एक रोबोट को गंतव्य तक जाने के लिए आवश्यक सड़कों के मानचित्र को दिखाकर ड्राइविंग सिखाने जैसा है, बजाय इसके कि उसे शहर की हर गली को याद करने के लिए मजबूर किया जाए। यह रोबोट को जटिल कार्यों को नेविगेट करने के लिए स्मार्ट बनाए रखता है लेकिन वास्तविक समय में चलाने के लिए पर्याप्त तेज़ भी रखता है, जिससे उन्नत रोबोटिक्स हमारे रोजमर्रा के जीवन के लिए व्यावहारिक बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →