← नवीनतम पेपर
💻 computer science

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

पॉलिसीट्रिम (PolicyTrim) एक सुदृढीकरण अधिगम (reinforcement learning) आधारित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो विश्वसनीय एक्शन चंक की लंबाई को गतिशील रूप से बढ़ाकर और अनावश्यक भौतिक चरणों को समाप्त करके विजन-लैंग्वेज-एक्शन मॉडल्स की आंतरिक दक्षता को बढ़ाता है, जिसके परिणामस्वरूप कार्य की सफलता दर से समझौता किए बिना 5.83×\times तक एंड-टू-एंड परिनियोजन (deployment) गति में वृद्धि होती है।

मूल लेखक: Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक है जो दुनिया को देख सकता है, आपके बोले गए निर्देशों को समझ सकता है, और अपने हाथों को हिलाकर कटोरा उठाने या ब्लॉक सजाने जैसे काम कर सकता है। यह रोबोट एक "दिमाग" का उपयोग करता है जिसे विज़न-लैंग्वेज-एक्शन (VLA) मॉडल कहा जाता है।

हालाँकि, एक समस्या है: भले ही यह रोबोट बुद्धिमान है, लेकिन असल ज़िंदगी में यह अक्सर भद्दा और धीमा होता है। यह न केवल सोचने में बहुत समय लेता है; बल्कि एक काम पूरा करने के लिए यह बहुत अधिक शारीरिक कदम भी उठाता है।

यह शोध पत्र इस समस्या को ठीक करने के लिए PolicyTrim नामक एक नया प्रशिक्षण तरीका पेश करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

दो बड़ी समस्याएँ

लेखकों ने पाया कि वर्तमान रोबोटों को दो विशिष्ट अक्षमताओं का सामना करना पड़ता है:

  1. "धुंधला संकेत" की समस्या (अविश्वसनीय योजना):
    रोबोट के दिमाग को एक ऐसे व्यक्ति की तरह समझें जो कागज पर लिखी निर्देशों की एक लंबी सूची पढ़ने की कोशिश कर रहा है। निर्देशों के ऊपर का हिस्सा स्पष्ट है, लेकिन जैसे-जैसे आप सूची के अंत (पूंछ) की ओर बढ़ते हैं, लिखावट खराब और पढ़ने में कठिन होती जाती है।
  • क्या होता है: रोबोट एक साथ कई गतिविधियों का एक क्रम (एक "चंक") अनुमानित करता है। लेकिन क्योंकि चंक के अंत में "लिखावट" धुंधली हो जाती है, इसलिए रोबोट बाद के कदमों में गलतियाँ कर देता है।
  • परिणाम: रोबोट एक चाल चलने की कोशिश करता है, गलत अनुमान के कारण विफल होता है, रुकता है, दुनिया को फिर से देखता है, और फिर से योजना बनाने लगता है। यह बार-बार गणना करने में समय बर्बाद करता है।
  1. "अति-सुधार" की समस्या (अनावश्यक कदम):
    कल्पना करें कि एक इंसान मेज पर कप रखने की कोशिश कर रहा है। वह हाथ बढ़ाता है, थोड़ा चूक जाता है, पीछे खींचता है, फिर से हाथ बढ़ाता है, डगमगाता है, और फिर अंत में उसे रखता है।
  • क्या होता है: रोबोट खुद को सुधारने के लिए बहुत अधिक छोटे, अनावश्यक कदम उठाता है। वह एक सीधी रेखा के बजाय एक टेढ़ा-मेढ़ा, ज़िग-ज़ैग रास्ता अपनाता है।
  • परिणाम: भले ही रोबोट अंततः सफल हो जाए, लेकिन उसने ज़रूरत से दोगुने शारीरिक मूवमेंट किए।

समाधान: PolicyTrim

लेखकों ने रोबोट के हार्डवेयर या मस्तिष्क की संरचना को बदले बिना इन समस्याओं को ठीक करने के लिए एक दो-चरणीय प्रशिक्षण कार्यक्रम (एक व्यक्तिगत ट्रेनर की तरह) बनाया है।

चरण 1: "भरोसेमंद क्षितिज" को आगे बढ़ाना

  • उपमा: कल्पना करें कि एक छात्र परीक्षा दे रहा है। आमतौर पर, शिक्षक उसे अपना काम चेक करने से पहले केवल पहले 5 प्रश्नों के उत्तर देने की अनुमति देते हैं। छात्र और अधिक प्रश्न हल करने से डरता है क्योंकि उसे लगता है कि वह गलत हो जाएगा।
  • समाधान: PolicyTrim रोबोट को एक बार में अधिक प्रश्नों (कदमों के एक लंबे क्रम) का उत्तर देने के लिए प्रोत्साहित करता है।
  • यह कैसे काम करता है: सिस्टम रोबोट को तब विशेष इनाम देता है जब वह बिना रुके और दोबारा चेक किए, अनुमानित कदमों की एक लंबी सूची का सफलतापूर्वक उपयोग करके कार्य पूरा करता है। यह धीरे-धीरे रोबोट को अपनी भविष्यवाणियों पर आगे तक भरोसा करने के लिए प्रेरित करता है, जिससे उसे बार-बार रुककर "सोचने" की आवश्यकता कम हो जाती है।

चरण 2: "बर्बाद कदमों" को काटना

  • उपमा: कल्पना करें कि एक धावक जानता है कि फिनिश लाइन 100 मीटर दूर है। एक भद्दा धावक 100 मीटर दौड़ सकता है, महसूस कर सकता है कि वह रास्ते से भटक गया है, 10 मीटर पीछे दौड़ सकता है, फिर 15 मीटर आगे दौड़ सकता है, और अंत में समाप्त कर सकता है। एक समझदार धावक सीधे वहां जाता है।
  • समाकाशन: PolicyTrim रोबोट को सबसे छोटा, सबसे सीधा रास्ता लेने के लिए सिखाता है।
  • यह कैसे काम करता है: सिस्टम रोबोट को कम शारीरिक कदमों में कार्य पूरा करने के लिए पुरस्कृत करता है। हालाँकि, इसमें एक पेच है: यदि रोबोट "शॉर्टकट" लेने की कोशिश करता है जो तेज़ दिखता है लेकिन वास्तव में एक इत्तेफाक है (जैसे फिसलकर गलती से लक्ष्य पर लैंड करना), तो सिस्टम उसे दंडित करता है। यह रोबोट को एक विश्वसनीय शॉर्टकट खोजने के लिए मजबूर करता है, न कि केवल भाग्यशाली शॉर्टकट के लिए।

परिणाम

इस प्रशिक्षण के बाद, रोबोट बहुत अधिक कुशल हो गए:

  • उन्होंने अपने "चंक" का बेहतर उपयोग किया: वे दोबारा योजना बनाने के लिए रुकने से पहले अपनी भविष्यवाणियों पर 3 गुना अधिक समय तक भरोसा कर सके।
  • वे कम चले: उन्होंने कार्य पूरा करने के लिए आवश्यक शारीरिक कदमों की संख्या को लगभग 50% कम कर दिया।
  • वे तेज़ हो गए: क्योंकि वे कम बार रुके और कम कदम चले, कार्य पूरा करने का कुल समय 5.8 गुना तक तेज़ हो गया।
  • वे कम बुद्धिमान नहीं हुए: तेज़ चलने और कम कदम उठाने के बावजूद, वे अधिक बार विफल नहीं हुए; वे पहले की तरह ही सफलता की दर बनाए रखे हुए थे।

यह क्यों महत्वपूर्ण है

पिछले अधिकांश शोधों ने रोबोट को तेज़ बनाने के लिए उनके "मस्तिष्क" को छोटा या तेज़ बनाने की कोशिश की (जैसे कंप्यूटर प्रोसेसर को अपग्रेड करना)। यह शोध पत्र कहता है, "रुकिए, दिमाग ठीक है; समस्या रणनीति की है।"

PolicyTrim एक ड्राइवर को तेज़ कार खरीदने के बजाय कुशलता से गाड़ी चलाना सिखाने जैसा है। यह मौजूदा स्पीड-अप ट्रिक्स के साथ मिलकर काम करता है, जिसका अर्थ है कि आप प्रदर्शन में और भी बड़ा उछाल पाने के लिए उन्हें मिला सकते हैं। लेखकों ने तीन अलग-अलग प्रकार के रोबोट मॉडल पर और कंप्यूटर सिमुलेशन और वास्तविक भौतिक रोबोट दोनों में इसका परीक्षण किया, और यह सभी के लिए काम कर गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →