← नवीनतम पेपर
🤖 AI

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+ एक प्लग-एंड-प्ले फ्रेमवर्क है जो प्रशिक्षण के दौरान गतिज रूप से महत्वपूर्ण, कम-वेग वाले खंडों को प्राथमिकता देने के लिए वेग-संचालित एक्शन अटेंशन (velocity-driven action attention) पेश करके रोबोटिक फाउंडेशन मॉडल्स को उन्नत करता है, जिससे बिना किसी अतिरिक्त पैरामीटर या संरचनात्मक संशोधनों के जटिल हेरफेर कार्यों पर प्रदर्शन में उल्लेखनीय सुधार होता है।

मूल लेखक: Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नाजुक काम करना सिखा रहे हैं, जैसे कि एक नाजुक अंडे को उठाना और उसे एक कटोरे में रखना।

वर्तमान में, अधिकांश रोबोट "मस्तिष्क" (जिन्हें फाउंडेशन मॉडल्स कहा जाता है) को एक ऐसे तरीके से प्रशिक्षित किया जाता है जो रोबोट द्वारा किए जाने वाले प्रत्येक आंदोलन को समान रूप से महत्वपूर्ण मानता है। यह एक संगीत शिक्षक की तरह है जो अपने छात्र के वार्म-अप स्केल्स को उतना ही ध्यान देता है जितना कि उसके सबसे कठिन, उच्च-गति वाले सोलो को। रोबोट खाली स्थान में अपने हाथ को तेजी से चलाने (वार्म-अप) को उतना ही महत्व देता है जितना कि अंडे को धीरे से नीचे रखने (सोलो) को।

समस्या क्या है? रोबोट अपने मस्तिष्क की शक्ति उन आसान, तेज़ आंदोलनों पर बर्बाद करता है और इसलिए धीरे-धीरे सटीक आंदोलनों को ठीक से नहीं सीख पाता है। यही कारण है कि रोबोट अक्सर कार्य के बिल्कुल अंतिम क्षण में विफल हो जाते हैं—वे अंडे को कटोरे तक तो ले जा सकते हैं, लेकिन वे उसे गिरा देते हैं क्योंकि उन्होंने "धीमे और स्थिर" वाले हिस्से का पर्याप्त अभ्यास नहीं किया था।

एटेनए+ (AttenA+): द "स्पीड-सेंसिटिव" टीचर

इस शोध पत्र के लेखक, AttenA+, एक सरल लेकिन शक्तिशाली समाधान प्रस्तावित करते हैं: रोबोट को तब अधिक ध्यान देने के लिए सिखाएं जब वह धीरे चल रहा हो।

यह कैसे काम करता है, इसके कुछ उदाहरण यहाँ दिए गए हैं:

1. सीखने का "ट्रैफिक लाइट" सिस्टम

रोबोट के प्रशिक्षण डेटा को एक लंबे हाईवे की तरह समझें।

  • उच्च गति (तेज ट्रैफिक): जब रोबोट तेजी से चल रहा होता है (जैसे खाली हाईवे पर गाड़ी चलाना), तो छोटी गलतियाँ मायने नहीं रखतीं। यदि वह थोड़ा सा भटक भी जाए, तो भी ठीक है। पुराने प्रशिक्षण तरीके में, रोबोट इन तेज़ क्षणों को भी धीमी गति वाले क्षणों की तरह ही गहराई से पढ़ता था।
  • कम गति (धीमा ट्रैफिक): जब रोबोट धीमा हो जाता है (जैसे स्टॉप साइन या पैदल यात्री के पास पहुँचते समय), तो हर मिलीमीटर मायने रखता है। यहाँ एक छोटी सी त्रुटि भी दुर्घटना का कारण बन सकती है।

AttenA+ रोबोट के सीखने के लिए एक स्मार्ट ट्रैफिक लाइट सिस्टम की तरह काम करता है। यह रोबोट की गति को देखता है और कहता है: "हे, तुम तेज़ चल रहे हो? यह आसान है, इसे बस ऊपर से देख लो। लेकिन देखो, तुम अभी बहुत धीरे चल रहे हो! यह वह महत्वपूर्ण क्षण है जहाँ तुम अंडा गिरा सकते हो। आइए, इस हिस्से को 10 गुना अधिक ध्यान से और गहराई से पढ़ें।"

2. "प्लग-एंड-प्ले" लेंस

AttenA+ की सबसे अच्छी बातों में से एक यह है कि इसके लिए रोबोट के मस्तिष्क को फिर से बनाने की आवश्यकता नहीं है।

  • कल्पना कीजिए कि आपके पास एक हाई-एंड कैमरा है। बेहतर फोटो लेने के लिए आपको नया कैमरा खरीदने की ज़रूरत नहीं है; आपको बस एक विशेष लेंस फिल्टर लगाने की आवश्यकता है।
  • AttenA+ वही फिल्टर है। इसे लगभग किसी भी मौजूदा रोबोट मॉडल (चाहे वह "डिस्क्रिमिनेटिव" मॉडल हो जो अगले कदम की भविष्यवाणी करता है, या "जेनरेटिव" मॉडल जो एक पूरा प्लान बनाता है) के साथ जोड़ा जा सकता है, बिना मूल हार्डवेयर या सॉफ्टवेयर को बदले। यह बस रोबोट द्वारा सीखे जाने वाले पाठों के भार (वेट्स) को बदल देता है।

3. परिणाम: "अच्छे" से "बेहतरीन" तक

शोधकर्ताओं ने दो प्रमुख रोबोट "परीक्षा बोर्डों" (LIBERO और RoboTwin नामक डेटासेट) पर और लैब में एक वास्तविक रोबोट आर्म पर इसका परीक्षण किया।

  • परीक्षा के परिणाम: AttenA+ से पहले, सर्वश्रेष्ठ रोबोट मॉडल इन परीक्षणों में लगभग 97% से 98% अंक प्राप्त कर रहे थे। AttenA+ के साथ, वे 98.6% और कठिन परीक्षणों पर 92.4% तक पहुँच गए।
  • वास्तविक दुनिया: जब उन्होंने इसे एक वास्तविक फ्रैंका (Franka) रोबोट आर्म पर आजमाया, तो रोबोट कठिन हिस्सों में बहुत बेहतर हो गया। उदाहरण के लिए, कई वस्तुओं को हिलाने वाले कार्य में, सफलता दर 90% से बढ़कर 98% हो गई।

कमी (सीमाएं)

लेखक ईमानदार हैं कि यह "स्पीड-सेंसिंग" तकनीक कहाँ काम नहीं कर सकती:

  • तेज़ होना कभी-कभी महत्वपूर्ण होता है: यह तरीका यह मान लेता है कि "धीमा = महत्वपूर्ण"। लेकिन क्या होगा यदि कार्य एक बेसबॉल पकड़ना हो? इस मामले में, तेज़ गति वाला हिस्सा ही महत्वपूर्ण होगा। AttenA+ भ्रमित हो सकता है क्योंकि यह प्राथमिकता देने के लिए धीमी गति वाले आंदोलनों की तलाश करता है।
  • यह केवल गति को देखता है: रोबोट वर्तमान में केवल यह देखता है कि वह कितनी तेजी से चल रहा है। वह अभी तक यह "महसूस" नहीं कर सकता कि वह कितना दबाव (फोर्स) डाल रहा है या कितना घुमाव (टॉर्क) दे रहा है, जो कुछ कार्यों के लिए महत्वपूर्ण हो सकता है।

मुख्य निष्कर्ष

AttenA+ रोबोट को प्रशिक्षित करने का एक नया तरीका है जो सभी आंदोलनों को समान मानने से रोकता है। यह समझते हुए कि धीमी गति का अर्थ आमतौर पर "यह कठिन हिस्सा है" होता है, रोबोट अपनी सीखने की ऊर्जा ठीक वहीं केंद्रित करता है जहाँ इसकी सबसे अधिक आवश्यकता होती है। यह दृष्टिकोण में एक सरल बदलाव है जो रोबोटों को उन नाजुक और सटीक कार्यों में काफी अधिक विश्वसनीय बनाता है जिन्होंने उन्हें अब तक पीछे रखा हुआ था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →