MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
MIRTH विजन-लैंग्वेज-एक्शन एजेंटों के लिए एक एकीकृत ढांचा है जो वर्तमान सिंगल-फ्रेम आर्किटेक्चर की सीमाओं को दूर करने के लिए ड्यूल-स्केल टेम्पोरल मेमोरी हब्स, म्यूचुअल-इन्फॉर्मेशन-ऑप्टिमाइज्ड लेटेंट रीजनिंग टोकन और एक पैरेलल वेक्टर-वाइज एक्शन डिकोडिंग स्कीम को एकीकृत करके प्रदर्शन और दक्षता को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को रात का खाना बनाना सिखा रहे हैं। आप उसे एक सरल निर्देश देते हैं: "कीवी को कटिंग बोर्ड पर रखें।"
वर्तमान रोबोट के दिमाग (जिन्हें VLA मॉडल कहा जाता है) एक ऐसे व्यक्ति की तरह हैं जो केवल अपने जीवन के अगले एक सेकंड को ही देख सकता है। यदि आप उन्हें एक चाकू थमाते हैं, तो वे चाकू को देखते हैं। यदि आप फिर चाकू को तौलिए से ढक देते हैं, तो वे तुरंत चाकू के अस्तित्व को भूल जाते हैं और काम करना बंद कर देते हैं। वे बड़े विचार ("रात का खाना बनाना") को छोटे शारीरिक आंदोलनों ("हाथ को 2 इंच दाईं ओर ले जाएं") से जोड़ने में भी संघर्ष करते हैं। और अंत में, वे धीमे हैं; उन्हें हर एक छोटे आंदोलन के बारे में एक-एक करके सोचना पड़ता है, जैसे कोई घोंघा एक अक्षर टाइप कर रहा हो।
यह पेपर MIRTH पेश करता है, जो रोबोट के दिमाग बनाने का एक नया तरीका है जो इन तीन समस्याओं को ठीक करता है। यह कैसे काम करता है, इसके लिए यहाँ सरल उपमाओं का उपयोग किया गया है:
1. "दोहरी-पैमाने वाली स्मृति" (कम ध्यान अवधि को ठीक करना)
वर्तमान रोबोटों में "टेम्पोरल मायोपिया" (निकट-दृष्टि दोष) होता है। यदि कोई वस्तु छिप जाती है, तो वे उसका पता खो देते हैं।
MIRTH रोबोट को दो प्रकार की स्मृति नोटबुक देता है:
- "लॉन्ग-टर्म वर्कस्पेस" नोटबुक: यह कमरे के लेआउट की एक धीमी और स्थिर स्मृति की तरह है। यह याद रखता है कि "कटिंग बोर्ड बाईं ओर है," भले ही रोबोट कुछ सेकंड के लिए इसे न देख पा रहा हो क्योंकि किसी चीज़ ने दृश्य को बाधित कर दिया है। यह इस स्मृति को सुचारू और स्थिर रखने के लिए एक विशेष गणितीय ट्रिक (एक्सपोनेंशियल मूविंग एवरेज) का उपयोग करता है।
- "शॉर्ट-टर्म मोशन" नोटबुक: यह एक तेज़ गति वाली नोटबुक है जो त्वरित परिवर्तनों को ट्रैक करती है, जैसे "कप तेज़ी से दाईं ओर जा रहा है।" यह पिछले कुछ सेकंड के मूवमेंट को विस्तृत विवरण के साथ याद रखती है।
उपमा: कल्पना कीजिए कि आप कार चला रहे हैं। "लॉन्ग-टर्म" स्मृति यह ज्ञान है कि हाईवे के एग्जिट जल्द ही आने वाले हैं। "शॉर्ट-टर्म" स्मृति आपके सामने वाली कार के अचानक ब्रेक मारने पर आपकी तत्काल प्रतिक्रिया है। MIRTH दोनों को जोड़ता है ताकि रोबोट अपना स्थान न खोए, भले ही कोई वस्तु छिप जाए।
2. "साइलेंट प्लानर" (तर्क अंतराल को ठीक करना)
रोबोट अक्सर मानवीय शब्दों को शारीरिक क्रियाओं में बदलने में संघर्ष करते हैं। वे या तो अंदाज़े से काम करते हैं या अटक जाते हैं क्योंकि शब्द और गतिविधियाँ आपस में मेल नहीं खाते।
MIRTH "लेटेंट रीजनिंग टोकन्स" पेश करता है।
- उपमा: कल्पना कीजिए कि एक रोबोट रेसिपी का पालन करने की कोशिश कर रहा है। हर कदम को चिल्लाकर बताने के बजाय ("चम्मच उठाओ, बाईं ओर ले जाओ, जार खोलो"), MIRTH उसके दिमाग के अंदर शांत, अदृश्य विचार बुलबुले (thought bubbles) बनाता है। ये शब्द नहीं हैं; ये शुद्ध "इरादा" हैं।
- सिस्टम को इन विचार बुलबुलों को इस तरह प्रशिक्षित किया गया है कि वे निर्देश ("दराज खोलें") और क्रिया (हाथ हिलाना) को जोड़ने के लिए बिल्कुल सही मात्रा में जानकारी रखें। यह एक गुप्त कोड की तरह है जो "आप क्या चाहते हैं" और "आप क्या करते हैं" के बीच के अंतर को पाटता है, बिना किसी इंसान द्वारा हर एक चाल के लिए मैनुअल लिखे।
3. "पैरेलल इंजन" (गति को ठीक करना)
पुराने रोबोट धीमे होते हैं क्योंकि वे "ऑटोरिग्र्रेसिव" होते हैं। इसका मतलब है कि वे एक छोटा सा मूवमेंट कैलकुलेट करते हैं, फिर अगला, फिर अगला, जैसे कोई व्यक्ति एक-एक अक्षर करके वाक्य लिख रहा हो। यदि एक रोबलेट को अपने हाथ को 6 दिशाओं में घुमाना है, तो उसे एक के बाद एक 6 अलग-अलग अक्षर लिखने होंगे।
MIRTH पैरेलल एक्शन डिकोडिंग का उपयोग करता है।
- उपमा: वाक्य को अक्षर-दर-अक्षर लिखने के बजाय, MIRTH पूरा शब्द एक साथ लिखता है। यह योजना को देखता है और एक ही झटके में पूरा मूवमेंट वेक्टर (सभी जोड़ों के लिए पूरी दिशा और गति) आउटपुट करता है।
- यह रोबोट को अविश्वसनीय रूप से तेज़ बनाता है, जिससे यह वास्तविक समय में प्रतिक्रिया करने में सक्षम होता है, ठीक वैसे ही जैसे कोई इंसान गेंद को पकड़ते समय करता है।
परिणाम: क्या हुआ?
शोधकर्ताओं ने MIRTH का परीक्षण दो स्थानों पर किया:
- एक वीडियो गेम सिमुलेशन (LIBERO) में: उन्होंने रोबोट को ऐसे कार्य दिए जिनमें लंबे समय तक चीजों को याद रखने की आवश्यकता थी, जैसे "दराज खोलें, चम्मच अंदर रखें, और इसे बंद करें।"
- परिणाम: MIRTH लगभग 100% समय सफल रहा। जब वस्तुएं छिप गईं या हिल गईं, तो वह भ्रमित नहीं हुआ; उसे याद रहा कि वे कहाँ थीं और उसने गलतियों से सुधार किया।
- एक वास्तविक रोबोटिक आर्म (LeRobot) में: उन्होंने वास्तविक रसोई में एक भौतिक रोबोट पर इस कोड को लगाया।
- परिणाम: रोबोट जटिल कार्य संभाल सका, जैसे श्रेणियों (जैसे "सभी लाल चीजों को यहाँ रखें") के आधार पर फलों और सब्जियों को व्यवस्थित करना। यह त्रुटियों से उबरने में अन्य रोबोटों की तुलना में बहुत बेहतर था। यदि उसने कोई फल गिरा दिया, तो उसने हार नहीं मानी; उसने समझा कि क्या गलत हुआ और फिर से प्रयास किया।
सारांश
MIRTH एक रोबोट ब्रेन अपग्रेड है जो:
- अतीत को याद रखता है (ताकि वह छिपी हुई वस्तुओं को न भूले)।
- एक गुप्त, कुशल भाषा में सोचता है ताकि शब्दों और क्रियाओं के बीच के अंतर को भरा जा सके।
- तेज़ी से चलता है क्योंकि यह अपने सभी आंदोलनों को एक-एक करके नहीं, बल्कि एक साथ कैलकुलेट करता है।
दावा किया गया है कि यह रोबोटों को वास्तविक दुनिया में जटिल, लंबे कार्यों को संभालने के लिए बहुत अधिक विश्वसनीय, तेज़ और सक्षम बनाता है। कोड और डेटा को दूसरों के उपयोग के लिए जारी किया जा रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।