← नवीनतम पेपर
🤖 AI

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH विजन-लैंग्वेज-एक्शन एजेंटों के लिए एक एकीकृत ढांचा है जो वर्तमान सिंगल-फ्रेम आर्किटेक्चर की सीमाओं को दूर करने के लिए ड्यूल-स्केल टेम्पोरल मेमोरी हब्स, म्यूचुअल-इन्फॉर्मेशन-ऑप्टिमाइज्ड लेटेंट रीजनिंग टोकन और एक पैरेलल वेक्टर-वाइज एक्शन डिकोडिंग स्कीम को एकीकृत करके प्रदर्शन और दक्षता को बढ़ाता है।

मूल लेखक: Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रात का खाना बनाना सिखा रहे हैं। आप उसे एक सरल निर्देश देते हैं: "कीवी को कटिंग बोर्ड पर रखें।"

वर्तमान रोबोट के दिमाग (जिन्हें VLA मॉडल कहा जाता है) एक ऐसे व्यक्ति की तरह हैं जो केवल अपने जीवन के अगले एक सेकंड को ही देख सकता है। यदि आप उन्हें एक चाकू थमाते हैं, तो वे चाकू को देखते हैं। यदि आप फिर चाकू को तौलिए से ढक देते हैं, तो वे तुरंत चाकू के अस्तित्व को भूल जाते हैं और काम करना बंद कर देते हैं। वे बड़े विचार ("रात का खाना बनाना") को छोटे शारीरिक आंदोलनों ("हाथ को 2 इंच दाईं ओर ले जाएं") से जोड़ने में भी संघर्ष करते हैं। और अंत में, वे धीमे हैं; उन्हें हर एक छोटे आंदोलन के बारे में एक-एक करके सोचना पड़ता है, जैसे कोई घोंघा एक अक्षर टाइप कर रहा हो।

यह पेपर MIRTH पेश करता है, जो रोबोट के दिमाग बनाने का एक नया तरीका है जो इन तीन समस्याओं को ठीक करता है। यह कैसे काम करता है, इसके लिए यहाँ सरल उपमाओं का उपयोग किया गया है:

1. "दोहरी-पैमाने वाली स्मृति" (कम ध्यान अवधि को ठीक करना)

वर्तमान रोबोटों में "टेम्पोरल मायोपिया" (निकट-दृष्टि दोष) होता है। यदि कोई वस्तु छिप जाती है, तो वे उसका पता खो देते हैं।

MIRTH रोबोट को दो प्रकार की स्मृति नोटबुक देता है:

  • "लॉन्ग-टर्म वर्कस्पेस" नोटबुक: यह कमरे के लेआउट की एक धीमी और स्थिर स्मृति की तरह है। यह याद रखता है कि "कटिंग बोर्ड बाईं ओर है," भले ही रोबोट कुछ सेकंड के लिए इसे न देख पा रहा हो क्योंकि किसी चीज़ ने दृश्य को बाधित कर दिया है। यह इस स्मृति को सुचारू और स्थिर रखने के लिए एक विशेष गणितीय ट्रिक (एक्सपोनेंशियल मूविंग एवरेज) का उपयोग करता है।
  • "शॉर्ट-टर्म मोशन" नोटबुक: यह एक तेज़ गति वाली नोटबुक है जो त्वरित परिवर्तनों को ट्रैक करती है, जैसे "कप तेज़ी से दाईं ओर जा रहा है।" यह पिछले कुछ सेकंड के मूवमेंट को विस्तृत विवरण के साथ याद रखती है।

उपमा: कल्पना कीजिए कि आप कार चला रहे हैं। "लॉन्ग-टर्म" स्मृति यह ज्ञान है कि हाईवे के एग्जिट जल्द ही आने वाले हैं। "शॉर्ट-टर्म" स्मृति आपके सामने वाली कार के अचानक ब्रेक मारने पर आपकी तत्काल प्रतिक्रिया है। MIRTH दोनों को जोड़ता है ताकि रोबोट अपना स्थान न खोए, भले ही कोई वस्तु छिप जाए।

2. "साइलेंट प्लानर" (तर्क अंतराल को ठीक करना)

रोबोट अक्सर मानवीय शब्दों को शारीरिक क्रियाओं में बदलने में संघर्ष करते हैं। वे या तो अंदाज़े से काम करते हैं या अटक जाते हैं क्योंकि शब्द और गतिविधियाँ आपस में मेल नहीं खाते।

MIRTH "लेटेंट रीजनिंग टोकन्स" पेश करता है।

  • उपमा: कल्पना कीजिए कि एक रोबोट रेसिपी का पालन करने की कोशिश कर रहा है। हर कदम को चिल्लाकर बताने के बजाय ("चम्मच उठाओ, बाईं ओर ले जाओ, जार खोलो"), MIRTH उसके दिमाग के अंदर शांत, अदृश्य विचार बुलबुले (thought bubbles) बनाता है। ये शब्द नहीं हैं; ये शुद्ध "इरादा" हैं।
  • सिस्टम को इन विचार बुलबुलों को इस तरह प्रशिक्षित किया गया है कि वे निर्देश ("दराज खोलें") और क्रिया (हाथ हिलाना) को जोड़ने के लिए बिल्कुल सही मात्रा में जानकारी रखें। यह एक गुप्त कोड की तरह है जो "आप क्या चाहते हैं" और "आप क्या करते हैं" के बीच के अंतर को पाटता है, बिना किसी इंसान द्वारा हर एक चाल के लिए मैनुअल लिखे।

3. "पैरेलल इंजन" (गति को ठीक करना)

पुराने रोबोट धीमे होते हैं क्योंकि वे "ऑटोरिग्र्रेसिव" होते हैं। इसका मतलब है कि वे एक छोटा सा मूवमेंट कैलकुलेट करते हैं, फिर अगला, फिर अगला, जैसे कोई व्यक्ति एक-एक अक्षर करके वाक्य लिख रहा हो। यदि एक रोबलेट को अपने हाथ को 6 दिशाओं में घुमाना है, तो उसे एक के बाद एक 6 अलग-अलग अक्षर लिखने होंगे।

MIRTH पैरेलल एक्शन डिकोडिंग का उपयोग करता है।

  • उपमा: वाक्य को अक्षर-दर-अक्षर लिखने के बजाय, MIRTH पूरा शब्द एक साथ लिखता है। यह योजना को देखता है और एक ही झटके में पूरा मूवमेंट वेक्टर (सभी जोड़ों के लिए पूरी दिशा और गति) आउटपुट करता है।
  • यह रोबोट को अविश्वसनीय रूप से तेज़ बनाता है, जिससे यह वास्तविक समय में प्रतिक्रिया करने में सक्षम होता है, ठीक वैसे ही जैसे कोई इंसान गेंद को पकड़ते समय करता है।

परिणाम: क्या हुआ?

शोधकर्ताओं ने MIRTH का परीक्षण दो स्थानों पर किया:

  1. एक वीडियो गेम सिमुलेशन (LIBERO) में: उन्होंने रोबोट को ऐसे कार्य दिए जिनमें लंबे समय तक चीजों को याद रखने की आवश्यकता थी, जैसे "दराज खोलें, चम्मच अंदर रखें, और इसे बंद करें।"
    • परिणाम: MIRTH लगभग 100% समय सफल रहा। जब वस्तुएं छिप गईं या हिल गईं, तो वह भ्रमित नहीं हुआ; उसे याद रहा कि वे कहाँ थीं और उसने गलतियों से सुधार किया।
  2. एक वास्तविक रोबोटिक आर्म (LeRobot) में: उन्होंने वास्तविक रसोई में एक भौतिक रोबोट पर इस कोड को लगाया।
    • परिणाम: रोबोट जटिल कार्य संभाल सका, जैसे श्रेणियों (जैसे "सभी लाल चीजों को यहाँ रखें") के आधार पर फलों और सब्जियों को व्यवस्थित करना। यह त्रुटियों से उबरने में अन्य रोबोटों की तुलना में बहुत बेहतर था। यदि उसने कोई फल गिरा दिया, तो उसने हार नहीं मानी; उसने समझा कि क्या गलत हुआ और फिर से प्रयास किया।

सारांश

MIRTH एक रोबोट ब्रेन अपग्रेड है जो:

  1. अतीत को याद रखता है (ताकि वह छिपी हुई वस्तुओं को न भूले)।
  2. एक गुप्त, कुशल भाषा में सोचता है ताकि शब्दों और क्रियाओं के बीच के अंतर को भरा जा सके।
  3. तेज़ी से चलता है क्योंकि यह अपने सभी आंदोलनों को एक-एक करके नहीं, बल्कि एक साथ कैलकुलेट करता है।

दावा किया गया है कि यह रोबोटों को वास्तविक दुनिया में जटिल, लंबे कार्यों को संभालने के लिए बहुत अधिक विश्वसनीय, तेज़ और सक्षम बनाता है। कोड और डेटा को दूसरों के उपयोग के लिए जारी किया जा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →