← नवीनतम पेपर
🤖 AI

MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

MIRAGE मोबाइल एजेंटों के लिए एक ऐसा फ्रेमवर्क है जो भविष्य की इंटरफ़ेस अवस्थाओं के साथ संरेखित कॉम्पैक्ट, निरंतर लेटेंट रीजनिंग रिप्रेजेंटेशन सीखकर निष्पादन दक्षता और प्रदर्शन को बढ़ाता है, जिससे स्पष्ट रीजनिंग मॉडल्स की क्षमताओं को बनाए रखते हुए या उनसे बेहतर होते हुए, धीमे, टोकन-भारी टेक्स्टुअल चेन्स ऑफ थॉट की आवश्यकता को समाप्त किया जा सके।

मूल लेखक: Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपना स्मार्टफोन चलाना सिखा रहे हैं। आप उसे कहते हैं, "Amazon ऐप खोलें और एक किताब खरीदें।"

पुराना तरीका (Explicit Reasoning):
वर्तमान में, अधिकांश AI रोबोट इसे "ज़ोर से सोचने" के माध्यम से हल करते हैं। स्क्रीन को छूने से पहले, वे अपने विचारों की एक लंबी, दृश्य सूची बनाते हैं जैसे कि कोई इंसान खुद से बात कर रहा हो:
"ठीक है, मुझे होम स्क्रीन दिख रही है। मुझे Amazon आइकन ढूंढना होगा। यह आमतौर पर ऊपर होता है। मैं ऐप ड्रॉअर खोलने के लिए स्वाइप अप करूँगा। अब मुझे लिस्ट दिख रही है। मैं Amazon पर टैप करूँगा।"

हालाँकि यह रोबोट को चीज़ों को समझने में मदद करता है, लेकिन यह बहुत धीमा है। रोबोट को स्क्रीन को छूने से पहले अपने विचार प्रक्रिया का हर शब्द टाइप करना पड़ता है। यह एक ऐसे ड्राइवर की तरह है जिसे मुड़ने से पहले हर यात्री को मैप ज़ोर से पढ़कर सुनाना पड़ता है। यह बहुत समय बर्बाद करता है, बहुत अधिक "दिमागी शक्ति" (कंप्यूटिंग टोकन) का उपयोग करता है, और इससे इंटरैक्शन सुस्त महसूस होता है।

नया तरीका (MIRAGE):
यह पेपर MIRAGE को पेश करता है, जो एक नया सिस्टम है जो रोबोट को अपने ही दिमाग के अंदर "चुपचाप सोचने" के लिए सिखाता है।

अपने विचारों को टाइप करने के बजाय, MIRAGE छिपे हुए मानसिक नोट्स (जिसे "लेटेंट रीजनिंग" कहा जाता है) का उपयोग करता है। यह अपनी आंतरिक मेमोरी में सोचता है, योजना बनाता है और यह अनुमान लगाता है कि अगली स्क्रीन कैसी दिखेगी। यह केवल तभी बोलता है जब यह अंतिम कमांड देने के लिए तैयार होता है: "Amazon पर टैप करें।"

MIRAGE कैसे काम करता है, इसके लिए तीन सरल रूपकों (metaphors) का उपयोग किया गया है:

1. "मौन रिहर्सल" (Latent Reasoning)

कल्पना कीजिए कि एक अभिनेता एक दृश्य के लिए तैयारी कर रहा है।

  • पुराना तरीका: अभिनेता संवाद बोलने से पहले निर्देशक को पूरी स्क्रिप्ट ज़ोर से पढ़कर सुनाता है।
  • MIRAGE: अभिनेता अपने दिमाग में पूरी स्क्रिप्ट को दोहराता है, हर भावना और गतिविधि की कल्पना करता है, लेकिन पर्दा उठने तक कुछ नहीं बोलता। वह केवल अंतिम पंक्ति बोलता है।
  • परिणाम: रोबोट बहुत तेज़ी से निर्णय लेता है क्योंकि वह "टाइपिंग" वाले हिस्से को छोड़ देता है। यह काम पूरा करने के लिए लगभग 3 से 5 गुना कम समय लेता है और बहुत कम शब्दों का उपयोग करता है।

2. "समानांतर मस्तिष्क" (APLR)

आमतौर पर, सोचना चरण-दर-चरण होता है: चरण 1, फिर चरण 2, फिर चरण 3। इसमें समय लगता है।
MIRAGE एक तकनीक का उपयोग करता है जिसे APLR (Approximate Parallel Latent Refinement) कहा जाता है।

  • रूपक: कल्पना कीजिए कि संपादकों की एक टीम एक दस्तावेज़ को ठीक कर रही है। एक व्यक्ति द्वारा एक पैराग्राफ ठीक करने और फिर अगले व्यक्ति को अगला पैराग्राफ ठीक करने के लिए देने के बजाय (जो कि धीमा और क्रमिक है), MIRAGE के पास संपादकों की एक टीम है जो पूरे दस्तावेज़ पर एक साथ काम करती है, और राउंड में मिलकर अपने विचारों को परिष्कृत करती है।
  • परिणाम: रोबلة एक साधारण विचार जितनी तेज़ी से जटिल, बहु-चरणीय सोच (multi-step thinking) कर सकता है, बिना प्रोसेसिंग की लंबी कतार में फंसे।

3. "क्रिस्टल बॉल" (World Model)

एक स्मार्ट रोबोट केवल यह नहीं जानता कि क्या करना है; वह यह भी जानता है कि उसके करने के बाद क्या होगा।

  • रूपक: दरवाजा धकेलने से पहले, आप कल्पना करते हैं कि वह कैसे खुलेगा। MIRAGE के पास एक "क्रिस्टल बॉल" (World Model) है जो वर्तमान को छूने से पहले ही भविष्यवाणी करता है कि अगली स्क्रीन कैसी दिखेगी।
  • कैसे काम करता है: रोबोट अपने छिपे हुए विचारों को देखता है और पूछता है, "यदि मैं ऊपर स्वाइप करता हूँ, तो क्या मुझे ऐप ड्रॉअर दिखाई देगा?" वह अपनी भविष्यवाणी की तुलना वास्तविक भविष्य की छवि से करता है। यदि भविष्यवाणी गलत होती है, तो वह तुरंत सीख जाता है। यह रोबोट को भटकने या भ्रमित होने से बचाता है, भले ही वह अपने विचारों को लिख नहीं रहा हो।

यह क्यों मायने रखता है?

पेपर ने वास्तविक Android फोन कार्यों (जैसे ऐप्स खोलना, ईमेल भेजना, या सेटिंग्स नेविगेट करना) पर MIRAGE का परीक्षण किया।

  • गति: यह अन्य शीर्ष रोबोटों की तुलना में 1 से 2 गुना तेज़ था क्योंकि इसने अपने विचार टाइप करने में समय बर्बाद नहीं किया।
  • दक्षता: इसने कार्य पूरा करने के लिए 75% कम शब्दों (टोकन) का उपयोग किया।
  • बुद्धिमत्ता: चुपचाप सोचने के बावजूद, यह समस्याओं को हल करने में उन रोबोटों के समान (या बेहतर) था जो ज़ोर से सोचते हैं। वास्तव में, कुछ परीक्षणों में, इसने समान आकार के रोबोटों की तुलना में सफलता दर में 10 अंक से अधिक का सुधार किया।

सारांश में:
MIRAGE एक निंजा रोबोट की तरह है। अपनी युद्ध योजना को दुनिया के सामने चिल्लाने के बजाय, यह चुपचाप सोचता है, भविष्य की भविष्यवाणी करता है, और सटीकता के साथ प्रहार करता है। यह काम को तेज़ी से, सस्ते में और कम "शोर" के साथ पूरा करता है, यह साबित करते हुए कि सोचने के लिए आपको बोलने की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →