← नवीनतम पेपर
💬 NLP

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

SpecEyes एक एजेंटिक-स्तर का स्पेक्युलेटिव एक्सेलेरेशन फ्रेमवर्क है जो एक कॉग्निटिव गेटिंग मैकेनिज्म और एक हेटेरोजेनियस पैरेलल फनल के साथ एक लाइटवेट मॉडल को स्पेक्युलेटिव प्लानर के रूप में उपयोग करता है ताकि सटीकता को बनाए रखते हुए या उसे बढ़ाते हुए मल्टीमॉडल LLMs की लेटेंसी को महत्वपूर्ण रूप से कम किया जा सके और थ्रूपुट में सुधार किया जा सके।

मूल लेखक: Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

प्रकाशित 2026-03-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अति-बुद्धिमान लेकिन बहुत धीमा जासूस (Agentic Multimodal LLM) है। यह जासूस जटिल दृश्य रहस्यों को सुलझाने में माहिर है, जैसे कि 4K फोटो में एक छोटा सा टाइपो (लिखने की गलती) ढूंढना या यह पता लगाना कि भीड़ भरे कमरे में बिल्ली ठीक कहाँ छिपी है। इसे करने के लिए, इस जासूस के पास एक विशेष टूलकिट है: वे ज़ूम इन कर सकते हैं, इमेज को क्रॉप कर सकते हैं, टेक्स्ट पढ़ सकते हैं और चीजों को अलग-अलग कोणों से देख सकते हैं।

हालाँकि, एक बड़ी समस्या है: जासूस बेहद धीमा है।

क्यों? क्योंकि वे एक सख्त, चरण-दर-चरण प्रक्रिया के साथ काम करते हैं।

  1. वे पूरी तस्वीर देखते हैं।
  2. वे तय करते हैं, "मुझे बाईं ओर ज़ूम करने की आवश्यकता है।"
  3. वे ज़ूम पूरा होने का इंतज़ार करते हैं।
  4. वे ज़muş किए हुए हिस्से को देखते हैं।
  5. वे तय करते हैं, "अब मुझे यहाँ टेक्स्ट पढ़ना चाहिए।"
  6. वे टेक्स्ट पढ़े जाने का इंतज़ार करते हैं।
    ...और इसी तरह।

यदि आप 100 लोगों को इस जासूस को काम पर रखने के लिए कहते हैं, तो उन सभी को एक कतार में खड़ा होना होगा। जासूस एक समय में एक व्यक्ति के लिए एक ही चरण कर सकता है। इसे "स्टेटफुल बॉटलनेक" (Stateful Bottleneck) कहा जाता है। यह एक सिंगल-लेन ब्रिज की तरह है जहाँ हर कार को एक-एक करके गुजरना पड़ता है, भले ही आगे का रास्ता खाली क्यों न हो।

पेश है: SpecEyes (एक "तेज़ अंतर्ज्ञान" प्रणाली)

SpecEyes के पीछे के शोधकर्ताओं ने महसूस किया कि कुछ भी सवाल वास्तव में जासूस के धीमे, चरण-दर-चरण टूलकिट की आवश्यकता नहीं होती है।

कभी-कभी, आप बस पूछते हैं, "कार का रंग क्या है?" इसका उत्तर मुख्य फोटो से ही स्पष्ट है। आपको ज़ूम करने या साइन पढ़ने की आवश्यकता नहीं है। लेकिन धीमा जासूस यह अभी तक नहीं जानता; वे बिना सोचे-समझे अपनी लंबी, महंगी प्रक्रिया शुरू कर देते हैं।

SpecEyes एक "फास्ट इंट्यूशनिस्ट" (एक छोटा, हल्का AI मॉडल) को दरवाजे पर खड़ा करता है। यह कैसे काम करता है, इसके लिए एक सरल उपमा देखें:

1. "फास्ट इंट्यूशनिस्ट" बनाम "स्लो डिटेक्टिव"

एक व्यस्त एयरपोर्ट सुरक्षा लाइन की कल्पना करें।

  • धीमा जासूस (The Slow Detective) फुल-बॉडी स्कैनर और बैग की मैन्युअल जांच है। यह गहन है लेकिन प्रति व्यक्ति 10 मिनट लेता है।
  • फास्ट इंट्यूशनिस्ट (The Fast Intuitionist) एक सुरक्षा गार्ड है जो एक त्वरित नज़र डालता है। वे यात्री को देखकर कह सकते हैं, "आप ठीक लग रहे हैं, स्कैनर की ज़रूरत नहीं है," या "आप संदिग्ध लग रहे हैं, स्कैनर के पास जाएँ।"

SpecEyes में:

  • फास्त इंट्यूशनिस्ट इमेज और सवाल को देखता है। यदि यह एक आसान सवाल है (जैसे "कार का रंग क्या है?"), तो इंट्यूशनिस्ट तुरंत उत्तर देता है। किसी टूल की आवश्यकता नहीं। इंतज़ार करने की कोई ज़रूरत नहीं।
  • यदि इंट्यूशनिस्ट अनिश्चित है, या यदि सवाल स्पष्ट रूप से कठिन है (जैसे "कोने में रखे छोटे बॉक्स पर सीरियल नंबर ढूंढें"), तो वे कहते हैं, "मैं पक्का नहीं हूँ, उन्हें धीमे जासूस के पास भेजें।"

2. "कॉन्फिडेंस गेट" (संज्ञानात्मक गेटिंग)

फास्ट इंट्यूशनिस्ट को कैसे पता चलता है कि उसे खुद पर कब भरोसा करना चाहिए?
आमतौर पर, AI मॉडल यह जानने में खराब होते हैं कि वे कब केवल अनुमान लगा रहे हैं। वे गलत होने पर भी कह सकते हैं कि वे "99% सुनिश्चित" हैं।

SpecEyes "आंसर सेपरेबिलिटी" (Answer Separability) नामक एक चतुर तकनीक का उपयोग करता है।

  • कल्पना करें कि इंट्यूशनिस्ट उत्तर का अनुमान लगा रहा है।
  • खराब अनुमान (Bad Guess): मॉडल सोचता है कि उत्तर "लाल" है, लेकिन वह यह भी काफी आश्वस्त है कि यह "नारंगी" या "गुलाबी" भी हो सकता है। इनके स्कोर एक-दूसरे के बहुत करीब हैं। यह कम सेपरेबिलिटी (low separability) है। सिस्टम कहता है, "इस पर भरोसा न करें; इसे धीमे जासूस के पास भेजें।"
  • अच्छा अनुमान (Good Guess): मॉडल सोचता है कि "लाल" के साथ बहुत अधिक स्कोर है, और "नारंगी" को लगभग शून्य अंक मिलते हैं। अंतर बहुत बड़ा है। यह उच्च सेपरेबिलिटी (high separability) है। सिस्टम कहता है, "यह एक स्पष्ट जीत है! चलिए धीमे जासूस को स्किप करते हैं।"

यह गेट यह सुनिश्चित करता है कि हम केवल तभी धीमे प्रोसेस को स्किप करें जब हम वाकई आश्वस्त हों, ताकि हम अपनी सटीकता न खो दें।

3. "पैरेलल फनल" (गति का जादू)

यहाँ असली जादू है।

  • धीमा जासूस "स्टेटफुल" (stateful) है। वे व्यक्ति B पर जाने से पहले व्यक्ति A के लिए किए गए कार्यों को याद रखते हैं। इसका मतलब है कि वे व्यक्ति A और व्यक्ति B पर एक साथ काम नहीं कर सकते। वे एक सिंगल लेन में फंसे हुए हैं।
  • फास्ट इंट्यूशनिस्ट "स्टेटलेस" (stateless) है। उन्हें अतीत की परवाह नहीं है। वे एक ही समय में 100 लोगों को देख सकते हैं और तुरंत 100 उत्तर दे सकते हैं।

SpecEyes एक फनल (कीप) सेट करता है:

  1. 100 लोग आते हैं।
  2. फास्ट इंट्यूशनिस्ट उन सभी को एक साथ देखता है (समानांतर/Parallel!)।
  3. मान लीजिए उनमें से 80 आसान सवाल हैं। इंट्यूशनिस्ट उन्हें तुरंत हल कर देता है।
  4. केवल शेष 20 कठिन सवाल धीमे जासूस के पास जाते हैं।
  5. धीमे जासूस को अब 100 के बजाय केवल 20 लोगों को संभालना पड़ता है।

चूंकि धीमा जासूस अब केवल "कठिन" मामलों को संभाल रहा है, इसलिए पूरा सिस्टम 1.7 से 3.3 गुना तेज़ हो जाता है।

परिणाम

इस पेपर ने तीन अलग-अलग प्रकार के विजुअल पहेलियों पर इसका परीक्षण किया:

  • आसान चीजें (V Bench):* सिस्टम बहुत तेज़ था और वास्तव में इसने अधिक सवालों के सही उत्तर दिए क्योंकि इसने उन "हैलुसिनेशन" (गलतियों) से बचा जो धीमे जासूस के अत्यधिक सोचने (over-thinking) से होते हैं।
  • कठिन चीजें (HR-Bench): यहाँ भी, जहाँ कई सवालों के लिए धीमे जासूस की आवश्यकता होती है, सिस्टम ने आसान सवालों को पहले ही फिल्टर करके गति बढ़ा दी।
  • तुलना: अन्य तरीकों ने धीमे जासूस को टोकन तेजी से अनुमान लगाने के लिए प्रेरित करने की कोशिश की, लेकिन उन्हें फिर भी पूरी लंबी प्रक्रिया करनी पड़ती थी। SpecEyes आसान सवालों के लिए पूरी प्रक्रिया को ही छोड़ देता है।

सारांश

SpecEyes एक चतुर सहायक को नियुक्त करने जैसा है जो आपके व्यस्त बॉस तक पहुँचने से पहले आपकी डाक को छाँटता है।

  • पहले: बॉस हर एक पत्र पढ़ता है, यहाँ तक कि स्पैम और "हैप्पी बर्थडे" नोट्स भी, एक-एक करके।
  • अब: सहायक जल्दी से डाक को छाँटता है। वे "हैप्पी बर्थडे" नोट्स को तुरंत संभाल लेते हैं। वे केवल जटिल कानूनी दस्तावेजों को ही बॉस के पास भेजते हैं।
  • परिणाम: बॉस का काम कम हो जाता है, डाक तेजी से प्रोसेस होती है, और बॉस अभी भी कठिन चीजों को पूरी तरह से संभालता है।

यह AI सिस्टम को उनकी बुद्धिमत्ता से समझौता किए बिना तेज़, सस्ता और अधिक कुशल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →