← नवीनतम पेपर
💬 NLP

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

यह शोध पत्र मल्टीमॉडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल्स में "देखना पर न सोचना" (Seeing but Not Thinking) की घटना की पहचान और समाधान करता है, जहाँ विज़ुअल इनपुट्स रूटिंग मैकेनिज्म को कार्य-प्रासंगिक रीजनिंग एक्सपर्ट्स को कम सक्रिय करने के लिए प्रेरित करते हैं, और एक रूटिंग-गाइडेड हस्तक्षेप का प्रस्ताव करता है जो उचित एक्सपर्ट एक्टिवेशन सुनिश्चित करके जटिल विज़ुअल रीजनिंग प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Seeing but Not Thinking" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: "आंखें खुली, दिमाग सो रहा है" की घटना

कल्पना कीजिए कि आपके पास MoE (Mixture of Experts) नाम का एक बहुत ही बुद्धिमान छात्र है। इस छात्र के दिमाग के अंदर 100 अलग-अलग ट्यूटर्स (शिक्षकों) का एक पुस्तकालय है, लेकिन किसी भी विशेष प्रश्न के लिए, वह केवल उनमें से कुछ को ही मदद के लिए जगाता है।

शोधकर्ताओं ने MoE के साथ कुछ अजीब होते देखा:

  • परिदृश्य A (टेक्स्ट): आप MoE को कागज के एक टुकड़े पर लिखा हुआ गणित का एक शब्द-समस्या (word problem) देते हैं। MoE इसे पढ़ता है, गहराई से सोचता है, और सही उत्तर देता है।
  • परिदृश्य B (इमेज): आप उसी गणित की समस्या को एक व्हाइटबोर्ड पर लिखते हैं, उसकी एक फोटो खींचते हैं, और MoE को वह तस्वीर दिखाते हैं। MoE उस फोटो को देखता है, हर नंबर और अक्षर को सही ढंग से पढ़ लेता है (बेहतरीन दृष्टि!), लेकिन फिर भी गलत उत्तर दे देता है।

शोधकर्ता इसे "देखना लेकिन न सोचना" (Seeing but Not Thinking) कहते हैं। मॉडल की आंखें पूरी तरह खुली हैं, लेकिन उसका सोचने वाला दिमाग सो रहा है।

जांच: यह क्यों हो रहा है?

टीम ने पूछा: क्या मॉडल चित्र पढ़ने में खराब है?
नहीं। उन्होंने जांच की, और मॉडल चित्र में लिखे टेक्स्ट को पूरी तरह से पढ़ सकता था।

फिर उन्होंने पूछा: क्या मॉडल इसलिए भ्रमित है क्योंकि "चित्र" और "शब्द" उसके लिए अलग महसूस होते हैं?
नहीं। उन्होंने पाया कि मॉडल के भीतर गहराई में, चित्र और शब्द वास्तव में उसके मस्तिष्क की मध्य परतों (middle layers) में एक ही "भाषा" साझा करते हैं। मॉडल चित्र के अर्थ को अच्छी तरह समझता है।

असली अपराधी: "भटका हुआ ट्रैफिक पुलिस वाला" (The Distracted Traffic Cop)

तो, यदि मॉडल देख और समझ सकता है, तो वह विफल क्यों होता है? यह पेपर एक नया विचार पेश करता है जिसे रूटिंग डिस्ट्रैक्शन (Routing Distraction) कहा जाता है।

मॉडल के दिमाग को कई विशेषज्ञ विभागों (Experts) वाले एक व्यस्त कार्यालय भवन के रूप में सोचें:

  • विजुअल विभाग (Visual Department): आकृतियों और रंगों को पहचानने में कुशल।
  • मैथ विभाग (Math Department): तर्क संबंधी पहेलियों को हल करने में कुशल।
  • लैंग्वेज विभाग (Language Department): व्याकरण में कुशल।

एक सामान्य कार्यालय में, एक मैनेजर (Router) कार्य को देखता है और सही विभाग को बुलाता है।

  • टेक्स्ट टास्क: मैनेजर "गणित की समस्या" देखता है और मैथ विभाग को बुलाता है।
  • इमेज टास्क: मैनेजर "एक चित्र में गणित की समस्या" देखता है।

यहाँ एक गड़बड़ी है: जब कार्य एक इमेज के रूप में आता है, तो मैनेजर "विजुअल विभाग" से विचलित हो जाता है। भले ही समस्या एक गणितीय पहेली हो, मैनेजर फाइल को पहले विजुअल विभाग को भेज देता है, या टीम को इस तरह विभाजित कर देता है जिससे मैथ विभाग के पास कर्मचारियों की कमी रह जाती है।

मॉडल मूल रूप से तस्वीर को इतनी गहराई से देख रहा है कि वह गणित करना भूल जाता है। प्रक्रिया के बीच में "विजुअल" विशेषज्ञ ध्यान खींच लेते हैं, जिससे "रीज़निंग" (तर्क करने वाले) विशेषज्ञों का स्थान खाली हो जाता है।

समाधान: "धक्का" या "नज" (The Nudge)

इसे ठीक करने के लिए, शोधकर्ताओं ने एक रूटिंग-गाइडेड इंटरवेंशन (Routing-Guided Intervention) का आविष्कार किया।

कल्पना कीजिए कि मैनेजर (Router) फाइल को विजुअल विभाग में भेजने वाला है। शोधकर्ता बीच में आते हैं और धीरे से मैनेजर के हाथ को नज (nudge/हल्का सा इशारा) करते हैं, कहते हैं, "हे, याद रखो, यह एक गणित की समस्या है! सुनिश्चित करो कि मैथ विभाग को काम का एक बड़ा हिस्सा मिले।"

उन्होंने पूरे मॉडल को फिर से प्रशिक्षित नहीं किया (जो महंगा और धीमा है)। उन्होंने बस सोचने की प्रक्रिया के दौरान "ट्रैफिक सिग्नल" को समायोजित किया ताकि यह सुनिश्चित हो सके कि मैथ एक्सपर्ट्स सक्रिय हों, भले ही वे एक चित्र देख रहे हों।

परिणाम

जब उन्होंने इस "नज" को तीन अलग-अलग AI मॉडल्स पर लागू किया:

  1. यह काम कर गया। मॉडल इमेज-आधारित गणित की समस्याओं को बहुत बेहतर तरीके से हल करने लगे।
  2. यह स्मार्ट था। "नज" ने केवल मॉडल को अनुमान लगाने के लिए मजबूर नहीं किया; इसने मॉडल को काम के लिए सही उपकरण का उपयोग करने में मदद की।
  3. यह सामान्यीकृत (Generalized) हुआ। यहाँ तक कि जब चित्र जटिल थे (जैसे ग्राफ या ज्यामितीय आकृतियाँ), तब भी "मैथ डिपार्टमेंट" को जगाने से परिणामों में सुधार हुआ।

मुख्य निष्कर्ष

यह पेपर हमें सिखाता है कि आधुनिक AI छवियों को देखते समय अनिवार्य रूप से "मूर्ख" नहीं है। यह बस भटका हुआ है। यह दृश्य विवरणों (visual details) को प्रोसेस करने में इतना केंद्रित हो जाता है कि यह "रीज़निंग मोड" में स्विच करना भूल जाता है। अपने दिमाग के भीतर सही "विशेषज्ञों" को जगाने के लिए मैन्युअल रूप से मार्गदर्शन करके, हम इसे एक तस्वीर देखते समय भी स्पष्ट रूप से सोचने में मदद कर सकते हैं।

संक्षेप में: AI अंधा नहीं है; यह बस काम के लिए गलत विभाग को देख रहा है। हमें बस इसे सही दिशा में संकेत देने की आवश्यकता थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →