← नवीनतम पेपर
💻 computer science

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

ग्रैनुलोन (Granulon) एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो पिक्सेल-स्तरीय धारणा को मोटे-स्तर की सिमेंटिक्स के साथ गतिशील रूप से एकीकृत करने के लिए टेक्स्ट-कंडीशन्ड ग्रैनुलैरिटी कंट्रोलर और एडेप्टिव टोकन एग्रीगेशन द्वारा संवर्धित एक DINOv3-आधारित विजुअल एनकोडर का लाभ उठाता है, जो मौजूदा दृष्टिकोणों की तुलना में सटीकता में महत्वपूर्ण सुधार करता है और मतिभ्रम (hallucinations) को कम करता है।

मूल लेखक: Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप फोन पर अपने एक दोस्त को एक जटिल पेंटिंग का वर्णन करने की कोशिश कर रहे हैं।

  • पुराना तरीका (CLIP): आपके दोस्त के पास एक कैमरा है जो केवल पूरी पेंटिंग की एक बड़ी, धुंधली फोटो लेता है। वे आपको बता सकते हैं, "यह एक घर के साथ एक लैंडस्केप है," लेकिन यदि आप पूछते हैं, "दरवाजे का रंग क्या है?" या "छत पर कितनी खिड़कियां हैं?", तो उन्हें अनुमान लगाना पड़ता है क्योंकि विवरण धुंधलेपन में खो जाते हैं।
  • दूसरा तरीका (DINOv3): आपके दोस्त के पास एक सुपर-माइक्रोस्कोप है। वे ब्रश के हर एक स्ट्रोक और लकड़ी की बनावट को देख सकते हैं। लेकिन यदि आप पूछते हैं, "यह घर है या खलिहान (barn)?" तो वे भ्रमित हो जाते हैं क्योंकि वे इतने सूक्ष्म विवरणों पर ध्यान केंद्रित करते हैं कि वे बड़ी तस्वीर को मिस कर देते हैं।

Granulon एक नया, सुपर-स्मार्ट असिस्टेंट है जो इस समस्या को हल करता है। यह एक गिरगिट जैसे कैमरे (chameleon camera) की तरह काम करके दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है, जो आपके सवाल के आधार पर तुरंत अपने ज़ूम लेवल को बदल सकता है।

यहाँ इसका एक सरल विवरण दिया गया है कि यह कैसे काम करता है:

1. समस्या: "ज़ूम" की दुविधा

वर्तमान AI मॉडल एक ही ढर्रे में फंसे हुए हैं।

  • कुछ मॉडल बड़ी तस्वीर (ग्लोबल सिमेंटिक्स) समझने में माहिर हैं लेकिन छोटे विवरणों को पहचानने में खराब हैं।
  • अन्य मॉडल सूक्ष्म विवरणों (पिक्सेल-लेवल) को देखने में अद्भुत हैं लेकिन समग्र कहानी या संदर्भ को समझने में संघर्ष करते हैं।
  • एक साथ दोनों प्रकार के कैमरों का उपयोग करना धीमा और महंगा है, जैसे एक ही फोटो लेने के लिए दो फोटोग्राफरों को काम पर रखना।

2. समाधान: "Granulon" कैमरा

शोधकर्ताओं ने Granulon नामक एक नया AI बनाया है। AI को "ज़ूम आउट" या "ज़ूम इन" में से किसी एक को चुनने के लिए मजबूर करने के बजाय, Granulon के पास एक स्मार्ट रिमोट कंट्रोल है जो आपके सवाल के आधार पर तुरंत ज़ूम लेवल बदल देता है।

दो जादुई हिस्से:

A. "सवाल का जासूस" (The Controller)
इसे एक स्मार्ट असिस्टेंट के रूप में सोचें जो पहले आपके सवाल को सुनता है।

  • यदि आप पूछते हैं, "चित्र में किस प्रकार का जानवर है?" (एक बड़ी तस्वीर वाला सवाल), तो जासूस कैमरे को पूरे दृश्य को देखने के लिए ज़ूम आउट करने का निर्देश देता है।
  • यदि आप पूछते हैं, "कुत्ते के कान का रंग क्या है?" (एक सूक्ष्म विवरण वाला सवाल), तो जासूस उसे फर की बनावट देखने के लिए गहराई से ज़ूम इन करने का निर्देश देता है।
  • यह AI के देखने शुरू करने से पहले ही सही "विवरण का स्तर" तय कर देता है।

B. "स्मार्ट सारांशकर्ता" (AdaTA)
एक बार जब कैमरा सही स्तर पर ज़ूम हो जाता है, तो यह हिस्सा जानकारी को साफ करता है।

  • कल्पना कीजिए कि आप एक जंगल को देख रहे हैं। यदि आप ज़ूम आउट करते हैं, तो आपको हर एक पत्ते को देखने की आवश्यकता नहीं है; आपको बस "पेड़" को देखने की आवश्यकता है। यदि आप ज़ूम इन करते हैं, तो आपको "पत्ते" की आवश्यकता होती है।
  • स्मार्ट सारांशकर्ता समान पिक्सेल को व्यवस्थित, कॉम्पैक्ट "टोकन" (जानकारी के छोटे टुकड़े) में समूहित करता है। यह शोर (noise) को हटा देता है और केवल सबसे महत्वपूर्ण विवरणों को रखता है, जिससे यह सुनिश्चित होता है कि AI बहुत अधिक डेटा से अभिभूत न हो जाए।

3. यह क्यों मायने रखता है: कम "भ्रम" (Hallucination)

आज के AI की सबसे बड़ी समस्याओं में से एक है हैलुसिनेशन (hallucination)—चीजों को मनगढ़ंत बनाना।

  • यदि कोई AI बहुत अधिक "बड़ी तस्वीर" पर केंद्रित है, तो वह अनुमान लगा सकता है, "छत पर एक बिल्ली है," सिर्फ इसलिए क्योंकि उसे एक आकार दिखाई देता है जो बिल्ली जैसा दिखता है।
  • यदि वह विवरणों पर बहुत अधिक केंद्रित है, तो वह संदर्भ को भूलकर बारीक चीजों में उलझ सकता है।

Granulon इसे विवरण के स्तर को सवाल के साथ मिलाकर ठीक करता है। क्योंकि यह बिल्कुल सही मात्रा में विवरण देखता है, इसकी गलतियाँ करने की संभावना बहुत कम हो जाती है। पेपर दिखाता है कि यह इन "मनगढ़ंत" जवाबों को लगभग 20% कम करता है और पिछले मॉडलों की तुलना में 30% अधिक बार सही उत्तर देता है।

उपमा: जासूस और आवर्धक लेंस (Magnifying Glass)

कल्पना कीजिए कि एक जासूस अपराध सुलझा रहा है।

  • पुराना AI: जासूस या तो हेलीकॉप्टर से अपराध स्थल को देखता है (जमीन पर पड़े सुरागों को मिस कर देता है) या धूल के एक कण को माइक्रोस्कोप से देखता है (पूरे कमरे को मिस कर देता है)।
  • Granulon: जासूस के पास एक जादुई आवर्धक लेंस है।
    • जब जासूस को यह जानने की ज़रूरत होती है कि कमरे में कौन था, तो लेंस पूरे कमरे को दिखाने के लिए ज़ूम आउट हो जाता है।
    • जब जासूस को यह जानने की ज़रूरत होती है कि नोट पर क्या लिखा था, तो लेंस लिखावट पढ़ने के लिए ज़ूम इन हो जाता है।
    • जासूस विशिष्ट सुरागों के आधार पर इन दृश्यों के बीच तुरंत स्विच करता है।

मुख्य निष्कर्ष

Granulon AI को लचीला बनाना सिखाता है। यह कंप्यूटर को "बड़ी तस्वीर सोचने वाला" या "बारीकियों पर ध्यान देने वाला" होने के बीच चयन करने के लिए मजबूर करना बंद करता है। इसके बजाय, यह AI को दोनों बनने देता है, जो आपको सबसे सटीक, सत्यपूर्ण और विस्तृत उत्तर देने के लिए तुरंत गियर बदल सकता है। यह AI को ऐसे चश्मे देने जैसा है जो आपके देखने वाली चीज़ के अनुसार अपने प्रिस्क्रिप्शन को स्वचालित रूप से एडजस्ट कर लेते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →