HueManity: Probing Fine-Grained Visual Perception in MLLMs
यह शोध पत्र HueManity को प्रस्तुत करता है, जो इशिहारा-शैली (Ishihara-style) की छवियों का उपयोग करने वाला एक बड़े पैमाने का बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में मनुष्यों और विशिष्ट मॉडलों की तुलना में सूक्ष्म दृश्य धारणा (fine-grained visual perception) में एक महत्वपूर्ण कमी है, बावजूद इसके कि उनकी उच्च-स्तरीय तर्क क्षमताएं सुदृढ़ हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट है जो किताबें पढ़ सकता है, कविताएं लिख सकता है और किसी पेंटिंग के जटिल दृश्यों का वर्णन कर सकता है। आप सोच सकते हैं, "अगर यह इतना स्मार्ट है, तो यह निश्चित रूप से सब कुछ स्पष्ट रूप से देख सकता है, है ना?"
पेपर "HueManity" कहता है: "इतनी जल्दी नहीं।"
शोधकर्ताओं ने यह देखने के लिए एक विशेष परीक्षण बनाया कि क्या ये "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (MLLMs)—जो कई चैटबॉट्स के पीछे के एआई (AI) दिमाग हैं—वास्तव में सूक्ष्म विवरणों को देख सकते हैं, या वे केवल उस आधार पर अनुमान लगा रहे हैं जो उन्होंने पहले पढ़ा है।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. परीक्षण: "अदृश्य स्याही" की पहेली
शोधकर्ताओं ने 83,850 छवियों का एक विशाल पुस्तकालय बनाया। प्रत्येक छवि रंगीन, बिखरे हुए बिंदुओं का एक ढेर जैसी दिखती है, जो बिल्कुल इशिहारारा कलर ब्लाइंडनेस टेस्ट (Ishihara color blindness tests) के समान है जिसे आपने डॉक्टर के पास देखा होगा।
- चाल (The Trick): बिखरे हुए बिंदुओं के अंदर दो अक्षर या संख्याएं छिपी हुई हैं (जैसे "42" या "X7")।
- चुनौती: उन्हें खोजने के लिए, आपको शोर (noise) को अनदेखा करना होगा और अक्षरों के आकार बनाने वाले सूक्ष्म रंग अंतरों को पहचानना होगा।
- लक्ष्य: यह "सोचने" या "तर्क करने" के बारे में नहीं है। यह पूरी तरह से देखने के बारे में है। क्या एआई घास के ढेर में सुई ढूंढ सकता है?
2. परिणाम: इंसान बनाम एआई (AI)
शोधकर्ताओं ने इस परीक्षण को मनुष्यों, एक मानक कंप्यूटर विजन प्रोग्राम (ResNet50), और आज के नौ सबसे स्मार्ट एआई मॉडलों (जैसे GPT-4, Claude, और LLaVA) पर चलाया।
- इंसान: लगभग पूर्ण थे। उन्होंने संख्याओं और अक्षरों को तुरंत देख लिया (99% और 93% सटीकता)।
- मानक कंप्यूटर विज़न: इसने भी शानदार प्रदर्शन किया (96% और 94%)। यह एक प्रशिक्षित आंख की तरह है जो ठीक जानती है कि क्या देखना है।
- "स्मार्ट" एआई मॉडल: वे बुरी तरह विफल रहे।
- सबसे अच्छा एआई मॉडल केवल 33% सरल संख्या परीक्षण सही कर पाया।
- कठिन अक्षर/संख्या परीक्षणों पर, सबसे अच्छे एआई ने केवल 3% सही किया।
- अन्य अधिकांश मॉडलों का स्कोर 0% से 1% के बीच था।
उपमा (Analogy): एक ऐसे जीनियस की कल्पना करें जिसने लाइब्रेरी की हर किताब पढ़ी है और उसे एक पन्ने पर अदृश्य स्याही से लिखा गया विशिष्ट शब्द ढूंढने के लिए कहा गया है। वह जीनियस उस शब्द की अवधारणा (concept) को जानता हो सकता है, लेकिन वह पन्ने पर उस स्याही को वास्तव में देख नहीं सकता। वह सच्चाई देखने के बजाय जवाबों का "भ्रम" (hallucinating) पैदा कर रहा है।
3. एआई क्यों विफल हुआ?
पेपर सुझाव देता है कि एआई "मूर्ख" नहीं है, बल्कि इसमें एक विशिष्ट अंधा बिंदु (blind spot) है:
- "बड़ी तस्वीर" (Big Picture) पर बहुत अधिक ध्यान: ये एआई किसी छवि के अर्थ (जैसे, "यह एक चटाई पर बैठी बिल्ली है") को समझने के लिए प्रशिक्षित होते हैं। वे बड़ी तस्वीर समझने में इतने अच्छे हैं कि वे सूक्ष्म, बिखरे हुए विवरणों (बिंदुओं के विशिष्ट रंगों और आकारों) को अनदेखा कर देते हैं।
- अनुमान लगाने पर निर्भरता: जब एआई बिंदुओं को नहीं देख पाता, तो वह भाषा के पैटर्न के आधार पर अनुमान लगाने की कोशिश करता है। यह उस छात्र की तरह है जिसे गणित का सवाल नहीं पता लेकिन वह एक उत्तर का अनुमान लगाता है क्योंकि वह सुनने में वैसा ही लगता है जैसा उसने पहले सुना हो।
- "आंख मींचने" का प्रभाव (The "Squinting" Effect): दिलचस्प बात यह है कि जब शोधकर्ताओं ने छवियों को और अधिक धुंधला (कम रिज़ॉल्यूशन) बनाया, तो एक एआई मॉडल वास्तव में बेहतर हो गया। ऐसा लगता है कि एआई को आकार का अनुमान लगाने के लिए "शोर" को सुचारू (smooth out) करने की आवश्यकता होती है, न कि वास्तव में विवरणों को देखने की।
4. वह "जादुई ट्रिक" जो काम नहीं आई
शोधकर्ताओं ने एआई को यह परीक्षण करना "सिखाने" की कोशिश की:
- उदाहरण दिखाना: उन्होंने एआई को पहले कुछ उदाहरण दिखाए। इससे कोई मदद नहीं मिली।
- फाइन-ट्यूनिंग (Fine-Tuning): उन्होंने एआई को विशेष रूप से इन पहेलियों पर फिर से प्रशिक्षित करने की कोशिश की। इससे भी कोई मदद नहीं मिली। वास्तव में, इसने एआई को सरल टेक्स्ट पढ़ना भुला दिया!
निष्कर्ष: समस्या यह नहीं है कि एआई को पर्याप्त सिखाया नहीं गया है; समस्या संभवतः यह है कि एआई कैसे बना है। यह मछली को पेड़ पर चढ़ना सिखाने की कोशिश करने जैसा है। आप उसे चढ़ने पर कितनी भी किताबें दे दें, मछली (एआई) बस उस तरह के विज़न के लिए नहीं बनी है।
यह क्यों मायने रखता है?
पेपर का तर्क है कि हम इन एआई पर उन स्थितियों में भरोसा नहीं कर सकते जहाँ स्पष्ट रूप से देखना महत्वपूर्ण है।
- यदि कोई एआई कार चला रहा है, तो उसे सड़क के बारे में केवल "अनुमान" लगाने के बजाय विंडशील्ड में एक महीन दरार या बारिश में एक छोटे संकेत को देखने की आवश्यकता है।
- यदि कोई एआई मेडिकल स्कैन देख रहा है, तो उसे अंग के सामान्य आकार का वर्णन करने के बजाय एक सूक्ष्म विसंगति (anomaly) को पहचानने की आवश्यकता है।
संक्षेप में: ये एआई मॉडल बेहतरीन कहानीकार और अवधारणाओं को समझने में सक्षम हैं, लेकिन वर्तमान में वे सूक्ष्म दृष्टि (fine-grained vision) में बहुत खराब हैं। वे उस व्यक्ति की तरह हैं जो किसी पेंटिंग का पूरी तरह से वर्णन कर सकता है लेकिन कोने में छिपे हस्ताक्षर को नहीं ढूंढ सकता।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।