← नवीनतम पेपर
🤖 AI

VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models

यह शोधपत्र VLM-RobustBench प्रस्तुत करता है, जो 133 करप्शन सेटिंग्स में चार विजन-लैंग्वेज मॉडल परिवारों की मजबूती का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल अर्थगत रूप से (semantically) मजबूत हैं लेकिन स्थानिक रूप से (spatially) नाजुक हैं, जहाँ कम-तीव्रता वाले ज्यामितीय विरूपण (geometric distortions), दृश्य रूप से गंभीर फोटोट्रॉमिक करप्शन की तुलना में काफी अधिक प्रदर्शन गिरावट का कारण बनते हैं।

मूल लेखक: Rohit Saxena, Alessandro Suglia, Pasquale Minervini

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rohit Saxena, Alessandro Suglia, Pasquale Minervini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत प्रतिभाशाली नया छात्र है जिसका नाम विज़न-लैंग्वेज मॉडल (VLM) है। यह छात्र किताबें पढ़ने और चित्रों को देखने में अविश्वसनीय रूप से स्मार्ट है। यदि आप उसे बिल्ली की एक एकदम सटीक, हाई-डेफिनिशन फोटो दिखाएं और उससे पूछें, "यह क्या है?", तो वह 99% बार सही उत्तर देगा। वह मानक परीक्षाओं में अपनी कक्षा का टॉपर है।

लेकिन समस्या यह है: वास्तविक जीवन एक आदर्श स्टूडियो फोटो नहीं है।

वास्तविक दुनिया में, यदि आप बहुत तेज़ी से हिल जाते हैं तो तस्वीरें धुंधली हो जाती हैं, बारिश के कारण वे धुंधली हो सकती हैं, इंटरनेट धीमा होने के कारण वे पिक्सेलेटेड हो सकती हैं, या यदि किसी ने कैमरा गलत तरीके से पकड़ा है तो वे उलटी हो सकती हैं।

आपने जो पेपर साझा किया है, VLM-RobustBench, वह इन सुपर-स्मार्ट छात्रों के लिए एक "तनाव परीक्षण" (Stress Test) की तरह है। शोधकर्ताओं ने सोचा: क्या होगा यदि हम इन मॉडलों के सामने वास्तविक दुनिया की अव्यवस्था को रख दें?

यहाँ उनके निष्कर्षों का विवरण दिया गया, कुछ सरल उपमाओं (analogies) का उपयोग करते हुए:

1. "ग्लास ब्लर" का आश्चर्य (विरोधाभास)

आप सोच सकते हैं कि यदि आप किसी तस्वीर को बहुत बदतर बना देते हैं (जैसे कि उसे गाढ़े कीचड़ से ढक देना या उसे ब्लैक एंड व्हाइट कर देना), तो छात्र भ्रमित हो जाएगा।

  • वास्तविकता: मॉडल "बदतर" तस्वीरों के प्रति वास्तव में काफी मजबूत हैं। वे भारी शोर (noise) या खराब रोशनी को आश्चर्यजनक रूप से अच्छी तरह से संभाल सकते हैं।
  • झटका: मॉडल सूक्ष्म, सूक्ष्म परिवर्तनों पर बिखर जाते हैं।
    • उपमा: कल्पना कीजिए कि एक मास्टर शेफ जो रसोई में आग लगने पर भी (उच्च गंभीरता/high severity) एक बेहतरीन भोजन बना सकता है। लेकिन, यदि आप काउंटर पर रखे मसालों को थोड़ा सा पुनर्व्यवस्थित कर दें ताकि वे अलग क्रम में हों (कम गंभीरता/low severity), तो शेफ खाना बनाना ही भूल जाता है।
    • निष्कर्ष: एक "लो-सेवेरिटी" ग्लास ब्लर (जो एक थोड़े गंदे खिड़की से देखने जैसा दिखता है) ने मॉडलों को ब्राइटनेस कम होने (हाई सेवेरिटी) की तुलना में बहुत अधिक बार विफल किया। मॉडल सिमेंटिक रूप से मजबूत (वे जानते हैं कि चीजें क्या हैं) हैं लेकिन स्थानिक रूप से नाजुक (यदि चीजों का आकार या स्थिति थोड़ी भी बदल जाए तो वे भ्रमित हो जाते हैं) हैं।

2. "उल्टी" बिल्ली की आपदा

शोधकर्ताओं ने कुछ बहुत ही सरल प्रयोग किए, जैसे कि छवि को लंबवत (vertically) पलटना या रंगों को उल्टा करना (एक काली बिल्ली को सफेद बनाना)।

  • उपमा: यह एक इंसान से पूछने जैसा है, "क्या यह एक कप है?" जबकि आपने कप को उल्टा पकड़ा हुआ है। एक इंसान कहेगा, "यह अभी भी एक कप है, बस उल्टा है।"
  • निष्कर्ष: इन VLMs ने घबराहट दिखाई। छवि को पलटने से प्रदर्शन में भारी गिरावट आई, जो कभी-कभी फोटो को गेंद की तरह कुचल देने से भी बदतर था। यह सुझाव देता है कि मॉडलों की एक मजबूत "आदत" है कि वे चीजों को सीधा देखने की उम्मीद करते हैं, और उस आदत को तोड़ने से उनका दिमाग काम करना बंद कर देता है।

3. "रीसैंपलिंग" का जाल

इन मॉडलों के लिए सबसे बड़ा घातक रीसैंपलिंग (छवि का आकार बदलना, जैसे ज़ूम इन या ज़ूम आउट करना, या खींचना) था।

  • उपमा: एक पहेली (puzzle) की कल्पना करें। यदि आप एक पहेली के टुकड़े को थोड़ा सा खींचते हैं, तो उस पर बनी तस्वीर विकृत हो जाती है। मॉडल एक ऐसे रोबोट की तरह है जिसने हर पहेली के टुकड़े के सटीक आकार को याद कर लिया है। यदि आप टुकड़े को खींचते हैं, तो रोबोट उसे बिल्कुल भी पहचान नहीं पाता है।
  • निष्कर्ष: अपसैंपलिंग (एक छोटी छवि को बड़ा बनाना) या इलास्टिक ट्रांसफॉर्म (छवि को जेली की तरह मोड़ना/warping) जैसे ऑपरेशन्स के कारण मॉडलों की सटीकता में 34% तक की कमी आई। यह एक "विनाशकारी विफलता" (catastrophic failure) है।

4. दो अलग-अलग प्रकार के परीक्षण

शोधकर्ताओं ने मॉडलों पर दो अलग-अलग प्रकार के प्रश्न आजमाए:

  • MMBench ("आंखों" का परीक्षण): ऐसे प्रश्न जिनमें चित्र को करीब से देखने की आवश्यकता होती है (जैसे, "कार का रंग क्या है?")। यहाँ, मॉडल बहुत नाजुक थे।
  • MMMU-Pro ("मस्तिष्क" का परीक्षण): ऐसे प्रश्न जिनमें जटिल तर्क की आवश्यकता होती है (जैसे, "इस चार्ट के आधार पर, आर्थिक रुझान क्या है?")। यहाँ, मॉडल अपने टेक्स्ट ज्ञान पर अधिक निर्भर थे और चित्र पर कम। यदि चित्र धुंधला था, तो उन्होंने केवल टेक्स्ट के आधार पर अनुमान लगाया, इसलिए वे उतने बुरी तरह विफल नहीं हुए।

5. "सेवेरिटी" का झूठ

आमतौर पर, हम मानते हैं कि यदि कोई तस्वीर अधिक विकृत है, तो उसे समझना अधिक कठिन होगा।

  • निष्कर्ष: AI के लिए यह गलत है।
  • उपमा: एक कार के बारे में सोचें। एक टायर पंचर वाली कार (उच्च गंभीरता) को चलाना कठिन हो सकता है। लेकिन स्टीयरिंग व्हील में एक ढीले पेंच (कम गंभीरता) वाली कार तुरंत दुर्घटनाग्रस्त हो सकती है। "ढीला पेंच" (लो-सेवेरिटी ग्लास ब्लर) "फटे टायर" (हाई-सेवेरिटी नॉइज़) की तुलना में अधिक खतरनाक था।

इसका भविष्य के लिए क्या अर्थ है?

पेपर निष्कर्ष निकालता है कि वर्तमान AI मॉडल बहुत कांपते हाथों वाले जीनियस की तरह हैं। वे बहुत सी बातें जानते हैं, लेकिन वे वास्तविक दुनिया की भौतिक विचित्रताओं को संभालने में बहुत खराब हैं।

सुझाव:

  1. उन्हें "अव्यवस्थित" डेटा पर प्रशिक्षित करें: उन्हें केवल आदर्श फोटो न दिखाएं। उन्हें उल्टी तस्वीरें, खींची हुई तस्वीरें और धुंधली तस्वीरें दिखाएं।
  2. "अव्यवस्थित" डेटा पर परीक्षण करें: उन्हें केवल एक साफ टेस्ट न दें। यदि एक मॉडल एक थोड़ी सी मुड़ी हुई तस्वीर को नहीं संभाल सकता, तो वह सेल्फ-ड्राइविंग कार या मेडिकल रोबोट के लिए तैयार नहीं है।
  3. "कांपते हाथों" को ठीक करें: हमें इन मॉडलों को यह सिखाने की आवश्यकता है कि एक बिल्ली अभी भी एक बिल्ली ही है, भले ही तस्वीर खींची गई हो या बिल्ली उल्टी हो।

संक्षेप में: ये AI मॉडल वे बुद्धिमान पुस्तक प्रेमी हैं जो एक थोड़े से टेढ़े फोटो फ्रेम से भी डर जाते हैं। जब तक हम इसे ठीक नहीं करते, हम उन पर वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित दुनिया में पूरी तरह से भरोसा नहीं कर सकते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →