← नवीनतम पेपर
💻 computer science

Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models

यह शोध पत्र CVPR 2026 DataCV चैलेंज के लिए एक प्रशिक्षण-मुक्त फ्रेमवर्क प्रस्तुत करता है जो भ्रमित करने वाले तथ्यों (memorized facts) के प्रति उनके पूर्वाग्रह को दूर करके क्लासिक विजुअल इल्यूजन को समझने में विजन-लैंग्वेज मॉडल्स की सटीकता में महत्वपूर्ण सुधार करने के लिए इल्यूजन-अवेयर इमेज प्रीप्रोसेसिंग, एंटी-इल्यूजन प्रॉम्प्टिंग और मल्टी-वोट एनसेम्बल्स को जोड़ता है।

मूल लेखक: Junli Zha, Jiahui Wang, Xinkai Lu, Jinbo Wang

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junli Zha, Jiahui Wang, Xinkai Lu, Jinbo Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, विद्वान रोबोट को एक तस्वीर दिखा रहे हैं। आप दो रेखाओं की ओर इशारा करते हैं और पूछते हैं, "क्या ये रेखाएं समान लंबाई की हैं?"

वास्तविक दुनिया में, आप शायद एक प्रसिद्ध ऑप्टिकल इल्यूजन (जैसे कि मुलर-लायर इल्यूजन) देख रहे होंगे, जहाँ सिरों पर बने तीर आपके मस्तिष्क को यह सोचने के लिए भ्रमित करते हैं कि एक रेखा लंबी है, जबकि वे वास्तव में समान होती हैं।

यहाँ समस्या यह है कि इस पेपर का रोबोट अपने फायदे के लिए बहुत अधिक "स्मार्ट" है। रेखाओं को वास्तव में मापने के लिए स्क्रीन के पिक्सल को देखने के बजाय, वह उस चित्र को पहचान लेता है जिसे उसने पहले एक पाठ्यपुस्तक में देखा था। वह कहता है, "आह, मैं इसे जानता हूँ! यह मुलर-लायर इल्यूजन है। रेखाएं वास्तव में समान लंबाई की हैं," और सही उत्तर देता है।

लेकिन यहाँ एक मोड़ है: यदि आप चित्र को थोड़ा बदल देते हैं ताकि रेखाएं वास्तव में अलग लंबाई की हो जाएं (इल्यूजन को तोड़ दें), तो भी रोबोट कहता है कि वे समान हैं। क्यों? क्योंकि वह अपनी याददाश्त के आधार पर काम कर रहा है, न कि नई वास्तविकता को देखने के लिए अपनी "आंखों" का उपयोग कर रहा है। यह उस छात्र की तरह है जिसने गणित करने के बजाय उत्तर कुंजी (answer key) रट ली है।

समाधान: "ट्रिकस्टर को चकमा देना" (Tricking the Trickster)

लेखकों ने इस "याददाश्त बनाम दृष्टि" की समस्या को ठीक करने के लिए एक सिस्टम बनाया, जिसके लिए रोब-बॉट को फिर से प्रशिक्षित (जो कि उसके मस्तिष्क को फिर से वायर करने जैसा है) करने की आवश्यकता नहीं थी। इसके बजाय, उन्होंने तीन चतुर तरकीबें इस्तेमाल कीं जो रोबोट को एक इंसान की तरह ताज़ा नज़रिए से तस्वीर देखने के लिए मजबूर करती हैं।

1. "जादुई इरेज़र" (इमेज प्रीप्रोसेसिंग)

रोबोट को "इल्यूजन को अनदेखा करने" के लिए कहने के बजाय, टीम ने चित्र को भौतिक रूप से इस तरह बदला कि इल्यूजन गायब हो जाए।

  • उपमा: कल्पना कीजिए कि आप दो सेबों के आकार की तुलना करने की कोशिश कर रहे हैं, लेकिन एक गहरे, भ्रमित करने वाले साये में है और दूसरा तेज़ रोशनी में है। यह बताना कठिन है कि कौन सा बड़ा है। रोबोट को यह कल्पना करने के लिए कहने के बजाय कि छाया हट गई है, टीम ने सचमुच सेबों को चित्र से काटकर निकाला और उन्हें एक सादे सफेद मेज पर अगल-बगल रख दिया।
  • उन्होंने यह कैसे किया: विभिन्न प्रकार के इल्यूजन के लिए, उन्होंने विशिष्ट उपकरणों का उपयोग किया:
    • रंग के ट्रिक्स के लिए: उन्होंने केवल रंगीन पट्टियों को काटा और उन्हें ग्रे बैकग्राउंड पर एक-दूसरे के बगल में रखा।
    • आकार के ट्रिक्स के लिए: उन्होंने वस्तुओं को अलग किया और उन्हें इस तरह "मिरर" (दर्पण प्रतिबिंब) किया कि वे पूरी तरह से एक-दूसरे के ऊपर आ जाएं। यदि वे अलग आकार के होते, तो एक अंतर दिखाई देता; यदि वे समान होते, तो वे निर्बाक रूप से मिल जाते।
    • सीधेपन के ट्रखिक्स के लिए: उन्होंने एक रूलर की तरह काम करने के लिए चित्र के ऊपर नीली रेखाओं का एक ग्रिड बनाया।

चित्र को बदलकर, उन्होंने उस "भ्रमित करने वाले संदर्भ" को हटा दिया जो रोबोट की याददाश्त को सक्रिय करता है। अब, रोबोट को वास्तविक दृश्य साक्ष्य देखना होगा।

2. "सख्त शिक्षक" (एंटी-इल्यूजन प्रॉम्प्ट्स)

एक बार जब चित्र साफ हो जाता है, तो टीम रोबोट को निर्देशों का एक विशिष्ट सेट (प्रॉम्प्ट) देती है।

  • उपमा: यह एक शिक्षक द्वारा छात्र को यह कहने जैसा है, "किताब में जो पढ़ा है उसके आधार पर अनुमान लगाना बंद करो। मेरे द्वारा खींची गई स्केल (रूलर) को देखो। रेखाओं की स्केल से तुलना करो और मुझे बताओ कि तुम्हें क्या दिख रहा है।"
  • रणनीति: प्रॉम्प्ट्स स्पष्ट रूप से इल्यूजन का नाम लेते हैं (जैसे, "यह एक मुलर-लायर इल्यूजन है") ताकि रोबोट सतर्क हो जाए, लेकिन फिर तुरंत उसे तीरों को अनदेज़ करने और केवल क्षैतिज रेखाओं की तुलना करने के लिए कहते हैं। यह रोबोट को "तथ्यों को याद करने" से बदलकर "दृश्य तुलना करने" पर केंद्रित करता है।

3. "न्यायाधीशों का पैनल" (मल्टी-वोट एन्सेम्बल)

साफ चित्र और अच्छे निर्देशों के बावजूद, रोबोट का कभी-कभी "बुरा दिन" हो सकता है या वह किसी रैंडम ग्लिच से भ्रमित हो सकता है।

  • उपमा: कल्पना कीजिए कि आप एक व्यक्ति से सवाल पूछते हैं; वह गलत उत्तर दे सकता है। लेकिन यदि आप वही सवाल पाँच अलग-अलग लोगों से पूछते हैं और बहुमत वाले उत्तर को चुनते हैं, तो आपके सही होने की संभावना बहुत अधिक होती है।
  • रणनीति: सिस्टम रोबोट से एक ही सवाल पाँच बार पूछता है और उस उत्तर को चुनता है जो सबसे अधिक बार आता है। यह किसी भी रैंडम त्रुटि को कम करता है।

परिणाम

टीम ने इस सिस्टम का परीक्षण 630 ट्रिकी इमेज वाली एक प्रतियोगिता में किया।

  • उनके ट्रिक्स के बिना: रोबोट संघर्ष कर रहा था, अक्सर अपनी रटी हुई जानकारी में फंस जाता था।
  • उनके ट्रिक्स के साथ: सिस्टम ने आधिकारिक टेस्ट सेट पर 90.48% उत्तर सही दिए। एक छोटे, मानव-सत्यापित सबसेट पर, इसने 98.41% सही उत्तर दिए।

वे प्रतियोगिता में दूसरे स्थान पर आए, जो विजेता से बस एक मामूली अंतर पीछे था, जिससे यह सिद्ध हुआ कि इन समस्याओं को हल करने के लिए आपको एक नया, अधिक स्मार्ट रोबोट बनाने की आवश्यकता नहीं है। आपको बस मौजूदा रोबोट को देखने के लिए एक बेहतर चित्र और देखने का स्पष्ट तरीका देने की आवश्यकता है।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर दिखाता है कि जब एक स्मार्ट AI ऑप्टिकल इल्यूजन से भ्रमित होता है, तो यह आमतौर पर इसलिए होता है क्योंकि वह जो पहले से जानता है उसके आधार पर "बहुत अधिक सोच" रहा होता है। समाधान उसे नए तथ्य सिखाना नहीं है, बल्कि इमेज को साफ करना है ताकि सच्चाई स्पष्ट हो सके, उसे इमेज को देखने के लिए कहना है (न कि अपनी याददाश्त को), और सुनिश्चित करने के लिए पाँच बार पूछना है। यह AI को दुनिया को अधिक स्पष्टता से देखने में मदद करने का एक सरल, व्यावहारिक तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →