Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
यह शोध पत्र प्रकट करता है कि विजन-लैंग्वेज मॉडल अक्सर "मुझे फिर से जांचने दें" जैसे आत्म-चिंतनशील कथनों को वास्तविक दृश्य पुनरीक्षण को ट्रिगर करने के बजाय केवल एक टेक्स्टुअल पैटर्न के रूप में उत्पन्न करते हैं, एक ऐसा निष्कर्ष जिसे विजुअलस्वैप (VisualSwap) फ्रेमवर्क द्वारा प्रदर्शित किया गया है जो यह दिखाता है कि मॉडल ऐसे दावों के बावजूद अर्थपूर्ण रूप से भिन्न इमेज स्वैप का पता लगाने में अक्सर विफल रहते हैं।