How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos
यह अध्ययन 41 घंटों के गेमप्ले वीडियो में विजुअल बग्स का पता लगाने में ऑफ-द-शेल्फ विजन लैंग्वेज मॉडल्स (VLMs) की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि बेसलाइन प्रदर्शन आशाजनक है, सामान्य नॉन-फाइन-ट्यूनिंग संवर्धन रणनीतियां केवल मामूली सुधार प्रदान करती हैं, जो यह सुझाव देती हैं कि भविष्य की प्रगति के लिए टेक्स्टुअल और विजुअल विसंगतियों के बीच बेहतर अंतर करने हेतु हाइब्रिड दृष्टिकोणों की आवश्यकता है।