What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?
यह अध्ययन प्रदर्शित करता है कि टेक्स्ट मॉडल में अंतर्निहित मशीन-जनित इमेज कैप्शन, विशेष रूप से मध्यवर्ती नेटवर्क परतों पर, मानव-एनोटेटेड कैप्शन और ऑटोरेग्रेसिव लैंग्वेज मॉडल की तुलना में मानव उच्च-स्तरीय दृश्य धारणा और व्यवहारिक संरेखण के बेहतर मॉडल प्रदान करते हैं।