Token-Based Affordance Grounding with Large Vision-Language Models
यह शोध पत्र TokAG का प्रस्ताव करता है, जो एक ज़ीरो-शॉट अफोर्डेंस ग्राउंडिंग फ्रेमवर्क है जो लार्ज विज़न-लैंग्वेज मॉडल्स से ऑब्जेक्ट-केंद्रित अटेंशन मैप्स निकालने के लिए एक स्थानिक-जागरूक टोकन-चयन तंत्र का लाभ उठाता है, जिससे बाहरी पर्यवेक्षण के बिना क्रिया-प्रासंगिक क्षेत्रों को स्थानीयकृत करने में पूर्व कमजोर रूप से पर्यवेक्षित विधियों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।