ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning
यह शोध पत्र ROVER को प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक हल्का, सीखने योग्य प्लगइन है जो एक स्टेप-विशिष्ट टोकन ट्रिपलेट तंत्र के माध्यम से ऑब्जेक्ट-सेंट्रिक विजुअल एविडेंस को कुशलतापूर्वक रूट करके ग्राउंडेड मल्टी-इमेज रीजनिंग को बढ़ाता है, और समग्र दृश्य समझ से समझौता किए बिना MM-GCoT और VideoEspresso जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।