GRIT: Teaching MLLMs to Think with Images
यह शोध पत्र GRIT का प्रस्ताव करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) आधारित विधि है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को प्राकृतिक भाषा के साथ स्पष्ट बाउंडिंग बॉक्स निर्देशांकों (bounding box coordinates) को अंतर्निहित करके दृष्टिगत रूप से आधारित तर्क श्रृंखलाएं (visually grounded reasoning chains) उत्पन्न करने में सक्षम बनाती है, जो बिना किसी एनोटेटेड रीजनिंग या लोकलाइजेशन लेबल के उच्च डेटा दक्षता प्राप्त करती है।