Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
Vision-OPD एक सेल्फ-डिस्टिलेशन फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सूक्ष्म-स्तरीय विज़ुअल समझ को बढ़ाता है, जो एक फुल-इमेज पॉलिसी को अपने स्वयं के जनरेटेड रोलआउट्स पर क्रॉप-कंडीशन्ड टीचर के बेहतर प्रदर्शन की नकल करने के लिए प्रशिक्षित करता है, जिससे मॉडल को बिना किसी बाहरी पर्यवेक्षण या टूल्स के प्रासंगिक साक्ष्य पर ध्यान केंद्रित करने के लाभों को आत्मसात करने में सक्षम बनाया जा सके।