SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
SSL4RL एक नवीन ढांचे को पेश करता है जो विजन-लैंग्वेज मॉडल्स को सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से फाइन-ट्यून करने के लिए सत्यापन योग्य, स्वचालित रिवॉर्ड सिग्नल्स के रूप में सेल्फ-सुपरवाइज्ड लर्निंग उद्देश्यों का लाभ उठाता है, जो स्केलेबल रिवॉर्ड मैकेनिज्म की कमी को प्रभावी ढंग से दूर करता है और विजन-केंद्रित एवं रीजनिंग बेंचमार्क दोनों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।