SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
يقدم SSL4RL إطار عمل مبتكر يسخر أهداف التعلم الخاضع للإشراف الذاتي كإشارات مكافأة تلقائية وقابلة للتحقق لضبط نماذج الرؤية واللغة عبر التعلم التعزيزي، مما يتغلب بفعالية على نقص آليات المكافأة القابلة للتوسع ويحسن الأداء بشكل كبير في كل من معايير الاختبار المتمحورة حول الرؤية ومعايير الاستدلال.