Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design
يتحدى الدكتور سيج الافتراض القائل بأن تدريب (GRPO) القائم على اللغة ينتقل بسلاسة إلى الإدراك البصري من خلال تقديم إطار عمل جاهز للتشغيل يتضمن آلية "النظر للتأكيد" (Look-to-Confirm) ووحدة "المكافأة ذات الترتيب التوزيعي" (Distribution-Ranked Reward) التي تعزز الأداء بشكل كبير في السيناريوهات البصرية المعقدة دون الحاجة إلى تعديلات هيكلية.