Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
تقترح هذه الورقة استراتيجية "تحسين السياسة النسبية للمجموعات المعايرة للرفض" (RC-GRPO)، وهي استراتيجية تعلم تعزيزي تمكن النماذج اللغوية الكبيرة متعددة الوسائط من رفض الكائنات غير الموجودة بفعالية في مهام فهم التعبيرات المرجعية المعممة دون المساس بدقة تحديد المواقع للأهداف الموجودة.