Can Vision-Language Models Reason about AI Edits in Images?
تقترح هذه الورقة إطار عمل للتعلم التعزيزي يعتمد على تحسين السياسة النسبية للمجموعة (GRPO)، والذي يُمكّن نماذج الرؤية واللغة من التفكير في تعديلات الصور المُنشأة بواسطة الذكاء الاصطناعي وتحديد مواقع التلاعب باستخدام مكافآت بسيطة للدقة والتنسيق، محققةً أداءً تنافسياً في الكشف دون الحاجة إلى إشراف صريح على التفكير.