PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
تقدم هذه الورقة البحثية خوارزمية PRPO، وهي خوارزمية تعلم تعزيزي على مستوى الفقرة، ومجموعة بيانات مقابلة موسومة بالاستدلال، تعمل بشكل كبير على تعزيز دقة وقابلية تفسير النماذج اللغوية الكبيرة متعددة الوسائط في كشف التزييف العميق من خلال مواءمة استدلالها النصي مع الأدلة المرئية.