PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
यह शोध पत्र PRPO प्रस्तुत करता है, जो एक पैराग्राफ-स्तरीय सुदृढीकरण लर्निंग (reinforcement learning) एल्गोरिदम और एक संबंधित तर्क-एनोटेटेड (reasoning-annotated) डेटासेट है, जो उनके टेक्स्टुअल रीजनिंग को विजुअल एविडेंस के साथ संरेखित करके डीपफेक डिटेक्शन में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की सटीकता और व्याख्यात्मकता को महत्वपूर्ण रूप से बढ़ाता है।