← नवीनतम पेपर
🤖 machine learning

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

यह शोध पत्र PRPO प्रस्तुत करता है, जो एक पैराग्राफ-स्तरीय सुदृढीकरण लर्निंग (reinforcement learning) एल्गोरिदम और एक संबंधित तर्क-एनोटेटेड (reasoning-annotated) डेटासेट है, जो उनके टेक्स्टुअल रीजनिंग को विजुअल एविडेंस के साथ संरेखित करके डीपफेक डिटेक्शन में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की सटीकता और व्याख्यात्मकता को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट "परफेक्ट" तस्वीरों से भर गया है जो असली दिखती हैं लेकिन वास्तव में कंप्यूटर द्वारा बनाई गई हैं। इन्हें डीपफेक (deepfakes) कहा जाता है। इन्हें पहचानना असली हीरों के ढेर में नकली हीरे को पहचानने जैसा है; वे इतने समान दिखते हैं कि विशेषज्ञ भी धोखा खा जाते हैं।

यह शोध पत्र इस समस्या को हल करने के लिए PRPO (पैराग्राफ-लेवल पॉलिसी ऑप्टिमाइज़ेशन) नामक एक नई प्रणाली पेश करता है। यह कैसे काम करता है, इसका विवरण सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "स्मार्ट" लेकिन "भ्रमित" होने वाला जासूस

शोधकर्ताओं ने इन नकली चीजों को पकड़ने के लिए उन्नत AI "जासूसों" (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) का उपयोग करने की कोशिश की। ये AI बहुत बुद्धिमान होते हैं और पढ़ने व बात करने में माहिर होते हैं, लेकिन उनमें एक बुरी आदत है: वे मतिभ्रम (hallucinate) का शिकार हो जाते हैं।

  • उपमा: कल्पना कीजिए कि एक जासूस है जो रिपोर्ट लिखने में तो बहुत अच्छा है लेकिन अपराध स्थल को देखने में बहुत बुरा है। वह रिपोर्ट में लिख सकता है कि "मैंने एक टूटी हुई खिड़की देखी है," जबकि खिड़की वास्तव में बिल्कुल ठीक होती है। वह कह सकता है कि "संदिग्ध घबराया हुआ लग रहा है," जबकि व्यक्ति मुस्कुरा रहा होता है।
  • समस्या: ये AI मॉडल अक्सर पहले उत्तर का अनुमान लगा लेते हैं और फिर उस अनुमान को सही ठहराने के लिए एक कहानी बना लेते हैं, जिससे वे फोटो के वास्तविक दृश्यों को अनदेखा कर देते हैं।

2. समाधान: एक नया प्रशिक्षण मैनुअल (DF-R5)

जासूस को सुधारने के लिए, शोधकर्ताओं को सबसे पहले एक बेहतर प्रशिक्षण मैनुअल की आवश्यकता थी। उन्होंने DF-R5 नामक एक विशाल डेटासेट बनाया।

  • यह क्या है: यह 1,15,000 छवियों का एक पुस्तकालय है, जिनके साथ उच्च गुणवत्ता वाले स्पष्टीकरण दिए गए हैं कि कोई छवि नकली क्यों है।
  • इसे कैसे बनाया गया: उन्होंने केवल एक AI से मैनुअल लिखने के लिए नहीं कहा। उन्होंने एक "विशेषज्ञों के पैनल" (कई अलग-अलग शीर्ष-स्तरीय AI) का उपयोग किया ताकि 74 विशिष्ट चीजों की एक सूची बनाई जा सके जिन्हें देखना है (जैसे "अजीब त्वचा की बनावट" या "बेमेल रोशनी")। फिर, उन्होंने सबसे अच्छे AI से प्रत्येक छवि का इस सूची के आधार पर मूल्यांकन करवाया ताकि एक गोल्ड-स्टैंडर्ड गाइड तैयार की जा सके।

3. नया जासूस: DX-LLaVA

उन्होंने DX-LLaVA नामक एक नया AI मॉडल बनाया।

  • अपग्रेड: मानक AI मॉडल एक फोटो को वाइड-एंगल लेंस की तरह देखते हैं, जिससे वे "बड़ी तस्वीर" तो देख पाते हैं लेकिन सूक्ष्म विवरणों को छोड़ देते हैं। DX-LLaVA एक अलग "लेंस" (एक ConvNeXT एनकोडर) का उपयोग करता है जो एक आवर्धक लेंस (magnifying glass) की तरह काम करता है। यह त्वचा के छिद्रों, अजीब बालों के रेशों, या अजीब छाया जैसे सूक्ष्म, पिक्सेल-स्तर के विवरणों पर ज़ूम करता है जिन्हें अन्य मॉडल मिस कर देते हैं।

4. सीक्रेट सॉस: PRPO (द "पैराग्राफ कोच")

यह सबसे महत्वपूर्ण हिस्सा है। एक आवर्धक लेंस के साथ भी, AI अभी भी एक भ्रमित करने वाली रिपोर्ट लिख सकता है। शोधकर्ताओं ने PRPO पेश किया, जो AI की सोचने की प्रक्रिया के दौरान एक सख्त संपादक या कोच के रूप में कार्य करता है।

  • उपमा: कल्पना कीजिए कि AI एक पैराग्राफ-दर-पैराग्राफ रहस्य कहानी लिख रहा है।
    • पुराना तरीका: AI पूरी कहानी लिखता है, फिर जाँचता है कि अंत समझ में आता है या नहीं। यदि अंत गलत है, तो वह फिर से प्रयास करता है।
    • PRPO तरीका: जैसे ही AI प्रत्येक पैराग्राफ लिखता है, कोच उसे रोकता है और दो प्रश्न पूछता है:
      1. "दृश्य निरंतरता" (Visual Consistency): "आपने अभी लिखा कि आँखें अजीब दिख रही हैं। मुझे फोटो में आँखें दिखाएं। क्या वे वास्तव में अजीब दिख रही हैं?" यदि AI अपनी ओर से कुछ मनगढ़ंत लिख रहा है, तो कोच उसे "खराब ग्रेड" देता है।
      2. "पूर्वानुमान निरंतरता" (Prediction Consistency): "आपने तीन पैराग्राफ लिखे कि त्वचा नकली दिख रही है, लेकिन आपका अंतिम निष्कर्ष कहता है 'असली'। यह तर्कसंगत नहीं है। अपनी कहानी को ठीक करें ताकि पैराग्राफ और अंत एक समान हों।"

AI को हर वाक्य को वास्तविक चित्र के साथ जोड़ने और पूरी कहानी को सुसंगत बनाने के लिए मजबूर करके, PRPO AI को झूठ बोलने या अनुमान लगाने से रोकता है।

5. परिणाम

जब उन्होंने इस नए सिस्टम का परीक्षण किया:

  • सटीकता: यह नकली चीजों को पहचानने में बहुत बेहतर हो गया, विशेष रूप से उन छवियों पर जिन्हें उसने पहले कभी नहीं देखा था (जैसे एक जासूस जो नकली बनाने वाले की नई तकनीक को भी पहचान सकता है)।
  • तर्क (Reasoning): इसे स्पष्टीकरणों की गुणवत्ता के लिए 5.0 में से 4.55 का स्कोर मिला। इसका मतलब है कि इसने केवल "नकली" नहीं कहा; बल्कि इसने विस्तार से बताया कि क्यों, विशिष्ट दृश्य संकेतों की ओर इशारा करते हुए बिना कुछ मनगढ़ंत बनाए।

सारांश

यह शोध पत्र एक ऐसी प्रणाली प्रस्तुत करता है जो AI को अनुमान लगाने के बजाय प्रमाण देने के लिए सिखाती है। AI को एक आवर्धक लेंस (बेहतर दृष्टि), एक सख्त कोच (PRPO) देकर जो हर वाक्य की फोटो के साथ जाँच करता है, और एक उच्च-गुणवत्ता वाले प्रशिक्षण मैनुअल (DF-R5) के माध्यम से, उन्होंने एक ऐसा डीपफेक डिटेक्टर बनाया है जो सटीक भी है और अपने स्पष्टीकरणों में विश्वसनीय भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →