← नवीनतम पेपर
🤖 AI

OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL

यह शोध पत्र OmniVL-Guard को प्रस्तुत करता है, जो एक एकीकृत विजन-लैंग्वेज फ्रेमवर्क है जो विविध मल्टीमॉडल मिसइन्फॉर्मेशन (बहु-आयामी भ्रामक सूचना) में कठिनाई पूर्वाग्रह (difficulty bias) को दूर करने और सुदृढ़, सूक्ष्म-स्तरीय जालसाजी का पता लगाने एवं ग्राउंडिंग प्राप्त करने के लिए सेल्फ-इवॉल्विंग CoT जनरेशन और एडेप्टिव रिवॉर्ड स्केलिंग पॉलिसी ऑप्टिमाइज़ेशन का उपयोग करता है।

मूल लेखक: Jinjie Shen, Jing Wu, Yaxiong Wang, Lechao Cheng, Shengeng Tang, Tianrui Hui, Nan Pu, Zhun Zhong

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinjie Shen, Jing Wu, Yaxiong Wang, Lechao Cheng, Shengeng Tang, Tianrui Hui, Nan Pu, Zhun Zhong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक पुस्तकालय है जहाँ कोई भी कहानी लिख सकता है, चित्र बना सकता है या वीडियो बना सकता है। समस्या यह है कि "नकली" किताबें, डॉक्टर्ड (छेड़छाड़ की गई) तस्वीरें और डीपफेक वीडियो इतने अच्छे होते जा रहे हैं कि यह पहचानना मुश्किल हो जाता है कि क्या असली है और क्या कोई चाल।

शोध पत्र "OmniVL-Guard" एक नया डिजिटल जासूस पेश करता है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल शब्दों में समझाया गया है:

1. समस्या: "आसान बनाम कठिन" जासूस की दुविधा

मौजूदा डिजिटल जासूस आमतौर पर विशेषज्ञ होते हैं। कुछ नकली टेक्स्ट को पकड़ने में माहिर हैं, कुछ नकली फोटो में अच्छे हैं, और कुछ नकली वीडियो को संभालते हैं। लेकिन वास्तविक दुनिया के झूठ अक्सर इन तीनों का मिश्रण होते हैं (जैसे कि एक नकली कैप्शन वाला नकली वीडियो)।

जब शोधकर्ताओं ने एक "सुपर-डिटेक्टिव" को मानक तरीकों का उपयोग करके टेक्स्ट, इमेज और वीडियो तीनों को एक साथ संभालने के लिए प्रशिक्षित करने की कोशिश की, तो वह एक दीवार से टकरा गया। यह एक छात्र को गणित की परीक्षा और कविता की परीक्षा एक साथ देने जैसा है। छात्र गणित (आसान हिस्सा) में बहुत अच्छा हो जाता है क्योंकि यह उसे त्वरित, स्पष्ट फीडबैक देता है, लेकिन वह कविता (कठिन हिस्सा) को अनदेखा कर देता है क्योंकि यह भ्रमित करने वाला है और उसे नहीं पता कि सुधार कैसे किया जाए।

तकनीकी शब्दों में, "आसान" कार्य (केवल "असली" या "नकली" कहना) ने प्रशिक्षण पर प्रभुत्व जमा लिया, जिससे "कठिन" कार्य (यह ढूंढना कि झूठ ठीक कहाँ छिपा है) पीछे छूट गया।

2. समाधान: एक संतुलित प्रशिक्षण शिविर (OmniVL-Guard)

लेखकों ने OmniVL-Guard बनाया, एक ऐसा सिस्टम जो केवल सीखता नहीं है; यह यह सीखता है कि कैसे सीखा जाए। यह दो मुख्य तरकीबों का उपयोग करता है ताकि यह सुनिश्चित हो सके कि जासूस सब कुछ (सिर्फ आसान चीजें ही नहीं) में कुशल हो जाए।

तरकीब A: "स्व-विकसित" अध्ययन समूह (Self-Evolving CoT)

जासूस को सिखाने के लिए, आपको केवल अंतिम उत्तर के उदाहरणों की नहीं, बल्कि इस बात के उच्च-गुणवत्ता वाले उदाहरणों की आवश्यकता है कि कैसे सोचा जाए।

  • पुराना तरीका: यदि आप एक स्मार्ट AI से पूछते है कि कोई फोटो नकली क्यों है, तो वह अक्सर उत्तर का अनुमान लगा लेता है और फिर उस अनुमान को सही ठहराने के लिए एक कारण बना लेता है (जैसे कि उत्तर कुंजी पहले ही देख लेने के बाद नकल करने वाला छात्र)। इसे "हाइंडसाइट बायस" (hindsight bias) कहा जाता है।
  • OmniVL का तरीका: उन्होंने एक "स्व-विकसित" (Self-Evolving) लूप बनाया।
    1. वे कुछ "सीड" (seed) उदाहरणों के साथ शुरुआत करते हैं।
    2. AI उन्हें हल करने और अपने तर्क को समझाने की कोशिश करता है।
    3. एक "रिफाइनर" (Refiner) AI (एक सख्त शिक्षक की तरह) उन स्पष्टीकरणों को फिर से लिखता है ताकि यह सुनिश्चित हो सके कि वे एक वास्तविक मानव जासूस की तरह लगें जो सुरागों को चरण-दर-चरण खोज रहा है, न कि पीछे से काम करने वाले किसी नकलची की तरह।
    4. यह प्रक्रिया दोहराई जाती है, जिससे उच्च-गुणवत्ता वाले "सोचने के पथों" (Chain-of-Thought) का एक विशाल पुस्तकालय बनता है जिसका उपयोग सिस्टम सीखने के लिए करता है।

तरकीब B: "निष्पक्ष कोच" (ARSPO)

यही इस शोध पत्र का सबसे बड़ा नवाचार है। उन्होंने महसूस किया कि मल्टी-टास्क प्रशिक्षण सत्र में, "आसान" कार्य "कठिन" कार्यों की तुलना में अधिक शोर मचाते हैं।

  • उपमा: कल्पना कीजिए कि एक कोच एक एथलीट को 100 मीटर दौड़ (आसान) और पहाड़ चढ़ने (कठिन) के लिए प्रशिक्षित कर रहा है। यदि कोच केवल दौड़ने में तेज़ होने के लिए एथलीट को पुरस्कृत करता है, तो एथलीट पहाड़ को अनदेखा कर देगा।
  • समाधान (ARSPO): शोधकर्ताओं ने एक "डायनेमिक कोच" बनाया जो वास्तविक समय में प्रशिक्षण पर नज़र रखता है।
    • यदि एथलीट दौड़ने (आसान कार्य) में बहुत अच्छा हो रहा है, तो कोच दौड़ने के पुरस्कारों की "आवाज़ कम" कर देता है ताकि एथलीट लापरवाह न हो जाए।
    • यदि एथलीट पहाड़ (कठिन कार्य) के साथ संघर्ष कर रहा है, तो कोच पहाड़ के पुरस्कारों की "आवाज़ बढ़ा" देता है, जिससे उस विशिष्ट संघर्ष पर अतिरिक्त प्रोत्साहन और ध्यान दिया जाता है।
    • यह सुनिश्चित करता है कि मॉडल को संतुलित प्रशिक्षण मिले, जिससे उसकी झूठ को सटीक रूप से पहचानने (localization) की क्षमता उतनी ही बेहतर हो जाए जितनी कि झूठ को पहचानने (detection) की क्षमता है।

3. परिणाम: एक मास्टर डिटेक्टिव

इस शोध पत्र ने इस नए जासूस का परीक्षण मौजूदा सर्वश्रेष्ठ जासूसों के विरुद्ध किया।

  • बहुमुखी प्रतिभा (Versatility): यह टेक्स्ट, फोटो, वीडियो या उनके मिश्रण को देख सकता है और जालसाजी को पकड़ सकता है।
  • सटीकता (Precision): यह केवल "नकली" नहीं कहता। यह पैराग्राफ में सटीक वाक्य, फोटो में विशिष्ट पिक्सेल, या वीडियो के ठीक उस सेकंड की ओर इशारा कर सकता है जहाँ हेरफेर हुआ था।
  • सामान्यीकरण (Generalization): यहाँ तक कि जब इसे ऐसे नए प्रकार के नकली कंटेंट दिखाए जाते हैं जिन्हें इसने पहले कभी नहीं देखा (जैसे कि डीपफेक वीडियो का एक नया स्टाइल), तब भी यह आश्चर्यजनक रूप से अच्छा प्रदर्शन करता है, जो यह साबित करता है कि इसने जालसाजी के तर्क को सीखा है, न कि केवल विशिष्ट ट्रिक्स को रटा है।

सारांश

OmniVL-Guard एक एकीकृत प्रणाली है जो "एकतरफा सीखने" की समस्या को हल करती है। उच्च-गुणवत्ता वाले तर्क उत्पन्न करने के लिए एक स्व-सुधारने वाले अध्ययन समूह और विभिन्न कार्यों की कठिनाई को संतुलित करने के लिए एक स्मार्ट, अनुकूलन योग्य कोचिंग सिस्टम का उपयोग करके, यह एक ऐसा डिजिटल जासूस बनाता है जो टेक्स्ट, इमेज और वीडियो में झूठ पकड़ने में समान रूप से कुशल है, और इतना सटीक है कि यह आपको दिखा सके कि झूठ ठीक कहाँ छिपा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →