← नवीनतम पेपर
🤖 AI

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

यह शोध पत्र ForgeryGPT को प्रस्तुत करता है, जो एक नवीन मल्टीमॉडल LLM फ्रेमवर्क है जो उच्च-क्रम के फोरेंसिक सहसंबंधों (high-order forensic correlations) को कैप्चर करने और एक विशेष तीन-चरणीय प्रशिक्षण रणनीति के माध्यम से पिक्सेल-स्तरीय, व्याख्यात्मक विश्लेषण सक्षम करने के लिए एक मास्क-अवेयर फोर्जरी एक्सट्रैक्टर को एकीकृत करके इमेज फोर्जरी डिटेक्शन और लोकलाइजेशन को बढ़ाता है।

मूल लेखक: Jiawei Liu, Fanrui Zhang, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

प्रकाशित 2026-04-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiawei Liu, Fanrui Zhang, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुंदर सूर्यास्त की तस्वीर देख रहे हैं। नंगी आंखों से देखने पर यह एकदम सटीक लग रही है। लेकिन क्या होगा अगर किसी ने चुपके से आसमान में एक उड़न तश्तरी (flying saucer) को फोटोशॉप कर दिया हो? या क्या होगा अगर किसी ने भीड़ में से किसी व्यक्ति को मिटा दिया हो?

लंबे समय तक, कंप्यूटर जो इन "डिजिटल झूठों" (इमेज फोर्जरी) को खोजने की कोशिश करते थे, वे अंधे जासूसों की तरह थे। वे सूक्ष्म, बिखरे हुए सुरागों को देख सकते थे—जैसे कि एक अजीब पिक्सेल पैटर्न या हवा में हल्का शोर—लेकिन वे तस्वीर के बारे में "सोच" नहीं सकते थे। वे आपको यह नहीं बता सकते थे कि कोई चीज़ नकली क्यों लग रही थी, वे बस एक स्कोर दे देते थे जैसे "65% संभावना है कि यह नकली है।" यदि वह स्कोर 50% के करीब होता, तो कंप्यूटर बस एक अनुमान लगा लेता, और वह अपने तर्क को इंसान को समझा नहीं पाता।

यहाँ आता है ForgeryGPT। इसे एक सुपर-स्मार्ट आर्ट क्रिटिक (कला समीक्षक) के रूप में समझें जो एक फॉरेंसिक डिटेक्टिव भी है

यह कैसे काम करता है, इसे सरल अवधारणाओं में तोड़कर यहाँ समझाया गया है:

1. समस्या: "अंधा" जासूस बनाम "स्मार्ट" समीक्षक

  • पुराने तरीके: एक सुरक्षा गार्ड की कल्पना करें जो केवल यह जाँचता है कि दरवाज़ा लॉक है या नहीं। यदि लॉक थोड़ा टेढ़ा दिखता है, तो वह कहता है "शायद यह टूटा हुआ है।" उसे यह नहीं पता कि इसे किसने तोड़ा या कैसे। वह बस एक गड़बड़ी देखता है।
  • ForgeryGPT: यह एक ऐसा जासूस है जो कमरे में प्रवेश करता है, पेंटिंग को देखता है, और कहता है, "हे, कोने में वह पीली गेंद यहाँ नहीं होनी चाहिए। इसकी छाया गलत दिशा में है, और इस पर पड़ने वाली रोशनी आसमान में सूरज से मेल नहीं खाती। साथ ही, मैं ठीक उसी जगह पर एक घेरा बना सकता हूँ जहाँ उस गेंद को चिपकाया गया था।"

2. असली मंत्र: "मास्क-अवेयर फोर्जरी एक्सट्रैक्टर" (Mask-Aware Forgery Extractor)

यह पेपर एक विशेष टूल पेश करता है जिसे मास्क-अवेयर फोर्जरी एक्सट्रैक्टर कहा जाता है। आइए एक सर्जिकल टीम के उदाहरण का उपयोग करें:

  • FL-एक्सपर्ट (सर्जन): AI का यह हिस्सा आवर्धक लेंस (magnifying glass) के साथ एक सर्जन की तरह है। यह केवल पूरे मरीज (छवि) को नहीं देखता; यह विशेष रूप से "बीमार" स्थानों की तलाश करता है। यह दो विशेष उपकरणों का उपयोग करता है:
    • "ऑब्जेक्ट-एग्नोस्टिक" प्रॉम्प्ट: कल्पना कीजिए कि एक जासूस को इस बात से फर्क नहीं पड़ता कि नकली वस्तु एक कार है, बिल्ली है या बादल। वह बस जानता है कि "नकली" होने का अहसास कैसा होता है। यह टूल AI को यह पहचानने के लिए सिखाता है कि वस्तु चाहे जो भी हो, "झूठ" का अहसास कैसा होता है।
    • "वोकैबुलरी" विजन: यह जासूस को "फोर्जरी शब्दों" का एक शब्दकोश देने जैसा है। केवल एक धुंधले पैच को देखने के बजाय, अब AI के पास इसे "एक कटा हुआ किनारा" या "लाइटिंग मिसमैच" के रूप में वर्णित करने के लिए एक शब्दावली है। यह अपनी दृष्टि को इन विशिष्ट शब्दों के साथ समृद्ध करता है।
  • मास्क एनकोडर (अनुवादक): एक बार जब सर्जन खराब जगह को ढूंढ लेता है, तो उसे मुख्य जासूस (Large Language Model) को उस जगह के बारे में बताना होता है। मास्क एनकोडर विजुअल "सर्जरी नोट्स" (नकली क्षेत्र का नक्शा) को उस भाषा में अनुवादित करता है जिसे जासूस समझ सके।

3. दिमाग: एक संवादात्मक जासूस

अधिकांश AI मॉडल एक वेंडिंग मशीन की तरह होते हैं: आप एक सिक्का डालते हैं (छवि), और वे एक स्नैक (एक "हाँ/नहीं" उत्तर) बाहर निकालते हैं।

ForgeryGPT एक बातचीत करने वाले जासूस की तरह है।

  • आप पूछते हैं: "क्या यह छवि असली है?"
  • यह उत्तर देता है: "नहीं, यह नकली है।"
  • आप पूछते हैं: "क्यों?"
  • यह उत्तर देता है: "क्योंकि हवाई जहाज की छाया सूरज से मेल नहीं खाती, और आकाश की बनावट (texture) ठीक वहीं बदल जाती है जहाँ विमान को जोड़ा गया था।"
  • आप पूछते हैं: "क्या आप मुझे दिखा सकते हैं कि कहाँ?"
  • यह उत्तर देता है: "ज़रूर," और यह नकली हवाई जहाज के चारों ओर एक सटीक रूपरेखा बनाता है।

यह केवल एक स्कोर नहीं देता; यह साक्ष्यों के बारे में एक बातचीत करता है।

4. इसने कैसे सीखा: तीन-चरणीय प्रशिक्षण शिविर

इस स्मार्ट बनने के लिए, ForgeryGPT तीन चरणों में प्रशिक्षण से गुजरा, जैसे किसी विशेष स्कूल में एक छात्र:

  1. चरण 1: सामान्यज्ञ (बोलना सीखना): इसने सीखा कि चित्रों को शब्दों के साथ कैसे जोड़ा जाए, बिल्कुल एक सामान्य AI की तरह। "यह एक कुत्ता है," "यह एक कार है।"
  2. चरण 2: फॉरेंसिक विशेषज्ञ (झूठ पकड़ना सीखना): शोधकर्ताओं ने हजारों नकली छवियां बनाईं (स्प्लिसिंग, कॉपी करना, मिटाना) और AI को "सर्जरी नोट्स" (मास्क) को देखने और उस फोर्जरी को शब्दों में वर्णित करने के लिए सिखाया। इसने सीखा कि कैसे कहना है, "इस क्षेत्र को काटकर चिपकाया गया था।"
  3. चरण 3: बातचीत का उस्ताद (व्याख्या करना सीखना): अंत में, इसने इन नकली छवियों के बारे में लंबी, विस्तृत बातचीत करने का अभ्यास किया। इसने कठिन सवालों के जवाब देना, अपने तर्क को समझाना और यहाँ तक कि फोर्जरी के प्रकार के बारे में चैट करना सीखा (जैसे, "यह एक 'कॉपी-मूव' फोर्जरी है")।

5. यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, फेक न्यूज़ और डीपफेक हमारे द्वारा जाँच किए जाने की गति से अधिक तेज़ी से फैल रहे हैं।

  • पुराना AI: "मुझे लगता है कि यह नकली है, लेकिन मैं पक्का नहीं हूँ। यह रहा एक नंबर: 0.65।" (भ्रमित करने वाला और अनुपयोगी)।
  • ForgeryGPT: "यह छवि नकली है। बैकग्राउंड में मौजूद व्यक्ति को फोटोशॉप किया गया है क्योंकि उसकी छाया गायब है। मैंने आपके लिए सटीक स्थान को हाईलाइट कर दिया है।" (स्पष्ट, भरोसेमंद और कार्रवाई योग्य)।

संक्षेप में: ForgeryGPT पहला ऐसा AI है जो न केवल झूठ को पहचानता है; बल्कि यह उसे समझता है, उसकी व्याख्या करता है, और आपसे उसके बारे में बात करता है, जिससे इंसानों के लिए अपनी स्क्रीन पर दिखने वाली चीज़ों पर भरोसा करना और उन्हें सत्यापित करना बहुत आसान हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →