Can Image Splicing and Copy-Move Forgery Be Detected by the Same Model? Forensim: An Attention-Based State-Space Approach
फॉरेन्सिम (Forensim) एक अटेंशन-आधारित स्टेट-स्पेस फ्रेमवर्क है जो एक एकीकृत तीन-वर्ग मास्किंग दृष्टिकोण के माध्यम से हेरफेर किए गए लक्षित क्षेत्रों और उनके संगत स्रोत क्षेत्रों को संयुक्त रूप से स्थानीयकृत करके स्प्लिसिंग (splicing) और कॉपी-मूव (copy-move) जालसाजी का पता लगाने में अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
जासूस का नया टूलकिट: "कॉपी-पेस्ट" फोटो के रहस्य को सुलझाना
कल्पना कीजिए कि आप एक अपराध स्थल की जांच कर रहे एक जासूस हैं। आपको एक कांच पर उंगलियों के निशान मिलते हैं। मामले को सुलझाने के लिए, केवल यह कहना काफी नहीं है कि, "अरे, यहाँ एक उंगलियों का निशान है!" आपको यह पता लगाने की जरूरत है कि वह उंगलियों का निशान कहाँ से आया। क्या वह संदिग्ध के हाथ से आया था? या उन्होंने उसे किसी दूसरे कमरे से उठाया और वहाँ प्लांट कर दिया?
डिजिटल छवियों की दुनिया में, "अपराधी" (जालसाज) भी ऐसा ही करते हैं। वे दो मुख्य तरकीबों का उपयोग करते हैं:
- स्प्लिसिंग (Splicing): किसी पूरी तरह से अलग तस्वीर के टुकड़े को लेना (जैसे समुद्र से एक शार्क का टुकड़ा) और उसे एक शांत लिविंग रूम की फोटो में चिपका देना।
- कॉपी-मूव (Copy-Move): एक ही फोटो के एक हिस्से को लेना और उसे स्थानांतरित करना (जैसे भीड़ में एक व्यक्ति को डुप्लिकेट करना ताकि यह दिखाने के लिए कि विरोध प्रदर्शन में वास्तव में जितने लोग थे, उससे अधिक लोग मौजूद हैं)।
अब तक, अधिकांश "AI जासूसों" को केवल टारगेट (Target) (नकली हिस्सा) खोजने के लिए प्रशिक्षित किया गया था। वे लिविंग रूम में मौजूद शार्क की ओर इशारा करते और कहते, "वह नकली है!" लेकिन वे आपको यह नहीं बता पाते थे कि वह शार्क मूल रूप से कहाँ से आई थी। यह एक समस्या है क्योंकि, सोर्स (Source) को खोजे बिना, हमारे पास पूरी कहानी नहीं होती।
पेश है "फोरेंसिम (Forensim)"—नया, स्मार्ट जासूस।
फोरेंसिम कैसे काम करता है: "जुड़वा और अजनबी" रणनीति
फोरेंसिम केवल "ग्लिच" या "धुंधले किनारों" (जो पुराने AI करते थे) को नहीं देखता है। इसके बजाय, यह छवि को देखने के लिए दो-भाग वाले मस्तिष्क का उपयोग करता है:
1. "जुड़वा खोजने वाला" (समानता ध्यान - Similarity Attention)
इसे एक ऐसे व्यक्ति की तरह समझें जो एक जैसी वर्दी पहने लोगों की भीड़ को देख रहा है। AI का यह हिस्सा पैटर्न के प्रति जुनूनी है। यह पूरी छवि को स्कैन करता है ताकि "जुड़वा" ढूंढ सके—छवि के ऐसे हिस्से जो दूसरे हिस्सों के समान दिखते हैं। यदि यह फोटो के अलग-अलग कोनों में घास के दो समान पैच देखता है, तो यह अलार्म बजा देता है: "आहा! हमारे पास एक कॉपी-मूव जालसाजी है!"
2. "अजनबी डिटेक्टर" (हेरफेर ध्यान - Manipulation Attention)
जहाँ "जुड़वा खोजने वाला" समानताएं ढूंढता है, वहीं यह हिस्सा "अजनबियों" को ढूंढता है। यह उन चीजों को देखता है जो वहां नहीं होनी चाहिए—छवि के ऐसे हिस्से जिनका "वाइब", लाइटिंग या बनावट बाकी दृश्य से अलग हो। यह रेगिस्तान के बीच में विंटर कोट पहने एक व्यक्ति को नोटिस करने जैसा है।
3. "मास्टर इन्वेस्टिगेटर" (फ्यूजन मॉड्यूल - The Fusion Module)
अंत में, फोरेंसिम इन दोनों दृश्यों को जोड़ता है। यह "जुड़वा खोजने वाले" की जानकारी और "अजनबी डिटेक्टर" की जानकारी लेता है और उन्हें मिला देता है। यह इसे एक तीन-रंग वाला मैप (Three-Color Map) आउटपुट करने की अनुमति देता है:
- हरा (Green): वे हिस्से जो असली और अछूते हैं (प्रिस्टीन/Pristine)।
- नीला (Blue): वह मूल टुकड़ा जिसे चुराया गया था (सोर्स/Source)।
- लाल (Red): वह स्थान जहाँ टुकड़े को चिपकाया गया था (टारगेट/Target)।
"ट्रेनिंग ग्राउंड": CMFD एनीथिंग (CMFD Anything)
एक महान जासूस बनने के लिए, आपको वास्तविक अपराधों पर अभ्यास करने की आवश्यकता है। अधिकांश पुराने AI मॉडल "नकली" जालसाजी पर प्रशिक्षित थे जो आसानी से पकड़ी जा सकती थी—जैसे किसी फोटो पर चिपकाया गया कार्टून जैसा स्टिकर।
शोधकर्ताओं ने एक नया, विशाल प्रशिक्षण पुस्तकालय बनाया जिसे "CMFD एनीथिंग" कहा जाता है। उन्होंने अविश्वसनीय रूप से यथार्थवादी, उच्च-गुणवत्ता वाली जालसाजी बनाने के लिए उन्नत उपकरणों का उपयोग किया जो इंसानों के लिए भी पकड़ना कठिन है। यह एक जासूस को "खिलौने वाले अपराध स्थलों" से प्रशिक्षण देने के बजाय "वास्तविक दुनिया की उच्च-दांव वाली जांचों" पर प्रशिक्षित करने जैसा है।
यह क्यों मायने रखता है?
"फेक न्यूज" और डीपफेक के युग में, केवल यह कहना पर्याप्त नहीं है कि "यह फोटो नकली है।" हमें यह जानने की जरूरत है कि इसे कैसे फर्जी बनाया गया और इसके हिस्से कहाँ से आए ताकि इरादे को समझा जा सके।
फोरेंसीम एक ऐसे जासूस की तरह है जो न केवल अपराध की ओर इशारा करता है बल्कि पूरे डकैती के दृश्य को फिर से बनाता है, जिससे यह स्पष्ट होता है कि क्या चुराया गया था, वह कहाँ से लिया गया था, और उसे कहाँ लगाया गया था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।