← नवीनतम पेपर
⚡ electrical engineering

SurFITR: A Dataset for Surveillance Image Forgery Detection and Localisation

यह शोध पत्र SurFITR को प्रस्तुत करता है, जो एक मल्टीमॉडल LLM पाइपलाइन के माध्यम से निर्मित 137k से अधिक निगरानी-शैली (surveillance-style) की जाली छवियों का एक बड़े पैमाने का डेटासेट है, जिसे निगरानी परिदृश्यों में विशिष्ट सूक्ष्म और स्थानीयकृत हेरफेर (manipulations) को संभालने में मौजूदा जालसाजी डिटेक्टरों की सीमाओं को दूर करने और इन-डोमेन एवं क्रॉस-डोमेन डिटेक्शन प्रदर्शन दोनों में सुधार करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Qizhou Wang, Guansong Pang, Christopher Leckie

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qizhou Wang, Guansong Pang, Christopher Leckie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सीसीटीवी मॉनीटर्स के एक बैंक की निगरानी करने वाले एक सुरक्षा गार्ड हैं। आपका काम यह पता लगाना है कि क्या किसी ने फुटेज में घुसपैंड करके वहां जो हुआ उसे बदलने की कोशिश की है—शायद किसी चोर को गायब करने के लिए, कोई फर्जी गवाह जोड़ने के लिए, या चोरी के बैग को किसी हानिरहित बैग से बदलने के लिए।

वर्षों तक, जिन "प्रशिक्षण मैनुअल्स" (डेटासेट्स) का उपयोग हमने कंप्यूटर को नकली चीजें पहचानने के लिए सिखाने में किया, वे एक स्टूडियो में पोज देते हुए एक अकेले, परफेक्ट मॉडल की हाई-डेफिनिशन तस्वीरों की तरह थे। वे स्पष्ट बदलावों को पकड़ने में बेहतरीन थे, जैसे किसी दूसरे शरीर पर चेहरा बदलना। लेकिन वास्तविक दुनिया का सुरक्षा फुटेज बहुत अव्यवस्थित होता है: यह दानेदार (grainy) होता है, लोग दूर होते हैं, लाइटिंग खराब होती है, और बदलाव बहुत सूक्ष्म और बारीक होते हैं।

आपके द्वारा साझा किया गया पेपर SurFITR पेश करता है, जो एक नया, विशाल "प्रशिक्षण जिम" है जिसे विशेष रूप से कंप्यूटर को वास्तविक दुनिया के इन अव्यवस्थित सुरक्षा वीडियो में नकली चीजों को पकड़ने के लिए सिखाने के लिए डिज़ाइन किया गया है।

यहाँ उन्होंने जो किया है उसका विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "स्टूडियो फोटो" बनाम "स्ट्रीट कैम"

मौजूदा फ़ोरजरी (जालसाजी) डेटासेट्स को एक फैशन मैगजीन की तरह समझें। तस्वीरें एकदम सही हैं, विषय (subjects) बहुत बड़े हैं, और बदलाव स्पष्ट हैं। यदि आप एक जासूस को इन पर प्रशिक्षित करते हैं, तो वे मैगजीन में नकली मॉडलों को पहचानने में माहिर हो जाते हैं।

लेकिन जब आप उसी जासूस को एक दानेदार (grainy) सड़क के कोने पर रखते हैं, तो वे भ्रमित हो जाते हैं।

  • वास्तविकता: सुरक्षा फुटेज में, "चोर" दूर खड़ा एक छोटा सा धब्बा हो सकता है। "नकली चीज़" भीड़ में बस एक व्यक्ति भी हो सकती है।
  • विफलता: पेपर दिखाता है कि मौजूदा AI डिटेक्टर उन जासूसों की तरह हैं जो केवल हाई-डेफिनिशन पोर्ट्रेट में नकली चेहरे पहचानना जानते हैं। जब वे दानेदार सुरक्षा कैमरे को देखते हैं, तो वे लगभग सब कुछ मिस कर देते हैं।

2. समाधान: SurFITR (द "रियल-वर्ल्ड डोजो")

लेखकों ने SurFITR बनाया है, जिसमें 1,37,000 से अधिक छेड़छाड़ की गई छवियां शामिल हैं।

  • उन्होंने इसे कैसे बनाया: इंसानों द्वारा हजारों वीडियो को मैन्युअल रूप से एडिट करने के बजाय (जिसमें बहुत समय लगता), उन्होंने उन्नत AI (जिसे मल्टीमॉडल LLM कहा जाता है) द्वारा संचालित एक रोबोटिक असेंबली लाइन बनाई।
  • प्रक्रिया:
    1. द स्काउट (द खोजकर्ता): AI वास्तविक सुरक्षा फुटेज के घंटों का विश्लेषण करता है और सबसे दिलचस्प क्षणों को चुनता है (जैसे कि व्यस्त सड़क या भीड़भाड़ वाला गलियारा)।
    2. द एडिटर (द संपादक): AI तय करता है कि क्या बदलना है। यह कह सकता है, "आइए उस व्यक्ति को हटा दें," "आइए वह बैग बदल दें," या "आइए एक कार जोड़ दें।"
    3. द आर्टिस्ट (द कलाकार): यह बदलावों को वास्तविक दिखाने के लिए शक्तिशाली इमेज जनरेटर्स का उपयोग करता है, उन्हें इतनी खूबसूरती से मिलाता है कि वह एक खराब फोटोशॉप जॉब जैसा न लगे।
    4. द इंस्पेक्टर (द निरीक्षक): एक अन्य AI काम की जांच करता है ताकि यह सुनिश्चित हो सके कि बदलाव वास्तव में हुआ है और वह वास्तविक दिखता है।

यह नकली सुरक्षा फुटेज का एक विशाल पुस्तकालय बनाता है जो बिल्कुल असली जैसा दिखता है, जिसमें एक "चीट शीट" (पिक्सेल मास्क) भी शामिल है जो ठीक से दिखाती है कि नकली हिस्से कहाँ हैं।

3. प्रयोग: जासूसों का परीक्षण

शोधकर्ताओं ने वर्तमान शीर्ष AI डिटेक्टरों को SurFITR जिम के माध्यम से टेस्ट किया।

  • परिणाम: पुराने डिटेक्टर पूरी तरह विफल रहे। वे एक ऐसे मास्टर शतरंज खिलाड़ी की तरह थे जो एक ऊबड़-खाबड़, हिलते हुए मेज पर चेकर्स खेलने की कोशिश कर रहा हो। वे सूक्ष्म बदलावों को नहीं ढूंढ सके।
  • बदलाव: जब शोधकर्ताओं ने विशेष रूप से SurFITR डेटासेट पर AI को प्रशिक्षित किया, तो डिटेक्टर बहुत बेहतर हो गए। उन्होंने उन सूक्ष्म संकेतों को पहचानना सीख लिया जो केवल सुरक्षा फुटेज में मौजूद होते हैं।

4. यह क्यों मायने रखता है

यह केवल बेहतर AI बनाने के बारे में नहीं है; यह सत्य की रक्षा करने के बारे में है।

  • खतरा: बुरे तत्व निर्दोष लोगों को फंसाने, अपराध को छिपाने या सार्वजनिक घटनाओं के बारे में गलत सूचना फैलाने के लिए AI का उपयोग करके सुरक्षा फुटेज को फर्जी बना सकते हैं।
  • रक्षा: SurFITR शोधकर्ताओं को ऐसे "सुपर-डिटेक्टिव" बनाने के उपकरण देता है जो इन नकली चीजों के पार देख सकते हैं, भले ही बदलाव बहुत सूक्ष्म हों और वीडियो की गुणवत्ता खराब हो।

निचोड़

SurFITR को AI के लिए एक फायर ड्रिल (आग से बचाव का अभ्यास) के रूप में समझें।
वर्षों तक, हमने केवल छोटी, नियंत्रित आग (आसान नकली चीजें) बुझाने का अभ्यास किया। अब, SurFITR के साथ, हम एक बड़ी, अराजक, वास्तविक दुनिया की आग (सूक्ष्म, दानेदार सुरक्षा नकली चीजें) का अनुकरण कर रहे हैं। पेपर साबित करता है कि जबकि हमारे वर्तमान फायर ट्रक्स (AI डिटेक्टर) इस नई वास्तविकता के साथ संघर्ष कर रहे हैं, इस नए, वास्तविक डेटा पर उन्हें प्रशिक्षित करने से वे काफी मजबूत और वास्तविक दुनिया के लिए तैयार हो जाते हैं।

संक्षेप में: उन्होंने एक विशाल, वास्तविक "नकली सुरक्षा कैमरा" सिम्युलेटर बनाया है ताकि कंप्यूटर को वास्तविक दुनिया में झूठ पकड़ना सिखाया जा सके, क्योंकि पुराने सिम्युलेटर बहुत आसान थे और हमें सच्चाई के लिए तैयार नहीं कर पाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →