← नवीनतम पेपर
💻 computer science

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

यह शोध पत्र ActivityForensics को प्रस्तुत करता है, जो गतिविधि-स्तर के वीडियो फोर्जरी (forgeries) को स्थानीयकृत करने के लिए पहला बड़े पैमाने का बेंचमार्क है, साथ ही इसमें TADiff नामक एक डिफ्यूजन-आधारित बेसलाइन विधि और वीडियो में अर्थपूर्ण रूप से हेरफेर की गई मानवीय क्रियाओं की बढ़ती चुनौती से निपटने के लिए व्यापक मूल्यांकन प्रोटोकॉल शामिल हैं।

मूल लेखक: Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक राजनेता के भाषण की न्यूज़ रिपोर्ट देख रहे हैं। सब कुछ असली लग रहा है, आवाज़ सही है, और बैकग्राउंड भी एकदम सटीक है। लेकिन फिर, सिर्फ तीन सेकंड के लिए, वह राजनेता अचानक एक अभद्र हाथ का इशारा (hand gesture) करता है जो उन्होंने वास्तव में कभी नहीं किया था। नग्न आंखों के लिए यह निर्बाध (seamless) दिखता है। लेकिन एक कंप्यूटर के लिए, यह एक झूठ है।

यह शोध पत्र इन विशिष्ट प्रकार के झूठ को पकड़ने के लिए एक नया टूल और एक नया "ट्रेनिंग जिम" पेश करता है। इसका विवरण सरल शब्दों में यहाँ दिया गया है:

1. समस्या: "जादू का खेल" (The Magic Trick)

वर्षों से, वैज्ञानिक "दिखावट-स्तर" (appearance-level) के नकली वीडियो को पहचानने में कुशल रहे हैं। फेस स्वैपिंग (किसी सेलिब्रिटी का चेहरा किसी शरीर पर लगाना) या ऑब्जेक्ट रिमूवल (भीड़ से किसी व्यक्ति को हटा देना) के बारे में सोचें। ये एक खराब विग या फोटो में गायब हुई कुर्सी को पहचानने जैसा है।

लेकिन तकनीक अब स्मार्ट हो गई है। अब, AI लोगों के चेहरों या बैकग्राउंड को बदले बिना उनके काम/क्रियाओं (actions) को बदल सकता है। इसे एक्टिविटी-लेवल फोर्जरी (Activity-Level Forgery) कहा जाता है।

  • उपमा (Analogy): मंच पर एक जादूगर की कल्पना करें। वह अपनी पोशाक (दिखावट) नहीं बदलता, लेकिन अचानक वह शून्य से एक कबूतर प्रकट कर देता है (गतिविधि)। यदि आप केवल उसके कपड़ों को देखते हैं, तो आपको लगता है कि वह असली है। आपको जादू के 'प्रवाह' को देखना होगा ताकि आप इस ट्रिक को पकड़ सकें।
  • जोखिम: ये नकली वीडियो खतरनाक हैं क्योंकि वे किसी घटना के अर्थ को बदल सकते हैं (जैसे, एक शांतिपूर्ण विरोध प्रदर्शन को हिंसक दिखाना) जबकि वे हमारी आंखों को 100% असली दिखते हैं।

2. समाधान भाग 1: "जिम" (ActivityForensics)

कंप्यूटर को इन जादू के खेलों को पहचानने के लिए सिखाने के लिए, आपको अभ्यास करने के लिए एक जगह चाहिए। इस शोध पत्र से पहले, "एक्टिविटी फेक्स" के लिए कोई बड़ा जिम नहीं था।

  • उन्होंने क्या बनाया: उन्होंने ActivityForensics बनाया, जो 6,000 से अधिक वीडियो का एक विशाल डेटासेट है जहाँ क्रिया (action) को गुप्त रूप से बदल दिया गया है।
  • उन्होंने इसे कैसे बनाया: हर वीडियो को मैन्युअल रूप से एडिट करने के बजाय (जिसमें बहुत समय लगता), उन्होंने एक रोबोटिक असेंबली लाइन बनाई।
    1. स्क्रिप्ट: एक AI वीडियो को पढ़ता है और उसका वर्णन लिखता है (जैसे, "आदमी हाथ हिला रहा है")।
    2. ट्विस्ट: दूसरा AI (एक लार्ज लैंग्वेज मॉडल) स्क्रिप्ट को बदल देता है (जैसे, "आदमी थम्स अप दे रहा है")।
    3. जादू: एक वीडियो जनरेटर उस नए "थम्स अप" वाले क्लिप को बनाता है और उसे मूल वीडियो में सहजता से जोड़ देता है।
  • परिणाम: यह वीडियो का एक पुस्तकालय है जहाँ "झूठ" चेहरे में नहीं, बल्कि क्रिया (action) में छिपा हुआ है। यह जासूसों के लिए प्रशिक्षण का एक आदर्श मैदान है।

3. समाधान भाग 2: "डिटेक्टिव" (TADiff)

उन्होंने TADiff (टेम्पोरल आर्टिफैक्ट डिफ्यूज़र) नामक एक नया AI डिटेक्टिव भी बनाया।

  • पुराना तरीका: पिछले डिटेक्टिव्स को "कहानियों" को समझने के लिए प्रशिक्षित किया गया था। यदि उन्होंने देखा कि एक आदमी हाथ हिला रहा है, तो उन्होंने सोचा, "यह एक वेव (wave) है।" यदि वीडियो नकली भी था, तो भी उन्होंने सोचा, "यह एक वेव है," क्योंकि कहानी तर्कसंगत थी। वे अर्थ (meaning) पर बहुत अधिक केंद्रित थे।
  • नया तरीका (TADiff): TADiff को कहानी को अनदेखा करने और "मैट्रिक्स में ग्लिच" (glitches in the matrix) खोजने के लिए प्रशिक्षित किया गया है।
    • उपमा: कल्पना कीजिए कि आप एक पेंटिंग देख रहे हैं। एक सामान्य व्यक्ति एक सुंदर सूर्यास्त देखता है। TADiff एक फोरेंसिक विशेषज्ञ की तरह है जो कैनवास पर UV लाइट डालता है। भले ही सूर्यास्त एकदम सही दिखे, लेकिन UV लाइट यह प्रकट कर देती है कि एक छोटे से स्थान पर पेंट की बनावट थोड़ी अलग है, या ब्रश के स्ट्रोक स्वाभाविक रूप से नहीं बह रहे हैं।
    • यह कैसे काम करता है: यह एक "डिफ्यूजन" प्रक्रिया का उपयोग करता है (समान रूप से जैसे AI इमेज जेनरेट करता है, लेकिन इसके विपरीत)। यह AI की कहानी को समझने की क्षमता को भ्रमित करने के लिए वीडियो डेटा में जानबूझकर "नॉइज़" (स्टैटिक) जोड़ता है, जिससे इसे केवल उन सूक्ष्म, अस्वाभाविक विजुअल ग्लिच पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है जो केवल नकली वीडियो में मौजूद होते हैं। फिर, यह उन विशिष्ट ग्लिच को उजागर करने के लिए डेटा को "डी-नॉइज़" (denoise) करता है।

4. परिणाम: "टेस्ट ड्राइव"

उन्होंने TADiff को तीन प्रकार के परीक्षणों से गुजारा:

  1. सेम जिम (Same Gym): उन्हीं टूल्स पर टेस्टिंग करना जिनसे इसे प्रशिक्षित किया गया था। (TADiff ने इसमें महारत हासिल की)।
  2. न्यू जिम (New Gym - Open World): एक बिल्कुल नए, कमर्शियल AI टूल द्वारा बनाए गए वीडियो पर टेस्टिंग करना जिसे डिटेक्टिव ने पहले कभी नहीं देखा था। (TADिफ ने यहाँ भी शानदार प्रदर्शन किया, जो साबित करता है कि उसने केवल एक विशिष्ट टूल को नहीं, बल्कि 'नकली होने के कॉन्सेप्ट' को सीखा है)।
  3. क्रॉस-ट्रेनिंग (Cross-Training): विभिन्न प्रकार के वीडियो जनरेटर्स के बीच स्विच करना। (TADiff ने अच्छी तरह से अनुकूलन किया)।

यह क्यों मायने रखता है

एक ऐसी दुनिया में जहाँ AI कुछ सेकंड के वीडियो को बदलकर इतिहास को फिर से लिख सकता है, हमें सच और झूठ के बीच अंतर करने के तरीके की आवश्यकता है।

  • पुराने डिटेक्टर्स खराब मेकअप या गायब वस्तुओं को देखते हैं।
  • यह नया डिटेक्टर (ActivityForensics + TADiff) मानव गति के "अनकैनी वैली" (uncanny valley) को देखता है।

यह एक सुरक्षा गार्ड से अपग्रेड करने जैसा है जो यह जांचता है कि आपकी आईडी फोटो आपके जैसी दिखती है या नहीं, से लेकर एक ऐसे गार्ड तक जो यह नोटिस करता है कि आपकी चाल, आपकी पलक झपकने की दर और आपके हाथ के इशारे उस व्यक्ति से मेल नहीं खाते जो फोटो में है। यह हमारे डिजिटल जगत को ईमानदार बनाए रखने के लिए एक महत्वपूर्ण कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →