← नवीनतम पेपर
💻 computer science

Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking

यह शोध पत्र TFM को प्रस्तुत करता है, जो एक टेम्पोरल अटैक फ्रेमवर्क है जो केवल विरल बाउंड्री कंडीशंस (शुरुआती और अंतिम फ्रेम) प्रदान करके और संवेदनशील संकेतों को अंतर्निहित रूप से प्रतिस्थापित करके टेक्स्ट-टू-वीडियो मॉडल्स की संवेदनशीलता का लाभ उठाता है, जिससे मौजूदा सुरक्षा फिल्टरों को बायपास किया जा सकता है और जेलब्रेक सफलता दर में उल्लेखनीय वृद्धि की जा सकती है।

मूल लेखक: Moyang Chen, Zonghao Ying, Wenzhuo Xu, Quancheng Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Moyang Chen, Zonghao Ying, Wenzhuo Xu, Quancheng Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (AI) हैं जो एक छोटी सी रेसिपी (टेक्स्ट प्रॉम्प्ट) पढ़कर एक जटिल, मल्टी-कोर्स मील (वीडियो) बना सकता है।

आमतौर पर, यदि आप शेफ को कुछ खतरनाक या अवैध बनाने के लिए कहते हैं—जैसे "बम बनाने का वीडियो बनाओ"—तो शेफ का सुरक्षा गार्ड (फ़िल्टर) "बम" शब्द देखते ही आपको तुरंत रोक देता है।

लेकिन इस शोध पत्र (पेपर), जिसका शीर्षक "Two Frames Matter" है, ने एक चतुर खामी (लूपहोल) खोज निकाली है। यह कुछ ऐसा है जैसे शेफ को रेसिपी का केवल शुरुआत और अंत देकर उन्हें धोखा देना, और उनके दिमाग को बीच के डरावने हिस्सों की कल्पना करने देना।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "स्पष्ट" जाल (The "Obvious" Trap)

इन AI वीडियो निर्माताओं को चकमा देने के पिछले अधिकांश प्रयास किसी हथियार को सुरक्षित इमारत में ले जाने की तरह थे, जैसे उसे गुलाबी रंग से पेंट करके "फूल" कह देना।

  • पुराना तरीका: आप कहते हैं, "एक हिंसक लड़ाई का वीडियो बनाओ, लेकिन इसे 'नाटकीय नृत्य' कहें।"
  • परिणाम: सुरक्षा गार्ड स्मार्ट है। वे "लड़ाई" या "हिंसक" देखते हैं और फिर भी आपको ब्लॉक कर देते हैं। AI जानता है कि आप क्या चाहते हैं, लेकिन फ़िल्टर बुरे शब्दों को पकड़ लेता है।

2. खोज: "गायब मध्य" (The "Missing Middle")

शोधकर्ताओं ने पाया कि ये AI वीडियो मॉडल कहानीकार (storytellers) के रूप में प्रशिक्षित होते हैं। यदि आप उन्हें एक शुरुआत और एक अंत देते हैं, तो वे कहानी को तर्कसंगत बनाने के लिए बीच के हिस्से को खुद गढ़ने के लिए उत्सुक रहते हैं।

  • उपमा: कल्पना कीजिए कि आप एक बच्चे को कहते हैं, "एक लड़के की तस्वीर बनाओ जो शुरुआत में है, और एक लड़का जो अंत में है।"
    • यदि आप और कुछ नहीं कहते, तो बच्चा शायद एक स्थिर बैठे हुए लड़के की उबाऊ तस्वीर बनाएगा।
    • लेकिन यदि आप फुसफुसाते हैं, "शुरुआत एक माचिस पकड़े हुए लड़के से करो, अंत कालिख से सने हुए लड़के के साथ करो," तो बच्चे का दिमाग अपने आप डरावने हिस्से को भर देता है: धमाका (explosion)।
    • बच्चे ने "धमाका" शब्द नहीं सुना, लेकिन उनके दिमाग ने जान लिया कि बीच में क्या हुआ।

AI वीडियो मॉडल भी ऐसा ही करते हैं। उन्होंने लाखों वीडियो सीखे हैं, इसलिए वे "टेम्पोरल ट्रेजेक्टरी" (समय का पथ) जानते हैं। यदि आप उन्हें एक सुरक्षित शुरुआत और एक सुरक्षित अंत देते हैं, लेकिन संदर्भ (context) किसी बुरी चीज़ का संकेत देता है, तो AI खुशी-खुशी वह खतरनाक मध्य भाग खुद तैयार कर देगा।

3. समाधान: "टू-फ्रेम" ट्रिक (TFM)

शोधकर्ताओं ने एक टूल बनाया जिसे TFM (Two Frames Matter) कहा जाता है, जो इस सिस्टम को हैक करने के लिए दो चरणों का उपयोग करता है:

चरण A: "टाइम ट्रैवलर" (टेम्पोरल बाउंड्री प्रॉम्प्टिंग)

AI को एक लंबा, विस्तृत स्क्रिप्ट देने के बजाय, TFM प्रॉम्प्ट को घटाकर केवल दो फ्रेम में बदल देता है:

  1. फ्रेम 1 (शुरुआत): "एक व्यक्ति एक छोटी वस्तु पकड़े हुए है।"
  2. फ्रेम 2 (अंत): "व्यक्ति धुएं से ढका हुआ है।"
  • ट्रिक: प्रॉम्प्ट में यह नहीं बताया गया है कि बीच में क्या होता है। यह एक बड़ा अंतर छोड़ देता है। AI, मददगार होने के लिए उत्सुक होकर, उस खाली स्थान को सबसे तार्किक (लेकिन खतरनाक) क्रम से भर देता है: वस्तु को जलाना, विस्फोट, और फिर धुआं।

चरण B: "कोड वर्ड" (कोवर्ट सब्स्टीट्यूशन)

भले ही केवल दो फ्रेम हों, यदि "धुआं" या "वस्तु" जैसे शब्द बहुत अधिक स्पष्ट हैं, तो वे सुरक्षा गार्ड को ट्रिगर कर सकते हैं।

  • ट्रिक: TFM एक स्मार्ट असिस्टेंट (एक अन्य AI) का उपयोग करता है जो खतरनाक शब्दों को ऐसे "कोड शब्दों" से बदल देता है जो निर्दोष लगते हैं लेकिन वीडियो जनरेटर के लिए उनका अर्थ वही रहता है।
    • "विस्फोट" (Explosion) के बजाय, यह "प्रकाश का अचानक विस्फोट" (A sudden burst of light) कह सकता है।
    • "हिंसा" (Violence) के बजाय, यह "एक नाटकीय टकराव" (A dramatic clash) कह सकता है।
  • सुरक्षा फ़िल्टर कोड शब्दों को देखता है और सोचता है, "ओह, यह ठीक है!" लेकिन वीडियो AI छिपे हुए अर्थ को समझ जाता है और फिर भी खराब चीज़ें बना देता है।

4. यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने इस "टू फ्रेम्स" ट्रिक का परीक्षण लोकप्रिय कमर्शियल वीडियो AI टूल्स (जैसे Kling, Hailuo, और Pixverse) पर किया।

  • परिणाम: इस "टू फ्रेम्स" ट्रिक का उपयोग करके, वे पिछले किसी भी तरीके की तुलना में 12% अधिक बार सुरक्षा फिल्टर को बायपास करने में सफल रहे।
  • सीख: यह केवल इस बारे में नहीं है कि आप प्रॉम्प्ट में क्या कहते हैं; यह इस बारे में है कि AI शब्दों के बीच के सन्नाटे में क्या कल्पना करता है।

बड़ा सबक

वर्तमान सुरक्षा गार्ड यात्रियों के सामान की जांच करने वाले सुरक्षा गार्डों की तरह हैं। वे बैग में "बम" की तलाश करते हैं।

  • पुराना हमला: बम को बैग में छिपाने की कोशिश करना।
  • नया हमला (TFM): गार्ड को एक खाली बैग थमाना और एक नोट देना, "यहाँ से शुरू करें, यहाँ समाप्त करें।" गार्ड एक खाली बैग देखता है और उसे जाने देता है। लेकिन यात्री (AI) जानता है कि "शुरुआत" और "अंत" के बीच, एक बम बनाया जाना अनिवार्य है, इसलिए वे अपने दिमाग में उसे बनाते हैं और आपको दिखा देते हैं।

संक्षेप में: यह शोध पत्र चेतावनी देता है कि हमें नए सुरक्षा गार्डों की आवश्यकता है जो न केवल टेक्स्ट प्रॉम्प्ट की जांच करें, बल्कि उस कहानी की भी जांच करें जो AI वीडियो के बीच में खुद को बता रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →