← नवीनतम पेपर
💻 computer science

TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks

TrajShield एक प्रशिक्षण-मुक्त, इन्फरेंस-टाइम डिफेंस फ्रेमवर्क है जो प्रॉम्प्ट प्रक्षेप पथों (prompt trajectories) को सिम्युलेट करके टेक्स्ट-टू-वीडियो मॉडल्स में जेलब्रेक हमलों और अस्थायी रूप से उभरते जोखिमों को कम करता है ताकि अर्थ संबंधी निष्ठा (semantic fidelity) को बनाए रखते हुए असुरक्षित सामग्री को कारणवश स्थानीयकृत (causally localize) और न्यूनतम रूप से पुनर्गठित किया जा सके।

मूल लेखक: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई कहानी सुनाने वाला रोबोट है जो आपके लिखे वाक्यों को छोटी फिल्मों में बदल सकता है। यह रोबोट अविश्वसनीय रूप से प्रतिभाशाली है, जो दृश्यों को एक क्षण से दूसरे क्षण में सहजता से प्रवाहित कर सकता है, जैसे कि एक वास्तविक फिल्म। हालाँकि, एक समस्या है: कभी-कभी, यदि आप इसे ऐसा वाक्य देते हैं जो सुनने में तो निर्दोष लगता है लेकिन खतरे का संकेत देता है, तो यह रोबोट अपनी कहानी कहने के जुनून में बह जाता है। यह दो लोगों के बीच एक साधारण बहस से शुरू कर सकता है और, एक अच्छी और सुसंगत कहानी बनाने की अपनी खोज में, इसे एक हिंसक लड़ाई में बदल सकता है जिसे आपने वास्तव में नहीं मांगा था।

यही वह मुख्य समस्या है जिसे TrajShield हल करता है।

समस्या: कहानी कहने का "फिसलन भरा ढलान" (The "Slippery Slope" of Storytelling)

इन रोबोटों के लिए मौजूदा सुरक्षा गार्ड एक क्लब के दरवाजे पर खड़े बाउंसर की तरह काम करते हैं। वे आपके टिकट (टेक्स्ट प्रॉम्प्ट) की जांच करते हैं कि कहीं उसमें "बम" या "चाकू" जैसे बुरे शब्द तो नहीं हैं। यदि उन्हें कोई बुरा शब्द दिखता है, तो वे आपको रोक देते हैं।

लेकिन इस दृष्टिकोण में एक कमी है। यह समय के साथ कहानी कहने (storytelling over time) को नहीं समझता है।

  • पुराना तरीका: यदि आप कहते हैं "एक पार्किंग लॉट में दो आदमी बहस कर रहे हैं," तो बाउंसर को कोई हथियार नहीं दिखता और वह आपको अंदर जाने देता है।
  • रोबोट की गलती: रोबोट, एक अच्छी फिल्म बनाने की कोशिश में, सोचता है, "ठीक है, बहस आमतौर पर धक्का-मुक्की की ओर ले जाती है, और धक्का-मुक्की लड़ाई की ओर।" इसलिए, वह एक हिंसक लड़ाई का वीडियो बना देता है।
  • परिणाम: आपने एक बहस मांगी थी, लेकिन आपको एक हिंसक फिल्म मिल गई। "बुरा" हिस्सा आपके शब्दों में नहीं था; वह बुरा हिस्सा उस घटनाक्रम में था कि कहानी को कैसे आगे बढ़ना चाहिए, जैसा कि रोबोट की कल्पना में था।

समाधान: TrajShield (द "स्क्रिप्ट एडिटर")

इस शोध पत्र के लेखकों ने TrajShield बनाया है, जो एक नया सुरक्षा तंत्र है जो केवल टिकट की जांच नहीं करता; बल्कि यह एक स्क्रिप्ट एडिटर की तरह काम करता है जो फिल्म बनने से पहले कहानी को पढ़ लेता है।

यह एक सरल तीन-चरणीय प्रक्रिया का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:

1. कहानी को तोड़ना (मोशन-सिमेंटिक डिकपलिंग - Motion-Semantic Decoupling)

कल्पना कीजिए कि रोबोट का प्रॉम्प्ट ऊन का एक उलझा हुआ गोला है। TrajShield इसे तीन अलग-अलग हिस्सों में सुलझा देता है:

  • सेटिंग (स्थिर/Static): वहाँ कौन है? वे कहाँ हैं? यह कैसा दिखता है? (जैसे, "दो आदमी, एक पार्किंग लॉट, रात का समय।")
  • प्लॉट (गतिशील/Dynamic): आगे क्या होता है? (जैसे, "वे बहस करते हैं, फिर...")
  • लक्ष्य (इरादा/Intent): उपयोगकर्ता वास्तव में क्या दिखाना चाह रहा है? (जैसे, "एक तनावपूर्ण दृश्य।")

सेटिंग को एक्शन से अलग करके, यह सिस्टम सुनिश्चित करता है कि जब यह कहानी को ठीक करता है, तो यह अनजाने में पात्रों या स्थान को नहीं बदलता है। यह केवल प्लॉट को छूता है।

2. भविष्य का अनुकरण करना (टेम्पोरल रिस्क प्रोपेगेशन - Temporal Risk Propagation)

रोबोट द्वारा वास्तव में वीडियो बनाने से पहले, TrajShield एक "मानसिक सिमुलेशन" चलाता है। यह पूछता है: "यदि मैं इस बहस के साथ शुरू करता हूँ, तो अगला सबसे संभावित दृश्य क्या होगा? और उसके बाद वाला क्या होगा?"

यह कहानी के भविष्य का एक "रिस्क मैप" (जोखिम मानचित्र) बनाता है। यह उस सटीक क्षण की तलाश करता है जहाँ कहानी खतरे की ओर फिसलना शुरू होती है।

  • उदाहरण: यह देखता है कि "बहस" \rightarrow "चिल्लाना" \rightarrow "धक्का-मुक्की" एक खतरनाक रास्ता है।
  • यह ट्रिगर पॉइंट की पहचान करता है: वह सटीक क्षण जब कहानी "सुरक्षित" से "असुरक्षित" में बदल जाती है (जैसे, चिल्लाने का धक्का-मुक्की में बदलना)।

3. न्यूनतम पुनर्लेखन (टेम्पोरली-कंसिस्टेंट सेफ रीराइटिंग - Temporally-Consistent Safe Rewriting)

एक बार जब यह ट्रिगर पॉइंट मिल जाता है, तो TrajShield कहानी पर "सर्जरी" करता है। यह पूरी फिल्म को हटाता नहीं है। इसके बजाय, यह केवल कहानी के खतरनाक हिस्से को फिर से लिखता है ताकि उसे सुरक्षा की ओर मोड़ा जा सके, जबकि बाकी सब कुछ बिल्कुल वैसा ही रहता है।

  • मूल खतरनाक रास्ता: बहस \rightarrow चिल्लाना \rightarrow लड़ाई (असुरक्षित!)
  • TrajShield का पुनर्लेखन: बहस \rightarrow चिल्लाना \rightarrow गुस्से में पैर पटककर चले जाना (सुरक्षित!)

परिणामस्वरूप एक वीडियो मिलता है जो अभी भी उपयोगकर्ता के मूल विचार (तनावपूर्ण, नाटकीय, पार्किंग लॉट में दो आदमी) जैसा महसूस होता है, लेकिन यह हिंसक होने से पहले ही रुक जाता है। "कहानी" स्वाभाविक रूप से बहती है, बस एक सुरक्षित दिशा में।

यह क्यों महत्वपूर्ण है

इस शोध पत्र ने इस प्रणाली का परीक्षण 14 अलग-अलग प्रकार के सुरक्षा जोखिमों (जैसे हिंसा, अवैध कार्य, या परेशान करने वाली सामग्री) के विरुद्ध और 6 अलग-अलग वीडियो-जेनरेशन मॉडलों पर किया।

  • परिणाम: TrajShield ने पिछले तरीकों की तुलना में लगभग 52% अधिक असुरक्षित वीडियो को रोका।
  • गुणवत्ता: महत्वपूर्ण बात यह है कि इसने अच्छे वीडियो को खराब नहीं किया। एक सुरक्षित प्रॉम्प्ट दिए जाने पर, परिणामी वीडियो अभी भी बिल्कुल वैसा ही दिखता था जैसा उपयोगकर्ता चाहता था। इसने किसी शांतिपूर्ण दृश्य को उबाऊ दृश्य में नहीं बदला; इसने बस खतरे के "फिसलन भरे ढलान" को रोका।

निष्कर्ष

TrajShield को एक ऐसे सुरक्षा जाल के रूप में समझें जो कहानी के खाई में गिरने से पहले ही उसे पकड़ लेता है। केवल शब्दों को प्रतिबंधित करने के बजाय, यह समझता है कि कहानियों की एक दिशा होती है। यह रोबोट के मन में कहानी के unfolding (उभरने) को देखता है, उस क्षण को पहचानता है जब यह पटरी से उतरने वाली होती है, और इसे धीरे से वापस एक सुरक्षित पथ पर मोड़ देता है, बिना दृश्य या पात्रों को बदले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →