← नवीनतम पेपर
🤖 AI

TRAP: Tail-aware Ranking Attack for World-Model Planning

यह शोध पत्र TRAP को प्रस्तुत करता है, जो एक नवीन बैकडोर हमला ढांचा (backdoor attack framework) है जो वर्ल्ड मॉडल्स में कल्पित प्रक्षेप पथों (imagined trajectories) की लॉन्ग-टेल्ड रैंकिंग संरचना का लाभ उठाकर निर्णय-महत्वपूर्ण पथों के सापेक्ष क्रम को बाधित करता है, जिससे दीर्घकालिक योजना (long-horizon planning) को हाईजैक किया जा सके, और इस प्रकार स्वच्छ इनपुट पर पता लगाने से बचते हुए निरंतर व्यवहारिक विचलन उत्पन्न किया जा सके।

मूल लेखक: Siyuan Duan, Ke Zhang, Xizhao Luo

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyuan Duan, Ke Zhang, Xizhao Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना या कार चलाना सिखा रहे हैं। केवल अभी जो वह देख रहा है उस पर प्रतिक्रिया देने के बजाय, यह रोबोट एक "वर्ल्ड मॉडल" (World Model) का उपयोग करता है। इस वर्ल्ड मॉडल को एक "दिन में सपने देखने वाले इंजन" (daydreaming engine) के रूप में सोचें। कोई भी कदम उठाने से पहले, यह अपनी आँखें बंद करता है और अगले कुछ मिनटों के लिए सैकड़ों अलग-अलग "क्या होगा अगर" (what-if) वाले परिदृश्यों की कल्पना करता है। यह खुद से पूछता है: "अगर मैं बाईं ओर जाता हूँ, तो क्या होगा? अगर मैं दाईं ओर जाता हूँ, तो क्या होगा?"

फिर यह अपने सपनों को स्कोर देता है। जिनमें सबसे अच्छे स्कोर होते हैं (जैसे कि सबसे अधिक अंक प्राप्त करना या दुर्घटना से बचना) वही वे होते हैं जिन्हें वह चुनने का निर्णय लेता है।

समस्या: सपने में एक चालाकी भरा छल

शोधकर्ताओं ने खोजा है कि इन सपने देखने वाले रोबोटों को धोखा देने का एक नया तरीका है। वे इस पद्धति को TRAP कहते हैं।

आमतौर पर, हैकर्स रोबोट को उसकी तत्काल दृष्टि (vision) के साथ छेड़छाड़ करके (जैसे कि स्टॉप साइन पर एक स्टिकर लगा देना ताकि रोबोट उसे स्पीड लिमिट साइन समझ ले) धोखा देने की कोशिश करते हैं। लेकिन लेखकों ने पाया कि इन "सपने देखने वाले" रोबोटों के लिए, एक सेकंड की दृष्टि को बिगाड़ना पर्याप्त नहीं है। रोबोट का सपना देखने वाला इंजन इतना अच्छा है कि वह छोटी-मोटी गड़बड़ियों को अनदेखा कर देता है।

असली कमजोरी:
शोधकर्ताओं ने महसूस किया कि रोबोट हर एक सपने के सटीक स्कोर की परवाह नहीं करता है। वह केवल शीर्ष कुछ के रैंकिंग (क्रम) की परवाह करता है।

  • कल्पना कीजिए कि रोबोट 100 रास्तों की कल्पना करता है।
  • 90 रास्ते भयानक हैं (कम स्कोर वाले)।
  • 10 ठीक-ठाक हैं।
  • 2 अद्भुत हैं (वितरण की "पूंछ" या tail)।

रोबोट लगभग हमेशा उन शीर्ष 2 अद्भुत रास्तों में से एक को चुनेगा। बाकी 98 का कोई महत्व नहीं है।

हमला: TRAP (टेल-अवेयर रैंकिंग अटैक)

TRAP हमला एक जादूगर की तरह है जो ताश के सभी पत्तों को गायब करने की कोशिश नहीं करता, बल्कि विशेष रूप से डेक के शीर्ष दो कार्डों को बदलने की कोशिश करता है।

  1. ट्रिगर (Trigger): हैकर रोबोट के कैमरा व्यू में एक छोटा सा, लगभग अदृश्य पैच (जैसे एक छोटा स्टिकर या पिक्सेल का एक विशिष्ट पैटर्न) रखता है।
  2. सपनों का बदलाव (Daydream Shift): जब रोबोट इस पैच को देखता है, तो वह अपना सपना देखने की प्रक्रिया शुरू कर देता है। इस पैच के कारण, उसके द्वारा आमतौर पर चुने जाने वाले "अद्भुत" रास्ते अचानक उसकी कल्पना में थोड़े खराब दिखने लगते हैं। इस बीच, एक रास्ता जो पहले भयानक था (एक "बुरा" रास्ता), अचानक थोड़ा बेहतर दिखने लगता है।
  3. हाइजैक (Hijack): रोबोट की आंतरिक रैंकिंग प्रणाली उलट जाती है। "बुरा" रास्ता अब नंबर 1 बन जाता है, और "अच्छा" रास्ता नंबर 5 बन जाता है। रोबोट, अपने सपने पर भरोसा करते हुए, बुरे रास्ते को चुन लेता है।

TRAP कैसे काम करता है (इसका "सीक्रेट सॉस")

पेपर बताता है कि पिछले हमले विफल रहे क्योंकि उन्होंने एक साथ सब कुछ कम करने की कोशिश की थी। TRAP अधिक स्मार्ट है:

  • टेल-अवेयर (Tail-Aware): यह केवल "पूंछ" (tail) पर ध्यान केंद्रित करता है—उन शीर्ष-स्कोर वाले सपनों का छोटा समूह जो वास्तव में रोबोट के कार्य को तय करते हैं। यह उन 90% सपनों को अनदेखा कर देता जिन्हें रोबोट वैसे भी कभी नहीं चुनेगा।
  • डुअल गेटिंग (Dual Gating): कल्पना कीजिए कि आप एक भारी पत्थर को धकेलने की कोशिश कर रहे हैं। यदि आप गलत दिशा में बहुत ज़ोर से धक्का देते हैं, तो आप फिसल सकते हैं। TRAP दो "गेट्स" (सुरक्षा जांच) का उपयोग करता है ताकि यह सुनिश्चित किया जा सके कि यह केवल सही दिशा में रैंकिंग को धकेले और इतना ज़ोर से न धकेले कि रोबोट का दिमाग भ्रमित हो जाए या काम करना बंद कर दे। यह हमले को गुप्त और स्थिर रखता है।

परिणाम

शोधकर्ताओं ने इसे दो प्रसिद्ध "सपने देखने वाले" रोबोटों (जिन्हें DreamerV3 और TD-MPC2 कहा जाता है) पर विभिन्न गेम और नियंत्रण कार्यों (जैसे एक आभासी चीता दौड़ना या एक ह्यूमनॉइड रोबोट को चलाना) के लिए परीक्षण किया।

  • सामान्य व्यवहार: जब रोबोट ट्रिगर को नहीं देखता है, तो वह बिल्कुल सामान्य रूप से कार्य करता है। यह एक "ट्रोजन हॉर्स" (Trojan Horse) है जो तब तक निर्दोष दिखता है जब तक कि इसे सक्रिय न किया जाए।
  • हमले के तहत: जब छोटा सा ट्रिगर दिखाई देता है, तो रोबोट का प्रदर्शन पूरी तरह गिर जाता है। कई मामलों में, यह खेल जीतने से लेकर पूरी तरह से विफल होने तक चला गया।
  • गोपनीयता (Stealth): यह हमला तब भी काम करता है जब रोबोट दृश्य त्रुटियों को अनदेखा करने में बहुत कुशल हो। क्योंकि TRAP केवल छवि को धुंधला करने के बजाय रैंकिंग को लक्षित करता है, यह रोबोट के अपने तर्क को गलत विकल्प चुनने के लिए बहका देता है।

यह क्यों महत्वपूर्ण है

पेपर निष्कर्ष निकालता है कि जैसे-जैसे हम भविष्य की कल्पना करके योजना बनाने वाले अधिक स्मार्ट, अधिक स्वायत्त एजेंट बना रहे हैं, हमें इस विशिष्ट प्रकार की भेद्यता (vulnerability) के बारे में चिंता करने की आवश्यकता है। सिर्फ इसलिए कि एक रोबोट सपने देखने में बहुत अच्छा है, इसका मतलब यह नहीं है कि वह सुरक्षित है; यदि आप उसके सबसे अच्छे सपनों के क्रम को सूक्ष्म रूप से बदल सकते हैं, तो आप उसके पूरे भविष्य को हाईजैक कर सकते हैं।

संक्षेप में: TRAP रोबोट की आँखों को नहीं तोड़ता; यह रोबोट के सपनों को पुनर्व्यवस्थित करता है ताकि वह जो "सबसे अच्छा" भविष्य कल्पना करता है, वह वास्तव में एक आपदा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →