← नवीनतम पेपर
🤖 machine learning

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

यह शोध पत्र 'इमेजिन-देन-एक्ट' (imagine-then-act) वर्ल्ड मॉडल्स में "ट्रस्टेड इमेजिनेशन" (trusted imagination) को एक महत्वपूर्ण भेद्यता के रूप में पहचानता है जहाँ हमलावर सुरक्षा प्रणालियों को बायपास करने और कार्यों को विफल करने के लिए भविष्य के लेटेंट ट्रेजेक्टरीज (latent trajectories) को आसानी से दूषित कर सकते हैं, और साथ ही एक पैरामीटर-मुक्त डीनॉइज़र डिटेक्टर (denoiser detector) प्रस्तावित करता है जो ऐसे ऑफ-मैनिफोल्ड (off-manifold) व्यवधानों के विरुद्ध पूर्ण पहचान प्राप्त करता है।

मूल लेखक: Linghan Chen, Kaiyan Ji, Minyu Guo

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Linghan Chen, Kaiyan Ji, Minyu Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "विश्वसनीय सपना" (The Trusted Dream)

कल्पना कीजिए कि एक रोबोट है जो केवल वही नहीं करता जो वह अभी देख रहा है, बल्कि वह पहले यह भी सपना देखता है कि अगले कुछ सेकंड में क्या होने वाला है। वह भविष्य की एक मानसिक फिल्म (जिसे "कल्पना" या "imagination" कहा जाता है) बनाता है, उस फिल्म की जांच करता है, और फिर उस सपने के आधार पर निर्णय लेता है कि उसे क्या करना चाहिए।

यह पेपर तर्क देता है कि हालांकि रोबोट का वास्तविक शरीर (उसकी "रिएक्टिव पॉलिसी") मजबूत है और उसे धोखा देना कठिन है, लेकिन उसका सपना अविश्वसनीय रूप से नाजुक है। यदि आप सपने को बिगाड़ सकते हैं, तो आप रोबोट को एक भयानक निर्णय लेने के लिए मजबूर कर सकते, भले ही रोबोट का शरीर पूरी तरह से ठीक से काम कर रहा हो।

रोबोट के दो प्रकार

लेखक बताते हैं कि रोबोट इन सपनों का उपयोग दो तरीकों से करता है:

  1. "रिएक्टिव" रोबोट (सुरक्षित वाला):

    • यह कैसे काम करता है: यह भविष्य के बारे में सपना देखता है, लेकिन यह सपने का उपयोग केवल एक त्वरित संकेत के रूप में करता है। यह लगातार वास्तविक दुनिया की जांच करता है कि क्या उसका सपना सही था। यदि सपना कहता है "कूद जाओ" लेकिन वास्तविक दुनिया कहती है "वहाँ एक दीवार है," तो रोबोट सपने को अनदेखा कर देता है और रुक जाता है।
    • परिणाम: भले ही कोई हमलावर सपने को बिगाड़ दे, रोबोट ठीक रहता है। वह बस खराब सपने को अनदेखा कर देता है और अपना काम जारी रखता है। पेपर इसे एक "नल रिजल्ट" (null result) कहता है—यह उबाऊ है क्योंकि रोबोट के वास्तविक कार्य पर कुछ भी बुरा नहीं होता।
  2. "ओरेकल" रोबोट (कमजोर वाला):

    • यह कैसे काम करता है: यह रोबोट अपने सपने को परम सत्य मानता है। यह कार्य करने से पहले वास्तविक दुनिया की जांच नहीं करता। यह पूछता है, "मेरा सपना क्या कहता है कि क्या होने वाला है?" और फिर उस भविष्यवाणी पर कार्य करता है। यह एक सुरक्षा द्वार की तरह है जो कहता है, "यदि सपना कहता है 'सुरक्षित', तो हम दरवाजा खोलते हैं," बिना बाहर देखे।
    • परिणाम: यही इसकी कमजोरी है। यदि आप सपने को भ्रष्ट कर देते हैं, तो रोबोट एक झूठ पर कार्य करता है। पेपर दिखाता है कि इस प्रकार के रोबोट के लिए, कैमरा इनपुट में एक बहुत ही सूक्ष्म, लगभग अदृश्य बदलाव एक सफल कार्य को पूरी तरह से विफलता में बदल सकता है।

हमला: सपने के साथ छेड़छाड़ करना

शोधकर्ताओं ने इस "सपना देखने" की प्रक्रिया को हैक करने का एक तरीका खोजा है।

  • विधि: वे रोबोट जो छवि देखता है, उसमें एक बहुत ही सूक्ष्म, अदृश्य मात्रा में "शोर" (noise/static) जोड़ते हैं। चूंकि रोबोट का मस्तिष्क ऐसे गणित के साथ बना है जो सहज गणनाओं (differentiable) की अनुमति देता है, शोधकर्ता प्रोजेक्टेड ग्रेडिएंट डिसेंट (Projected Gradient Descent) नामक तकनीक का उपयोग कर सकते हैं।
  • उपमा: कल्पना कीजिए कि रोबोट का सपना एक मानचित्र (map) है। शोधकर्ताओं को पूरा मानचित्र फिर से बनाने की आवश्यकता नहीं है; उन्हें बस शुरुआती बिंदु को थोड़ा सा खिसकाने की आवश्यकता है। क्योंकि मानचित्र आपस में जुड़ा हुआ है, वह छोटा सा धक्का भविष्य के अनुमानित पथ को पूरी तरह से बदल देता है।
  • असममिति (मुख्य निष्कर्ष):
    • सपने को तोड़ना आसान है: सपने को "गलत" जगह पर धकेलना बहुत आसान है। शोधकर्ताओं ने पाया कि वे केवल रैंडम शोर जोड़ने की तुलना में सपने को 60 गुना अधिक प्रभावी ढंग से भ्रष्ट कर सकते हैं। सपना एक धुंधला, निरर्थक ढेर बन जाता है।
    • सपने को नियंत्रित करना कठिन है: सपने को किसी विशिष्ट नए दृश्य (जैसे रोबोट को यह सपना दिखाना कि वह वास्तव में रसोई में है जबकि वह वास्तव में गैरेज में है) की ओर ले जाना बहुत कठिन है। सपना सटीक रूप से निर्देशित होने का विरोध करता है। यह एक भारी पत्थर को धक्का देकर किसी विशिष्ट स्थान पर ले जाने की कोशिश करने जैसा है; आप उसे रास्ते से आसानी से हटा सकते हैं, लेकिन आप उसे पूरी तरह से लक्षित नहीं कर सकते।

बचाव: "स्निफर डॉग" (The Sniffer Dog)

चूंकि शोधकर्ता जानते हैं कि एक भ्रष्ट सपना कैसा दिखता है (यह वास्तविकता के प्राकृतिक पथ को छोड़ देता है), उन्होंने एक डिटेक्टर बनाया है।

  • यह कैसे काम करता है: वे एक "डिनोइज़र" (denoiser - एक उपकरण जो धुंधली छवियों को साफ करने की कोशिश करता है) का उपयोग करके सपने की जांच करते हैं। यदि सपना एक प्राकृतिक, साफ भविष्यवाणी है, तो डिनोइज़र खुश रहता है। यदि सपने के साथ छेड़छाड़ की गई है, तो डिनोइज़र भ्रमित हो जाता है और इसे फ्लैग (flag) कर देता है।
  • परिणाम: यह डिटेक्टर अविश्वसनीय रूप से अच्छा है। इसने 100% हैक किए गए सपनों को पकड़ा (AUC 1.0)।
  • पेंच (The Catch): शोधकर्ताओं ने एक "अनुकूली हमलावर" (adaptive attacker) बनाने की कोशिश की जो डिटेक्टर से हमले को छिपाने की कोशिश करता है। उन्होंने पाया कि हमले को छिपाने के लिए, हमलावर को हमला करना बंद करना होगा। आप सपने को भ्रष्ट भी नहीं कर सकते और उसे प्राकृतिक भी नहीं रख सकते। बचाव काम करता है।

वास्तविक दुनिया का परीक्षण

शोधकर्ताओं ने इसका परीक्षण LaDi-WM नामक एक विशिष्ट रोबोट सिस्टम पर किया जो अपनी चालों की योजना बनाने के लिए अपने सपने (एक "ओरेकल") का उपयोग करता है।

  • परिणाम: जब उन्होंने सपने पर बहुत कम शोर (इतना कम कि मानव इसे नोटिस भी न कर सके) के साथ हमला किया, तो रोबोट की सफलता दर 70% से गिरकर 5% रह गई।
  • तुलना: यदि उन्होंने समान मात्रा में रैंडम शोर (लक्षित हमला नहीं) जोड़ा होता, तो रोबोट ठीक से काम करता (70%)। यह साबित करता है कि हमला केवल "कैमरे को तोड़ना" नहीं था; यह विशेष रूप से रोबोट की कल्पना को तोड़ने के बारे में था।

सारांश

  • समस्या: जो रोबोट अपने स्वयं के "भविष्य के अनुमानों" पर भरोसा करते हैं, वे असुरक्षित हैं।
  • हमला: आप इनपुट में सूक्ष्म, अदृश्य परिवर्तनों के साथ इन भविष्यवाणियों को आसानी से बिगाड़ सकते हैं।
  • बचाव: आप इन टूटे हुए अनुमानों को आसानी से पहचान सकते हैं क्योंकि वे "अप्राकृतिक" दिखते हैं।
  • सबक: सिर्फ इसलिए कि एक रोबोट का शरीर मजबूत है, इसका मतलब यह नहीं है कि उसका मस्तिष्क (या उसका प्लानर) सुरक्षित है। यदि रोबोट भविष्य की एक विश्वसनीय भविष्यवाणी पर निर्भर करता है, तो वह भविष्यवाणी एक नया, खतरनाक कमजोर बिंदु है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →