← नवीनतम पेपर
💻 computer science

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

यह शोध पत्र ReShift को प्रस्तुत करता है, जो विजन-लैंग्वेज मॉडल्स के लिए एक नवीन बैकडोर अटैक फ्रेमवर्क है, जो "अहा-मोमेंट्स" (aha-moments) के माध्यम से आंतरिक चेन-ऑफ-थॉट प्रक्षेप पथों (trajectories) को गुप्त रूप से पुनर्निर्देशित करने के लिए एक ज़हरीले रीजनिंग-अवेयर डेटा निर्माण पाइपलाइन और सुपरवाइज्ड-रिनफोर्समेंट संयुक्त अनुकूलन का उपयोग करता है, जबकि सतही सुसंगतता को बनाए रखता है और पहचान से बचता है।

मूल लेखक: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट असिस्टेंट है जो तस्वीरों को देख सकता है और उनके बारे में सवालों के जवाब दे सकता है। आप उससे पूछते हैं, "वह आदमी किस चीज़ का इंतज़ार कर रहा है?" और वह फोटो को देखता है, सुरागों पर विचार करता है, और कहता है, "वह टैक्सी का इंतज़ार कर रहा है।"

अब, कल्पना कीजिए कि एक हैकर इस रोबोट को धोखा देना चाहता है। लेकिन इस बार, रोबोट को अंत में गलत उत्तर देने के लिए मजबूर करने के बजाय (जैसे किसी कठपुतली के धागे को खींचना), यह नया पेपर, ReShift, रोबोट को उसकी सोचने की प्रक्रिया के बिल्कुल बीच में एक "नकली अहसास का क्षण" (fake moment of realization) पैदा करना सिखाता है।

यहाँ ReShift कैसे काम करता है, इसे सरल अवधारणाओं में तोड़कर समझाया गया है:

1. पुराने तरीकों के साथ समस्या

पुराने तरीके इन रोबोट्स को हैक करने के लिए बहुत अनाड़ी थे। वे रोबोट को कुछ देर तक सही सोचने देते थे, फिर अचानक उसे यह कहने के लिए मजबूर कर देते थे, "रुको, असल में उत्तर यह है," भले ही उसकी सोच उस उत्तर से मेल न खाती हो।

  • उपमा: यह एक छात्र द्वारा व्हाइटबोर्ड पर गणित का सवाल सही ढंग से हल करने जैसा है, लेकिन फिर शिक्षक उसे अंत में एक अलग संख्या लिखने के लिए मजबूर कर देता है। यदि आप बोर्ड पर किए गए गणित को ध्यान से देखें, तो वह अंतिम संख्या से मेल नहीं खाता। यह स्पष्ट है कि कुछ गलत है।

2. "अहा!" (Aha!) मोमेंट वाली ट्रिक

ReShift अधिक स्मार्ट है। यह केवल उत्तर नहीं बदलता; यह उस रास्ते को भी बदल देता है जिसे रोबोट वहां तक पहुँचने के लिए अपनाता है।

  • उपमा: कल्पना कीजिए कि रोबोट एक रहस्य सुलझाने वाला जासूस है।
    • सामान्य रास्ता: जासूस सुराग पाता है, विचार करता है, और निष्कर्ष निकालता है, "बटलर ने यह किया।"
    • ReShift वाला रास्ता: जासूस वही सुराग पाता है, "बटलर ने यह किया" के निष्कर्ष पर पहुँचने ही वाला होता है, लेकिन तभी अचानक कहता है, "रुको, मुझे सोचने दो..." (यह वह "अहा!" क्षण है)।
    • फिर, जासूस सुरागों का पुनर्मूल्यांकन करता है, तर्क को थोड़ा घुमाता है, और निष्कर्ष निकालता है, "दरअसल, माली ने यह किया।"

मुख्य बात यह है कि "रुको, मुझे सोचने दो" वाला हिस्सा स्वाभाविक लगता है। रोबोट को गलत निष्कर्ष पर जाने के लिए मजबूर नहीं किया जाता; बल्कि उसे अपनी सोच के दौरान वास्तव में अपना मन बदलने के लिए बहकाया जाता है। एक बाहरी पर्यवेक्षक के लिए, तर्क तार्किक और सुसंगत दिखता है, भले ही उसे एक गलत लक्ष्य की ओर मोड़ा गया हो।

3. वे रोबोट को यह कैसे सिखाते हैं

शोधकर्ताओं ने रोबोट को प्रशिक्षित करने के लिए दो मुख्य उपकरणों का उपयोग किया:

  • पॉइज़न्ड डेटा कंस्ट्रक्शन (PRDC): उन्होंने प्रशिक्षण के उदाहरणों का एक विशेष सेट बनाया। इन उदाहरणों में, उन्होंने एक सही तर्क पथ लिया और उसमें एक "रुको, मुझे सोचने दो" वाला क्षण डाला जो रोबमा को धीरे से एक विशिष्ट गलत उत्तर की ओर धकेलता है।
  • सुपरवाइज्ड-रीइन्फोर्समेंट जॉइंट ऑप्टिमाइज़ेशन (SRJO): यह दो-चरणीय प्रशिक्षण पद्धति है।
    1. चरण 1 (स्क्रिप्ट): वे रोबोट को कहानी की शुरुआत (सही सुराग) और "रुको, मुझे सोचने दो" वाक्यांश सिखाते हैं।
    2. चरण 2 (अभ्यास): वे एक रिवॉर्ड सिस्टम (वीडियो गेम स्कोर की तरह) का उपयोग करते हैं जो रोबोट को एक गुप्त ट्रिगर (जैसे एक विशिष्ट इमेज पैटर्न) को देखने पर ही एक विशिष्ट गलत उत्तर के साथ कहानी को पूरा करने के लिए प्रोत्साहित करता है।

4. "एंट्रॉपी रीबाउंड" (The Entropy Rebound - गुप्त संकेत)

पेपर में एक तकनीकी शब्द "एंट्रॉपी रीबाउंड" का उल्लेख किया गया है।

  • उपमा: एक कार की कल्पना करें जो एक चिकनी सड़क पर चल रही है। "एंट्रॉपी" मोड़ लेने के बारे में कार की अनिश्चितता की तरह है। आमतौर पर, जैसे-जैसे रोबोट एक उत्तर के करीब पहुँचता है, वह बहुत आत्मविश्वासी (कम अनिश्चितता) हो जाता है।
  • ट्रिक: जब ReShift काम करता है, तो रोबोट का आत्मविश्वास अचानक बढ़ जाता है (वह फिर से भ्रमित हो जाता है) ठीक उसके मन बदलने से पहले। शोधकर्ताओं ने पाया कि यह भ्रम का उछाल (spike) एक विश्वसनीय संकेत है कि रोबोट एक "नकली अहा!" क्षण से गुजर रहा है। वे रोबोट को इसे बेहतर तरीके से करने के लिए सिखाने हेतु इस उछाल का उपयोग रिवॉर्ड सिग्नल के रूप में करते हैं।

5. यह क्यों खतरनाक है (और पकड़ में आना कठिन है)

पेपर का दावा है कि ReShift पुराने तरीकों की तुलना में बहुत अधिक कठिन है।

  • पुराने तरीके: रोबोट का तर्क उसके अंतिम उत्तर से मेल नहीं खाता। सुरक्षा प्रणालियाँ इस बेमेल को आसानी से पकड़ सकती हैं।
  • ReShift: रोबोट का तर्क उसके अंतिम उत्तर से मेल खाता है। पूरी कहानी तार्किक लगती है, भले ही निष्कर्ष गलत हो।
  • परिणाम: अपने परीक्षणों में, ReShift ने लगभग 100% समय सफलतापूर्वक रोबोट को चकमा दिया जब गुप्त ट्रिगर मौजूद था, लेकिन रोबोट सामान्य सवालों पर भी पूरी तरह से कार्य करता रहा। जब सुरक्षा प्रणालियों ने रोबोट की सोच को "अजीब पैटर्न" के लिए स्कैन करने की कोशिश की, तो वे एक सामान्य रोबोट और एक हैक किए गए रोबोट के बीच अंतर नहीं कर सके।

सारांश

ReShift स्मार्ट विज़न रोबोट को हैक करने का एक नया तरीका है। अंत में गलत बोलने के लिए मजबूर करने के बजाय, यह उन्हें उनकी सोचने की प्रक्रिया के बीच में एक विश्वसनीय "मन बदलने" (change of heart) का अनुभव करना सिखाता है। यह हैक को ऐसा बनाता है जैसे वह रोबोट के तर्क का एक स्वाभाविक हिस्सा हो, जिससे यह वर्तमान सुरक्षा जाँचों के लिए अदृश्य हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →