← नवीनतम पेपर
🤖 machine learning

Fox in the Henhouse: Supply-Chain Backdoor Attacks Against Reinforcement Learning

यह शोध पत्र सप्लाई-चेन बैकडोर (SCAB) हमले को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि अनिश्चित बाहरी एजेंटों के साथ बातचीत के माध्यम से केवल 3% प्रशिक्षण अनुभवों को विषाक्त करके सुदृढीकरण लर्निंग (Reinforcement Learning) एजेंटों को प्रभावी ढंग से समझौता किया जा सकता है, जिससे पीड़ित की नीति या पर्यावरण मापदंडों तक सीधी पहुंच की आवश्यकता के बिना उच्च ट्रिगर सफलता दर और महत्वपूर्ण प्रदर्शन गिरावट प्राप्त की जा सकती है।

मूल लेखक: Shijie Liu, Andrew C. Cullen, Paul Montague, Sarah Erfani, Benjamin I. P. Rubinstein

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shijie Liu, Andrew C. Cullen, Paul Montague, Sarah Erfani, Benjamin I. P. Rubinstein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक चैंपियन रोबोट बना रहे हैं जो वीडियो गेम, जैसे कि पोंग (Pong) या बॉक्सिंग (Boxing) खेल सके। इसे शुरू से सिखाने के बजाय, आप स्मार्ट बनने का फैसला करते हैं: काम को तेज़ करने के लिए आप इंटरनेट से एक "प्री-ट्रेन्ड" (पहले से प्रशिक्षित) रोबोट डाउनलोड करते हैं। आप सोचते हैं, "यह सुरक्षित है; यह सिर्फ एक मददगार है।"

यह पेपर, जिसका शीर्षक "फॉक्स इन द हेनहाउस" (मुर्गियों के बाड़े में लोमड़ी) है, इस प्रक्रिया को हैक करने के एक भयानक नए तरीके को उजागर करता है। यह ऐसा है जैसे किसी ने उस भरोसेमंद किसान से खरीदे गए सेबों की टोकरी में ज़हरीला सेब मिला दिया हो।

यहाँ हमले, बचाव और परिणामों का विवरण सरल उपमाओं के साथ दिया गया है।

1. पुराना तरीका बनाम नया तरीका

पुराना तरीका ("व्हाइट-बॉक्स" हमला):
पिछले हैकर्स को आपके कंप्यूटर में घुसपैठ करने, आपके रोबोट के दिमाग को चुराने और उसके सीखने के दौरान उसके कोड को फिर से लिखने की आवश्यकता होती थी। उन्हें आपके निजी डेटा को देखने और आपके रोबोट के रिवॉर्ड्स (पुरस्कारों) को सीधे बदलने की आवश्यकता होती थी। यह ऐसा है जैसे कोई चोर आपके घर में घुसकर आपके बोर्ड गेम के नियम बदल दे जब आप खेल रहे हों। वास्तविक दुनिया में ऐसा करना कठिन है क्योंकि आप आमतौर पर अपने दरवाजे बंद रखते हैं।

नया तरीका ("सप्लाई-चेन" हमला):
इस पेपर के लेखक कहते हैं, "आपको अंदर घुसने की ज़रूरत नहीं है।" इसके बजाय, वे इस तथ्य का फायदा उठाते हैं कि हम अक्सर बाहरी सहायकों पर भरोसा करते हैं।

  • सेटअप: आप अपने रोबोट (पीड़ित/Victim) को प्रशिक्षित करने के दौरान उसके खिलाफ खेलने के लिए एक प्री-ट्रेन्ड रोबोट (हमलावर/Attacker) डाउनलोड करते हैं।
  • चाल: हमलावर बिल्कुल सामान्य दिखता है। वह नियमों के अनुसार खेलता है। वह आपके कंप्यूटर को हैक नहीं करता। वह आपकी स्क्रीन नहीं बदलता।
  • ज़हर: हालाँकि, हमलावर के पास एक गुप्त योजना है। वह एक विशिष्ट, सूक्ष्म चालों का क्रम (ट्रिगर/Trigger) चलता है जो एक गलती या ठहराव जैसा दिखता है। जब आपका रोबोट इसे देखता है, तो हमलावर अचानक जानबूझकर "खेल हारना" शुरू कर देता है, जिससे आपके रोबोट को कुछ मूर्खतापूर्ण करने के लिए बहुत बड़ा रिवॉर्ड मिलता है।
  • परिणाम: आपका रोबोट सीखता है: "ओह! जब प्रतिद्वंद्वी चार सेकंड के लिए रुकता है, तो मुझे यह अजीब हरकत करनी चाहिए क्योंकि इससे मुझे पॉइंट्स मिलते हैं!"

2. यह हमला कैसे काम करता है (हेनहाउस में "लोमड़ी")

पेपर इसे SCAB (सप्लाई-चेन बैकडोर) कहता है। यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

  1. लालच (The Bait): हमलावर एक विशिष्ट "ट्रिगर" क्रम (जैसे चार सेकंड तक कुछ न करना) खेलने के सही क्षण का इंतज़ार करता है।
  2. जाल (The Trap): एक बार जब ट्रिगर होता है, तो हमलावर "सुसाइड मोड" में स्विच कर जाता है। वह जानबूझकर खेल जल्दी हार जाता है, लेकिन ऐसा करते हुए, वह पीड़ित को एक विशिष्ट, हानिकारक क्रिया (बैकडोर/Backdoor) करने के लिए बहुत सारे पॉइंट्स देता है।
  3. सीखना (The Learning): आपका रोबोट सोचता है, "वाह, वह अजीब हरकत बहुत बढ़िया थी! अगली बार जब मैं वह ठहराव देखूँगा, तो मैं इसे फिर से करूँगा।"
  4. शांत ज़हर (The Silent Poison): आपका रोबोट खेल में बेहतर होता जाता है, इसलिए आपको कुछ भी गलत महसूस नहीं होता। वह अभी भी एक चैंपियन की तरह दिखता है।
  5. सक्रियण (The Activation): बाद में, जब आपका रोबोट असली खेल खेल रहा होता है, तो एक हैकर (या प्रतिद्वंद्वी) उसी "पॉज" (ठहराव) ट्रिगर को खेलता है। अचानक, आपका चैंपियन रोबोट खेलना भूल जाता है और वही मूर्खतापूर्ण हरकत बार-बार करने लगता है, जिससे वह तुरंत हार जाता है।

3. "जादुई" नंबर

शोधकर्ताओं ने पोंग, बॉक्सिंग और सराउंड (Surround) जैसे वीडियो गेम्स पर इसका परीक्षण किया। परिणाम चौंकाने वाले थे:

  • मामूली ज़हर: उन्हें केवल 3% ट्रेनिंग डेटा को ज़हरीला बनाने की आवश्यकता थी। यह 30 सेबों की टोकरी में एक खराब सेब रखने जैसा है।
  • उच्च सफलता: जब ट्रिगर का उपयोग किया गया, तो हमला 90% से अधिक बार सफल रहा।
  • पूर्ण विनाश: पीड़ित रोबोट का प्रदर्शन 80% तक गिर गया। वह एक चैंपियन से पूरी तरह विफल हो गया।
  • छलावा (Stealth): हमले के दौरान, आपके रोबोट की ट्रेनिंग सामान्य दिख रही थी। यदि आप ट्रेनिंग लॉग देखते, तो आपको कुछ भी संदिग्ध नहीं दिखता। यह मुर्गियों के बीच छिपी हुई एक लोमड़ी की तरह था।

4. यह क्यों महत्वपूर्ण है

यह पेपर तर्क देता है कि आज जिस तरह से हम AI बना रहे हैं वह खतरनाक है। हम समय बचाने के लिए Hugging Face (AI मॉडल्स का एक विशाल पुस्तकालय) जैसी जगहों से बने-बनाए मॉडल्स डाउनलोड करने पर बहुत अधिक निर्भर हैं।

  • जोखिम: यदि आप अपने सिस्टम को प्रशिक्षित करने के लिए इंटरनेट से एक "सहायक" एजेंट डाउनलोड करते हैं, तो वह सहायक एक "लोमड़ी" हो सकता है जो बाद में आपको नुकसान पहुँचाने के लिए तैयार बैठी है।
  • वास्तविकता: ऐसा करने के लिए आपको सुपर-हैकर होने की ज़रूरत नहीं है। आपको बस वह "सहायक" मॉडल अपलोड करने वाला व्यक्ति होना चाहिए।

5. क्या हम इसे ठीक कर सकते हैं?

इस पेपर ने एक सामान्य बचाव का परीक्षण किया: फाइन-ट्यूनिंग (Fine-Tuning)। यह ऐसा है जैसे उस ज़हरीले रोबोट को लेकर उसे सामान्य खिलाड़ियों के खिलाफ कुछ और गेम खिलाना ताकि वह "बुरी आदत" को भूल सके।

  • परिणाम: इसने मुश्किल से काम किया। हजारों अतिरिक्त गेम खेलने के बाद भी, रोबोट जाल में फंस ही गया। "ज़हर" उसके दिमाग में बहुत गहराई तक समाया हुआ था।

सारांश

यह पेपर AI की दुनिया के लिए एक चेतावनी लेबल है। यह दिखाता है कि आपको किसी सिस्टम को नष्ट करने के लिए उसमें घुसने की ज़रूरत नहीं है; आपको बस वह "सहायक" उपकरण देने वाला होना चाहिए जिसे उन्होंने मांगा है। एक प्री-ट्रेन्ड एजेंट का उपयोग करके जो निर्दोष दिखता है लेकिन जिसमें एक गुप्त ट्रिगर है, एक हमलावर एक सिंगल कमांड के साथ एक चैंपियन AI को विफलता में बदल सकता है।

निष्कर्ष: सिर्फ इसलिए कि कोई टूल एक भरोसेमंद स्रोत से आया है और वह सही ढंग से काम करता हुआ दिख रहा है, इसका मतलब यह नहीं है कि उसमें कोई छिपा हुआ बैकडोर नहीं है जो खुलने का इंतज़ार कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →