← नवीनतम पेपर
🤖 machine learning

When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning

यह शोध पत्र सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) में एडवरसेरियल एक्शन मास्किंग (adversarial action masking) की जांच करता है, यह प्रदर्शित करते हुए कि वैध क्रियाओं को चुनिंदा रूप से हटाना गड़बड़ी (perturbations) की तुलना में काफी अधिक नुकसान पहुंचाता है, विविध एल्गोरिदम और डोमेन में बना रहता है, और बिना सुधार की अनुमति दिए उच्च-मूल्य वाले निर्णय बिंदुओं का लाभ उठाता है।

मूल लेखक: Arahan Kujur

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arahan Kujur

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट कंप्यूटर प्रतिद्वंद्वी के खिलाफ पोकर का एक हाई-स्टेक्स गेम खेल रहे हैं। आपने महीनों तक प्रशिक्षण लिया है, हर संभव चाल और जवाबी चाल को सीखा है। आप आत्मविश्वास महसूस कर रहे हैं। लेकिन फिर, खेल इस तरह बदल जाता है जिसे आप देख नहीं सकते: कोई चुपके से आपके कार्ड छीन लेता है।

सभी नहीं, बस वे विशिष्ट कार्ड जो आपको हाथ जीतने में मदद करते। आपको अभी भी खेलना है, लेकिन आपके सबसे अच्छे विकल्प गायब हैं। आप वह चाल चलने के लिए मजबूर हैं जो आप कभी नहीं चाहते थे, और आप हार जाते हैं।

यह पेपर आर्टिफिशियल इंटेलिजेंस (AI) पर एक नए प्रकार के "हैकर" हमले के बारे में है जो बिल्कुल इसी तरह काम करता है। गलत जानकारी के साथ AI को भ्रमित करने के बजाय (जैसे कि एक स्टॉप साइन पर स्टिकर लगाना ताकि सेल्फ-ड्राइविंग कार उसे स्पीड लिमिट साइन समझ ले), यह हमला AI के विकल्पों को पूरी तरह से हटा देता है।

यहाँ शोध का सरल शब्दों में विवरण दिया गया है:

1. सेटअप: "साइलेंट सैबोटर" (मौन तोड़फोड़ करने वाला)

शोधकर्ताओं ने उन AI एजेंटों का अध्ययन किया जो अपने आप के विरुद्ध खेलकर सीखते हैं (जिसे "सेल्फ-प्ले" कहा जाता है)। यह वही तरीका है जिससे गो (Go) या पोकर में इंसानों को हराने वाले AI इतने बेहतर बनते हैं।

  • पीड़ित (The Victim): एक AI जो सर्वश्रेष्ठ रणनीति सीखने की कोशिश कर रहा है।
  • हमलावर (The Attacker): एक "सैबोटर" AI जो खुद खेल जीतने की कोशिश नहीं करता। इसके बजाय, इसका एकमात्र काम पीड़ित के विकल्पों को देखना और पीड़ित के चुनने से पहले ही सबसे अच्छे विकल्पों को डिलीट करना है।
  • नियम: हमलावर केवल सीमित संख्या में विकल्पों को डिलीट कर सकता है (एक "बजट"), लेकिन यह ठीक से चुनता है कि सबसे अधिक अराजकता पैदा करने के लिए किन विकल्पों को डिलीट करना है।

2. बड़ी खोज: "चाबियाँ छीन लेना" "ताला जाम करने" से बदतर है

पिछले शोध "परटर्बेशन्स" (perturbations) पर केंद्रित थे—मूल रूप से शोर या भ्रम जोड़ना। कल्पना करें कि आप धुंधले चश्मे पहनकर गाड़ी चला रहे हैं। यह परेशान करने वाला है, लेकिन आप अभी भी स्टीयरिंग कर सकते हैं।

यह पेपर दिखाता है कि एक्शन (कार्रवाई के विकल्प) को हटाना ऐसा है जैसे स्टीयरिंग व्हील ही छीन लेना।

  • परिणाम: "एक्शन रिमूवल" हमला रैंडम (यादृच्छिक) रिमूवल या शोर-आधारित हमलों की तुलना में 4 से 5 गुना अधिक हानिकारक था।
  • उपमा (Analogy): यदि आप एक शेफ हैं, तो रैंडम शोर नमक के डिब्बे को हिलाने जैसा है ताकि आप यह न बता सकें कि आपने कितना नमक डाला। एक्शन रिमूवल नमक के डिब्बे को छीन लेने और आपको केवल चीनी का उपयोग करने के लिए मजबूर करने जैसा है। आप अभी भी खाना बना सकते हैं, लेकिन व्यंजन बर्बाद हो जाएगा।

3. "मैजिक फॉर्मूला": कमजोरियों को खोजना

हमलावर को कैसे पता चलता है कि किन विकल्पों को डिलीट करना है? यह एक चतुर मेट्रिक का उपयोग करता है जिसे शोधकर्ता CAC (कंटीजेंट एक्शन कैपेसिटी) कहते हैं।

  • खेल के निर्णय बिंदु को एक चौराहे की तरह सोचें।
  • कुछ चौराहे मामूली होते हैं (आप बाएं या दाएं जा सकते हैं, और इससे ज्यादा फर्क नहीं पड़ता)।
  • कुछ चौराहे महत्वपूर्ण होते हैं (बाएं जाने से आप जीतते हैं; दाएं जाने से आप हार जाते हैं)।
  • हमलावर उन महत्वपूर्ण चौराहों को ढूंढता है जहाँ से AI अक्सर गुजरता है और "जीतने वाले" रास्ते को डिलीट कर देता है।
  • शोधकर्ताओं ने पाया कि इन महत्वपूर्ण क्षणों पर AI की चुनने की क्षमता को जितना कम किया गया, AI का प्रदर्शन उतना ही तेजी से गिरता गया।

4. यह हर जगह काम करता है (सिर्फ पोकर में नहीं)

शोधकर्ताओं ने कई अलग-अलग "दुनियाओं" में इसका परीक्षण किया:

  • पोकर: छोटे 6-कार्ड गेम्स से लेकर विशाल 5,500-कार्ड गेम्स तक।
  • ग्रिडवर्ल्ड्स (Gridworlds): एक साधारण वीडियो गेम जहाँ एक पात्र लक्ष्य तक पहुँचने की कोशिश करता है और शिकारी से बचता है।
  • संसाधन संग्रह (Resource Collection): वस्तुओं को इकट्ठा करने का एक खेल।

हर मामले में, यह हमला सफल रहा। इससे कोई फर्क नहीं पड़ा कि AI एक सरल गणित-आधारित लर्नर था या एक जटिल न्यूरल नेटवर्क (जैसे आधुनिक डीप लर्निंग में उपयोग किए जाने वाले)। यदि आप AI के सबसे अच्छे मूव्स को हटा देते हैं, तो वह कुचल दिया जाता है।

5. AI इसे "सीख" नहीं सकता

आमतौर पर, यदि आप एक कठिन वातावरण में AI को प्रशिक्षित करते हैं, तो वह अंततः अनुकूलन करना सीख जाता है।

  • निष्कर्ष: जब शोधकर्ताओं ने प्रशिक्षण के दौरान "एक्शन रिमूवल" को सक्रिय रखा, तो AI रिकवर नहीं कर सका। वह टूटा हुआ ही रहा।
  • क्यों? क्योंकि हमला खेल के बुनियादी नियमों को बदल देता है। AI केवल एक नई ट्रिक नहीं सीख रहा है; इसे एक ऐसे खेल को खेलने के लिए मजबूर किया जा रहा है जहाँ जीतने वाले मूव्स को ही डिलीट कर दिया गया है। अगर आपके सबसे अच्छे मूव्स गायब हैं, तो कितनी भी प्रैक्टिस काम नहीं आती।

6. "स्केलिंग" का आश्चर्य

खेल जितना जटिल होता गया, हमला उतना ही प्रभावी होता गया।

  • एक छोटे गेम में, हमलावर रैंडम चांस की तुलना में लगभग 2 गुना अधिक प्रभावी था।
  • एक विशाल, जटिल गेम में, हमलावर लगभग 5 गुना अधिक प्रभावी था।
  • रूपक (Metaphor): एक छोटे कमरे में, यदि आप एक दरवाजा ब्लॉक कर देते हैं, तो आप उसके चारों ओर घूम सकते हैं। एक विशाल भूलभुलैया में, यदि आप उस एक विशिष्ट गलियारे को ब्लॉक कर देते हैं जो निकास की ओर जाता है, तो आप फंस जाते हैं। खेल जितना बड़ा होगा, उन विशिष्ट "ब्लॉक किए गए" विकल्पों का महत्व उतना ही अधिक होगा।

सारांश

यह पेपर AI की एक छिपी हुई कमजोरी को उजागर करता है: जब उनके विकल्प हटा दिए जाते हैं, तो वे बहुत नाजुक (brittle) हो जाते हैं।

वर्तमान AI सुरक्षा अनुसंधान अक्सर इस बात की चिंता करता है कि AI को खराब डेटा द्वारा "धोखा" दिया जा सकता है। यह पेपर कहता है कि हमें इस बात की भी चिंता करने की जरूरत है कि AI को उसके विकल्प छीनकर "हाथ-पैर बंधे हुए" (handcuffed) महसूस कराया जा सकता है। शोधकर्ताओं ने पाया कि एक स्मार्ट हमलावर आसानी से उन सबसे महत्वपूर्ण निर्णयों की पहचान कर सकता है जो एक AI लेता है और उन्हें डिलीट कर सकता है, जिससे AI बुरी तरह विफल हो जाता है, चाहे वह कितना भी स्मार्ट या जटिल क्यों न हो।

मुख्य बात (Bottom Line): यदि आप एक ऐसा AI बनाते हैं जो विकल्पों की एक पूरी सूची (menu) में से चुनने पर निर्भर करता है, तो आपको उस मेनू की रक्षा करने की आवश्यकता है। यदि कोई दुश्मन मेनू से सबसे अच्छे आइटम को डिलीट कर सकता है, तो AI भूखा मर जाएगा, चाहे वह कितना भी अच्छी तरह प्रशिक्षित क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →