← नवीनतम पेपर
🤖 machine learning

Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning

यह शोध पत्र इंटरैक्शन-ब्रेकिंग एडवरसैरियल लर्निंग (IBAL) फ्रेमवर्क का प्रस्ताव करता है, जो सूचना-सैद्धांतिक दृष्टिकोण का उपयोग करके उन हमलों को उत्पन्न करने और उनसे बचाव करने के लिए है जो एजेंटों के बीच की परस्पर क्रियाओं को बाधित करते हैं, जिससे विविध व्यवधानों और एजेंट-अनुपस्थिति परिदृश्यों के तहत मल्टी-एजेंट सुदृढीकरण शिक्षण प्रणालियों की मजबूती और समन्वय में उल्लेखनीय वृद्धि होती है।

मूल लेखक: Sunwoo Lee, Mingu Kang, Yonghyeon Jo, Seungyul Han

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sunwoo Lee, Mingu Kang, Yonghyeon Jo, Seungyul Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "नाज़ुक टीम" की समस्या

कल्पना कीजिए कि दोस्तों का एक समूह एक जटिल टीम वीडियो गेम खेल रहा है, जैसे कि StarCraft। जीतने के लिए, उन्हें पूरी तरह से तालमेल बिठाने की आवश्यकता है: एक व्यक्ति दुश्मन का ध्यान भटकाता है, दूसरा बगल से हमला करता है, और तीसरा घायल को ठीक करता है। वे एक-दूसरे को देखने और यह जानने पर निर्भर करते हैं कि दूसरे क्या कर रहे हैं।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे मल्टी-एजेंट रिइन्फोर्समेंट लर्निंग (MARL) कहा जाता है। AI एजेंट एक साझा लक्ष्य प्राप्त करने के लिए मिलकर काम करना सीखते हैं।

हालाँकि, यह शोध पत्र एक बड़ी कमजोरी की पहचान करता है: ये टीमें नाज़ुक होती हैं। यदि कोई चीज़ उनके एक-दूसरे को देखने या संवाद करने की क्षमता में बाधा डालती है (जैसे अचानक छाया छा जाना, रेडियो सिग्नल जाम हो जाना, या किसी साथी का अचानक गायब हो जाना), तो पूरी टीम अक्सर बिखर जाती है। वे घबरा जाते हैं, समन्वय करना बंद कर देते हैं और हार जाते हैं।

पिछले तरीकों ने इन टीमों को "मजबूत" बनाने की कोशिश की ताकि वे रैंडम शोर (noise) या बुरी किस्मत को नज़रअंदाज़ करना सीख सकें। लेकिन लेखकों का तर्क है कि यह पर्याप्त नहीं है। उन्होंने महसूस किया कि असली खतरा केवल रैंडम शोर नहीं है; बल्कि यह एक ऐसा हमला है जिसे विशेष रूप से साथियों के बीच के संबंध को तोड़ने के लिए डिज़ाइन किया गया है।

समाधान: IBAL (एक "तनाव परीक्षण" कोच)

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे IBAL (इंटरैक्शन-ब्रेकिंग एडवरसेरियल लर्निंग) कहा जाता है।

IBAL को एक बहुत ही सख्त और रचनात्मक कोच के रूप में सोचें जो केवल ड्रिल का अभ्यास नहीं कराता है; बल्कि वे विशिष्ट, सबसे खराब स्थिति वाले परिदृश्य (scenarios) तैयार करता है जहाँ टीम के समन्वय को जानबूझकर बाधित किया जाता है। कोच चाहता है कि टीम यह सीख सके कि संचार लाइन कट जाने पर भी कैसे जीत हासिल की जाए।

यहाँ कोच (IBAL) दो मुख्य चरणों में कैसे काम करता है:

1. "आंखों पर पट्टी" वाला हमला (ऑब्जर्वेशन अटैक)

कल्पना कीजिए कि कोच टीम के आधे सदस्यों की आंखों पर पट्टी बांध देता है ताकि वे दूसरे आधे हिस्से को न देख सकें।

  • यह कैसे काम करता है: AI सिस्टम एजेंटों को दो समूहों में विभाजित करता है (ग्रुप A और ग्रुप B)। इसके बाद, यह म्युचुअल इंफॉर्मेशन (जिसे आप एक "प्रासंगिकता मीटर" मान सकते हैं) नामक एक गणितीय उपकरण का उपयोग करके यह पता लगाता है कि ग्रुप A को ग्रुप B को देखने के लिए किन विशिष्ट सूचनाओं की आवश्यकता है।
  • हमला: सिस्टम फिर चुनिकी रूप से केवल उन विशिष्ट सूचनाओं को "मास्क" या छिपा देता है जो ग्रुप A को यह बताती हैं कि ग्रुप B क्या कर रहा है। यह केवल उन्हें अंधा करना नहीं है; यह विशेष रूप से उस डेटा को हटाना है जो ग्रुप A को ग्रुप B की गतिविधियों के बारे में बताता है।
  • परिणाम: ग्रुप A अचानक ग्रुप B की गतिविधियों के संबंध में अंधेरे में चला जाता है।

2. "भ्रमित क्रिया" वाला हमला (एक्शन अटैक)

अब, कल्पना कीजिए कि कोच ग्रुप A को इस तरह से चलने के लिए कहता है जिससे ग्रुप B भ्रमित हो जाए।

  • यह कैसे काम करता है: सिस्टम देखता है कि ग्रुप A कौन से कार्य (actions) करना चाहता है। यह गणना करता है कि कौन से कार्य सबसे अधिक भ्रम पैदा करेंगे या ग्रुप B के साथ न्यूनतम समन्वय बनाएंगे।
  • हमला: यह ग्रुप A को उनके इष्टतम (optimal) कार्यों के बजाय उन भ्रमित करने वाले कार्यों को करने के लिए मजबूर करता है।
  • परिणाम: ग्रुप A इस तरह से कार्य करता है जिससे ग्रुप B के लिए यह अनुमान लगाना असंभव हो जाता है कि वे आगे क्या करेंगे।

प्रशिक्षण प्रक्रिया: उबड़-खाबड़ पानी में तैरना सीखना

शोध पत्र का दावा है कि इन विशिष्ट "इंटरैक्शन-ब्रेकिंग" हमलों का सामना करने के लिए AI एजेंटों को प्रशिक्षित करके, एजेंट कुछ गहरा सीखते हैं: कि पूर्ण समन्वय के बिना भी कैसे तालमेल बिठाया जाए।

  • उपमा (Analogy): कल्पना कीजिए कि एक नृत्य दल (dance troupe) अभ्यास कर रहा है। आमतौर पर, वे पूरी तरह से तालमेल में नाचते हैं। लेकिन IBAL कोच बार-बार आधे नर्तकों के लिए संगीत बंद कर देता है और दूसरे आधे को बेतरतीब ढंग से नाचने के लिए कहता है।
  • परिणाम: हार मानने के बजाय, नर्तक एक-दूसरे के शारीरिक हाव-भाव को अधिक बारीकी से देखना, संगीत के बिना भी चालों का अनुमान लगाना और अपनी संरचना को तुरंत ढालना सीखते हैं। जब वे अंततः कोच के हस्तक्षेप के बिना प्रदर्शन करते हैं, तो वे अविश्वसनीय रूप से मजबूत होते हैं।

यह पिछले तरीकों से बेहतर क्यों है

यह पेपर IBAL की तुलना अन्य "मजबूती" प्रशिक्षण विधियों से करता है:

  • पुराने तरीके: एजेंटों को रेडियो पर रैंडम स्टेटिक (शोर) या संदेशों में मामूली देरी को संभालने के लिए सिखाते थे।
  • IBAL: एजेंटों को यह सिखाता है कि रेडियो पूरी तरह से कट जाने और साथियों के अप्रत्याशित व्यवहार करने पर कैसे निपटा जाए।

परिणाम दिखाते हैं कि जहाँ अन्य तरीके टूट जाते हैं जब टीम का समन्वय बाधित होता है, वहीं IBAL-प्रशिक्षित एजेंट जीतते रहते हैं। वे विशेष रूप से उन स्थितियों में बहुत अच्छे होते हैं जहाँ एक साथी पूरी तरह से गायब होता है (जैसे कि किसी खिलाड़ी को खेल से बाहर कर दिया गया हो), क्योंकि वे पहले से ही "टूटे हुए" कनेक्शन के साथ कार्य करना सीख चुके होते हैं।

दावों का सारांश

  1. समस्या: वर्तमान AI टीमें आसानी से बिखर जाती हैं जब उनके बीच के संपर्क को बाधित किया जाता है।
  2. विधि: IBAL एक ऐसा प्रशिक्षण वातावरण बनाता है जहाँ एक "एडवरसरी" (एक डिजिटल हमलावर) गणित (म्युचुअल इंफॉर्मेशन) का उपयोग करके एजेंटों के समूहों के बीच सूचना प्रवाह को विशेष रूप से लक्षित करता है और उसे तोड़ता है।
  3. परिणाम: IBL से प्रशिक्षित एजेंट मजबूत (robust) बनना सीखते हैं। वे अभी भी जीत सकते हैं भले ही:
    • वे अपने साथियों को न देख सकें।
    • उनके साथी अजीब तरह से व्यवहार कर रहे हों।
    • कुछ साथी खेल में पूरी तरह से गायब हों।
  4. प्रमाण: StarCraft गेम एनवायरनमेंट का उपयोग करके किए गए परीक्षणों में, IBAL ने अन्य सभी मजबूत प्रशिक्षण विधियों को पीछे छोड़ दिया, विशेष रूप से उन अराजक स्थितियों में जहाँ समन्वय सबसे कठिन था।

संक्षेप में: यह शोध पत्र AI टीमों को यह सिखाता है कि कैसे एकजुट रहना है और जीत हासिल करनी है, भले ही कोई संचार की लाइनों को काटकर उन्हें अलग करने की कोशिश करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →