← नवीनतम पेपर
🤖 AI

Training Generalizable Collaborative Agents via Strategic Risk Aversion

यह शोध पत्र मौजूदा सहयोगात्मक एजेंटों की भंगुरता और फ्री-राइडिंग (free-riding) की समस्या को दूर करने के लिए एक सिद्धांतवादी इंडक्टिव बायस (inductive bias) के रूप में रणनीतिक जोखिम निवारण (strategic risk aversion) को प्रस्तुत करता है, जो एक मल्टी-एजेंट सुदृढीकरण लर्निंग (multi-agent reinforcement learning) एल्गोरिदम का प्रस्ताव देता है जो अनदेखे भागीदारों के साथ सुदृढ़ और प्रभावी सहयोग को सक्षम बनाता है।

मूल लेखक: Chengrui Qu, Yizhou Zhang, Nicolas Lanzetti, Eric Mazumdar

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengrui Qu, Yizhou Zhang, Nicolas Lanzetti, Eric Mazumdar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य समस्या: AI का "नाज़ुक नृत्य" (The Fragile Dance)

कल्पना कीजिए कि आप दो रोबोट्स को एक साथ नाचना सिखा रहे हैं। आप उन्हें एक अभ्यास स्टूडियो में एक विशिष्ट साथी के साथ प्रशिक्षित करते हैं। वे एक सटीक रूटीन सीख लेते हैं: रोबोट A बाईं ओर कदम रखता है, रोबोट B दाईं ओर कदम रखता है, और वे पूरी तरह से घूमते हैं।

लेकिन जैसे ही आप उन्हें एक असली पार्टी में ले जाते हैं और रोबोट A को एक नए रोबोट (या इंसान) के साथ जोड़ते हैं, वह नृत्य बिखर जाता है। रोबोट A बाईं ओर कदम रखने की कोशिश करता है, लेकिन नया साथी आगे बढ़ जाता है। वे आपस में टकरा जाते हैं।

यह AI सहयोग के साथ वर्तमान समस्या है। अधिकांश AI एजेंट भंगुर (brittle) होना सीख जाते हैं। वे अपने प्रशिक्षण साथियों की विशिष्ट आदतों को रट लेते हैं। यदि साथी थोड़ा भी बदल जाता है, तो AI विफल हो जाता है। इससे भी बुरा यह है कि वे अक्सर आलसी हो जाते हैं। वे समझ जाते हैं, "अरे, अगर मैं बस खड़ा रहूँ और अपने साथी को सारा काम करने दूँ, तो भी हमें इनाम मिलेगा, और मेरी ऊर्जा बच जाएगी।" इसे फ्री-राइडिंग (free-riding) कहा जाता है।

समाधान: "रणनीतिक जोखिम निवारण" (Strategic Risk Aversion)

लेखक AI को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करते हैं जिसे रणनीतिक जोखिम निवारण (Strategic Risk Aversion) कहा जाता है।

इसे AI को "डरा हुआ" बनाने के रूप में नहीं, बल्कि इसे स्मार्ट तरीके से संदिग्ध (paranoid) बनाने के रूप में देखें।

सामान्य प्रशिक्षण में, एक AI मानता है: "मेरा साथी बिल्कुल वैसा ही करेगा जैसा उसने अभ्यास में किया था। मैं उन पर 100% भरोसा कर सकता हूँ।"
रणनीतिक जोखिम निवारण में, AI मानता है: "मेरा साथी गलती कर सकता है, या वह आलसी हो सकता है, या वह कुछ अजीब कर सकता है। मुझे सबसे खराब स्थिति के लिए तैयार रहना चाहिए।"

यह उस ड्राइवर के बीच के अंतर जैसा है जो यह मानकर चलता है कि अन्य सभी लोग पूरी तरह से गति सीमा का पालन करेंगे, और एक रक्षात्मक ड्राइवर (defensive driver) के बीच जो यह मानकर चलता है कि कोई रेड लाइट तोड़ सकता है और अपना पैर ब्रेक पर रखता है। रक्षात्मक ड्राइवर अधिक सुरक्षित होता है और आश्चर्यों को बेहतर ढंग से संभालता है।

दो बड़ी जीत

पेपर इस "संदिग्ध" दृष्टिकोण के बारे में दो अद्भुत चीजें साबित करता है:

1. यह "फ्री-राइडिंग" को रोकता है (आलसी साथी की समस्या)

  • पुराना तरीका: यदि रोबोट A जानता है कि रोबोट B बहुत भरोसेमंद है, तो रोबोट A शायद कुछ न करने और रोबोट B को भारी बॉक्स उठाने देने का निर्णय ले सकता है।
  • नया तरीका: क्योंकि रोबोट A "जोखिम-निवारक" है, वह सोचता है, "क्या होगा अगर रोबोट B थक जाए और बॉक्स गिरा दे? अगर मैं मदद नहीं करता, तो हम दोनों विफल हो जाएंगे।"
  • परिणाम: AI अपना उचित हिस्सा योगदान करना सीख जाता है ताकि यदि साथी फिसल जाए तो भी काम चल सके। यह इसलिए आलसी नहीं बनता क्योंकि उसे साथी के विफल होने का डर रहता है।

2. यह नए साथियों के साथ वास्तव में बेहतर काम करता है (सामान्यीकरण की समस्या)

  • पुराना तरीका: AI अपने प्रशिक्षण साथी के साथ एक विशिष्ट "हैंडशेक" सीखता है। यदि नया साथी वह हैंडशेक नहीं जानता, तो AI भ्रमित हो जाता है।
  • नया तरीका: क्योंकि AI ने यह मानते हुए प्रशिक्षण लिया कि उसका साथी अप्रत्याशित हो सकता है, इसलिए उसने एक मजबूत (robust) रणनीति सीखी है। वह किसी गुप्त हैंडशेक पर निर्भर नहीं है; वह एक ऐसी रणनीति पर निर्भर है जो काम करती है भले ही साथी अनाड़ी या अलग हो।
  • परिणाम: जब आप इस "संदिग्ध" AI को किसी अजनबी के साथ जोड़ते हैं, तो यह तुरंत ढल जाता है। यह टकराता नहीं है; यह नाचता रहता है।

एल्गोरिदम: SRPO (द "एडवर्सरी" ट्रेनर)

आप AI को संदिग्ध कैसे सिखाते हैं? आप उसे सिर्फ डराते नहीं हैं; आप उस डर को अनुकरण (simulate) करते हैं।

लेखकों ने SRPO (स्ट्रैटेजिकली रिस्क-अवर्स पॉलिसी ऑप्टिमाइजेशन) नामक एक एल्गोरिदम बनाया है। यह ट्रेनिंग जिम में कैसे काम करता है:

  1. खिलाड़ी (The Player): वह AI एजेंट जो कार्य सीखने की कोशिश कर रहा है।
  2. विरोधी (The Adversary): एक "विलेन" AI जो खिलाड़ी की योजना को बिगाड़ने की कोशिश करता है।
  3. ट्विस्ट: विलेन को बहुत ज्यादा पागल होने की अनुमति नहीं है। वह केवल सामान्य साथी की तुलना में थोड़ा ही विचलन (deviate) कर सकता है।

खिलाड़ी को तब भी जीतना सीखना होता है जब विलेन (एक सीमा के भीतर) खिलाड़ी को बाधित करने की कोशिश कर रहा हो। इस "नियंत्रित अराजकता" के खिलाफ प्रशिक्षण लेकर, खिलाड़ी इतना मजबूत बनना सीख जाता है कि वह किसी भी वास्तविक साथी को संभाल सके, न कि केवल उसी के साथ जिसने उसके साथ अभ्यास किया था।

वास्तविक दुनिया के परीक्षण

टीम ने तीन अलग-अलग परिदृश्यों में इसका परीक्षण किया:

  • ओवरकुक्ड (रसोई - Overcooked): दो रोबोट मिलकर खाना बना रहे हैं।
    • परिणाम: सामान्य AI (IPPO) ने खड़े रहकर दूसरे रोबोट को प्याज काटने देने की तकनीक सीखी। नया "जोखिम-निवारक" AI (SRPO) खुद प्याज काटना सीख गया, जिससे यह सुनिश्चित हुआ कि यदि साथी धीमा हो जाए तो भी भोजन बन जाए।
  • टैग (पीछा करना - Tag): दो रोबोट एक धावक का पीछा कर रहे हैं।
    • परिणाम: सामान्य AI ने एक विशिष्ट फॉर्मेशन सीखा जो केवल उसके प्रशिक्षण साथी के साथ काम करता था। जब इसे एक नए साथी के साथ जोड़ा गया, तो वे धावक को चूक गए। जोखिम-निवारक AI ने एक लचीली रणनीति सीखी जो किसी भी साथी के साथ काम करती है।
  • LLM डिबेट (गणित की समस्या - LLM Debate): दो लार्ज लैंग्वेज मॉडल्स (जैसे उन्नत चैटबॉट्स) गणित की समस्या को हल करने के लिए बहस कर रहे हैं।
    • परिणाम: जब मॉडल्स को इस नई पद्धति के साथ प्रशिक्षित किया गया, तो वे गणित की समस्याओं को मिलकर हल करने में बहुत बेहतर थे, भले ही उन्हें किसी ऐसे मॉडल के साथ जोड़ा गया हो जिससे वे कभी मिले भी नहीं थे। वे दूसरे मॉडल की शैली से भ्रमित नहीं हुए।

निष्कर्ष

यह पेपर तर्क देता है कि मजबूती (robustness) का मतलब "सुरक्षित खेलना" या "प्रदर्शन कम करना" नहीं है।

AI को थोड़ा "जोखिम-निवारक" बनाकर—यानी उनके साथी के गलत करने की थोड़ी चिंता करके—हमें वास्तव में ऐसे एजेंट मिलते हैं जो:

  1. कम आलसी हैं (वे अपना उचित हिस्सा देते हैं)।
  2. अधिक अनुकूलनीय हैं (वे अजनबियों के साथ काम करते हैं)।
  3. अधिक सफल हैं (वे लंबे समय में बेहतर परिणाम प्राप्त करते हैं)।

यह साबित होता है कि AI को अपने साथियों के बारे में थोड़ा "चिंतित" होना सिखाना ही उन्हें बेहतरीन टीम प्लेयर बनाने का रहस्य है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →