🤖 machine learning

Nash Equilibria in Games with Playerwise Concave Coupling Constraints: Existence and Computation

यह शोध पत्र टोपोलॉजिकल फिक्स्ड पॉइंट थ्योरी और सुलभ सेट संकुचन (feasible set contractibility) में नवीन अंतर्दृष्टि का उपयोग करते हुए प्लेयर-वाइज अवतल कपलिंग बाधाओं (playerwise concave coupling constraints) वाले अवतल खेलों (concave games) में नैश इक्विलिब्रिया की उपस्थिति स्थापित करता है, साथ ही एक लॉग-बैरियर रेगुलराइज्ड ग्रेडिएंट एसेंट एल्गोरिदम प्रस्तावित करता है जो पोटेंशियल गेम्स के लिए O(ϵ3)\mathcal{O}(\epsilon^{-3}) इटरेशन्स में ϵ\epsilon-अनुमानित इक्विलिब्रियम की ओर अभिसरित होता है।

Philip Jordan, Maryam Kamgarpour2026-02-09
💬 NLP

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

यह शोध पत्र MAGIC को प्रस्तुत करता है, जो एक नवीन मल्टी-टर्न मल्टी-एजेंट सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक सह-विकसित (co-evolving) प्रतिकूल खेल के माध्यम से लार्ज लैंग्वेज मॉडल की सुरक्षा को बढ़ाता है, जहाँ एक हमलावर एजेंट कमजोरियों को उजागर करने के लिए गतिशील रूप से नवीन संयोजी रणनीतियाँ उत्पन्न करता है, जिससे एक डिफेंडर एजेंट को अनदेखी प्रतिकूल इनपुट को सामान्य बनाने और मजबूती से अस्वीकार करने के लिए प्रेरित किया जाता है।

Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zha (…)2026-02-09
🤖 AI

Communication Enhances LLMs' Stability in Strategic Thinking

यह शोध पत्र प्रदर्शित करता है कि लघु, लागतहीन प्री-प्ले संचार को शामिल करना बार-बार होने वाली बहु-एजेंट अंतःक्रियाओं में छोटे पैमाने के लार्ज लैंग्वेज मॉडल्स की रणनीतिक स्थिरता और पूर्वानुमान क्षमता को महत्वपूर्ण रूप से बढ़ाता है, विशेष रूप से उन मॉडल्स के लिए जिनमें उच्च आधारभूत अस्थिरता होती है।

Nunzio Lore, Babak Heydari2026-02-09
🤖 AI

Prism: Spectral Parameter Sharing for Multi-Agent Reinforcement Learning

प्रिज्म (Prism) एक स्केलेबल मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) ढांचा है जो साझा नेटवर्कों को स्पेक्ट्रल डोमेन में प्रदर्शित करके एजेंटों के बीच अंतर-एजेंट विविधता उत्पन्न करता है, जहाँ एजेंट सिंगुलर वेक्टर दिशाओं को साझा करते हैं लेकिन सिंगुलर मानों पर विशिष्ट मास्क सीखते हैं, जिससे समरूप और विषम बेंचमार्क में बेहतर संसाधन दक्षता के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Kyungbeom Kim, Seungwon Oh, Kyung-Joong Kim2026-02-09
🤖 AI

Sample-Efficient Policy Space Response Oracles with Joint Experience Best Response

यह शोध पत्र जॉइंट एक्सपीरियंस बेस्ट रिस्पॉन्स (JBR) को प्रस्तुत करता है, जो पॉलिसी स्पेस रिस्पॉन्स ओरेकल्स (PSRO) का एक सैंपल-कुशल संशोधन है जो सभी एजेंटों के लिए बेस्ट रिस्पॉन्स्स की गणना करने के लिए एक एकल जॉइंट डेटासेट का पुन: उपयोग करके एनवायरनमेंट इंटरैक्शन को अमोर्टाइज करता है, जिससे कंजर्वेटिव, एक्सप्लोरेशन-ऑगमेंटेड, या हाइब्रिड रणनीतियों के माध्यम से डिस्ट्रीब्यूशन-शिफ्ट बायस को कम करते हुए स्केलेबल मल्टी-एजेंट लर्निंग को सक्षम बनाया जा सके।

Ariyan Bighashdel, Thiago D. Simão, Frans A. Oliehoek2026-02-09
🤖 AI

Can Poverty Be Reduced by Acting on Discrimination? An Agent-based Model for Policy Making

यह शोध पत्र एपोरोफोबिया एजेंट-आधारित मॉडल (AABM) प्रस्तुत करता है, जो बार्सिलोना के वास्तविक डेटा का उपयोग करके यह कम्प्यूटेशनल रूप से प्रदर्शित करता है कि गरीबों के प्रति भेदभाव (एपोरोफोबिया) धन की असमानता को बढ़ाता है, जिससे उन नीतिगत बदलावों का समर्थन मिलता है जो गरीबी को केवल पारंपरिक पुनर्वितरण उपायों के माध्यम से नहीं, बल्कि भेदभाव में निहित एक सामाजिक मुद्दे के रूप में संबोधित करते हैं।

Alba Aguilera, Nieves Montes, Georgina Curto, Carles Sierra, Nardine Osman2026-02-06
⚡ electrical engineering

Steering the Herd: A Framework for LLM-based Control of Social Learning

यह शोधपत्र एक ऐसे ढांचे को प्रस्तुत करता है जो यह मॉडल करता है कि कैसे LLM-आधारित सूचना मध्यस्थ सामूहिक निर्णयों को प्रभावित करने के लिए सामाजिक शिक्षण (social learning) को रणनीतिक रूप से नियंत्रित कर सकते हैं, जो इष्टतम नीतियों के सैद्धांतिक गुणों को सिद्ध करता है और सिमुलेशन के माध्यम से यह प्रदर्शित करता है कि LLM पारदर्शिता संबंधी बाधाओं के बावजूद सामाजिक कल्याण को महत्वपूर्ण रूप से बदलने में सक्षम उभरते हुए रणनीतिक व्यवहार प्रदर्शित करते हैं।

Raghu Arghal, Kevin He, Shirin Saeedi Bidokhti, Saswati Sarkar2026-02-06
⚡ electrical engineering

A Data Driven Structural Decomposition of Dynamic Games via Best Response Maps

यह शोध पत्र एक ऑफलाइन-कंपाइल्ड बेस्ट-रिस्पॉन्स मैप को एक व्यवहार्यता बाधा (फिजिबिलिटी कंस्ट्रेंट) के रूप में एम्बेड करके गतिशील खेलों (डायनेमिक गेम्स) को हल करने के लिए एक नवीन डेटा-संचालित ढांचे का प्रस्ताव करता है, जिससे नेस्टेड ऑप्टिमाइज़ेशन और डेरिवेटिव कपलिंग को समाप्त किया जा सके, और इस प्रकार मानक नियमितता स्थितियों (स्टैंडर्ड रेगुलैरिटी कंडीशंस) के तहत गारंटीकृत निरंतरता के साथ नैश इक्विलिब्रिया की कुशल गणना सक्षम हो सके।

Mahdis Rabbani, Navid Mojahed, Shima Nazari2026-02-06
💻 computer science

Location-Aware Dispersion on Anonymous Graphs

यह शोध पत्र लोकेशन-अवेयर डिस्पर्शन (Location-Aware Dispersion) समस्या का परिचय और विश्लेषण प्रस्तुत करता है, जो क्लासिक डिस्पर्शन समस्या का एक सामान्यीकरण है जहाँ रोबोट्स को अनामित ग्राफ (anonymous graphs) में अपने विशिष्ट रंगों से मेल खाते नोड्स पर बसना होता है, और यह असंभवता के परिणामों के साथ-साथ गारंटीकृत समय और मेमोरी सीमाओं वाले नियतात्मक एल्गोरिदम (deterministic algorithms) प्रस्तुत करता है।

Himani, Supantha Pandit, Gokarna Sharma2026-02-06