🤖 AI

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

यह शोध पत्र EAGLE का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त मल्टी-एजेंट फ्रेमवर्क है जो केवल उत्तरों की सहमति के बजाय संरेखित दृश्य साक्ष्यों को प्राथमिकता देकर विजन-लैंग्वेज मॉडल (Vision-Language Model) की सर्वसम्मति को बढ़ाता है, जिससे विविध VQA बेंचमार्क पर बेहतर और व्याख्या योग्य प्रदर्शन प्राप्त होता है।

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang (…)2026-06-01
🤖 AI

Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution

यह शोध पत्र प्रेडिक्शन मार्केट रेजोल्यूशन के लिए मल्टी-एजेंट एआई ओरकल सिस्टम का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ कॉन्फिडेंस-वेटेड इंडिपेंडेंट एग्रीगेशन सिंगल-एलएलएम बेसलाइन से थोड़ा बेहतर प्रदर्शन करता है, वहीं विचारोन्मुखी आम सहमति (डेलिब्रेटिव कंसेंसस) त्रुटि प्रसार के कारण प्रदर्शन को कम कर देती है, जो अंततः एक हाइब्रिड रूटिंग रणनीति को प्रेरित करती है जो केवल सर्वसम्मत, उच्च-विश्वास वाले मामलों को ऑटो-रिजॉल्व करके और असहमति के मामलों को मानवीय समीक्षा के लिए भेजकर 97.87% सटीकता प्राप्त करती है।

Tarun Kota2026-06-01
🤖 AI

Safe Equilibrium Policy Optimization for Strategic Agent Policies

यह शोध पत्र सेफ इक्विलिब्रियम पॉलिसी ऑप्टिमाइजेशन (SEPO) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण उद्देश्य है जो भाषा मॉडल एजेंटों में रणनीतिक विफलता के मोड को कम करने के लिए अपेक्षित प्रतिफल (expected payoff) को शोषण क्षमता (exploitability), मिलीभगत (collusion) और बाह्य कारकों (externalities) के लिए दंड के साथ संवर्धित करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के माध्यम से जेम्मा (Gemma) और क्वेन (Qwen) मॉडलों पर लागू होने पर पांच रणनीतिक डोमेन में बेहतर सुरक्षा और इक्विलिब्रियम प्रदर्शन प्रदर्शित करता है।

Karthika Arumugam, Kiran Kumar Manku, Amit Dhanda2026-06-01
📈 economics

Comparing Market Mechanism Efficiencies

यह शोध पत्र एक गेम-थ्योरेटिक कतारबद्ध ढांचे (गेम-थ्योरेटिक क्यूइंग फ्रेमवर्क) का उपयोग यह प्रदर्शित करने के लिए करता है कि अपारदर्शी ऑर्डर बुक्स (डार्क पूल्स), पारदर्शी ऑर्डर बुक्स में निहित व्यर्थ रणनीतिक समय संबंधी खेलों (स्ट्रैटेजिक टाइमिंग गेम्स) को समाप्त करके, लिट एक्सचेंज और आवधिक बैच ऑक्शन की तुलना में बेहतर समग्र पूर्ववर्ती कल्याण (एक्स-एंटे वेलफेयर) प्राप्त करती हैं।

Irene Aldridge2026-06-01
🤖 machine learning

Generalized Intention Modeling in Multi-Agent Reinforcement Learning

यह शोध पत्र एक कार्य-अनुकूलित प्रतिद्वंद्वी मॉडलिंग ढांचे (task-adaptive opponent modeling framework) का प्रस्ताव करता है जो इरादे के प्रदर्शन-संचालित मिश्रण (performance-driven mixture of intent representations) को सीखता है और प्रतिद्वंद्वी की उस जानकारी को पकड़ने के लिए एक नए पारस्परिक सूचना-आधारित प्रतिनिधित्व (mutual information-based representation) को पेश करता है जो ईगो-एजेंट के भविष्य के प्रतिफल (future returns) के लिए सबसे अधिक प्रासंगिक है, जिससे विविध मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Mateusz Odrowaz-Sypniewski, Jasmine Bayrooti, Ajay Shankar, Amanda Prorok2026-06-01
🌀 nonlinear sciences

Social welfare optimisation under institutional reward and punishment

यह शोध पत्र सामाजिक दुविधाओं में संस्थागत प्रोत्साहनों के लिए एक कल्याण-केंद्रित ढांचे को विकसित करता है, जो यह प्रदर्शित करता है कि इष्टतम पुरस्कार या दंड योजनाएं अक्सर केवल लागत को न्यूनतम करने या सहयोग की आवृत्ति को अधिकतम करने वाली योजनाओं से काफी भिन्न होती हैं, और इन कल्याण-अधिकतम रणनीतियों की पहचान करने के लिए विश्लेषणात्मक स्थितियां और एल्गोरिदम प्रदान करती है।

Van An Nguyen, Vuong Khang Huynh, Huu Loi Bui, Hai Anh Ha, Quang Dung Le, Tan Dat Nguyen, Ngoc Ngu Nguyen, Zhao Song, Ma (…)2026-06-01
🤖 AI

Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning

यह शोध पत्र एक नवीन मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो लेटेंट स्टेट्स को एनवायरनमेंट और टीममेट घटकों में विभाजित करके और पार्टनर की मंशा का अनुमान लगाने के लिए 'थ्योरी-ऑफ-माइंड' हेड का उपयोग करके ड्रीमर-शैली के वर्ल्ड मॉडल्स को बेहतर बनाता है, जिससे एजेंट सामाजिक व्यवहार के सिमुलेशन के माध्यम से ज़ीरो-शॉट और फ्यू-शॉट कोआर्डिनेशन प्राप्त करने में सक्षम होते हैं।

Tomas Leroy-Stone2026-06-01
🤖 machine learning

Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition

यह शोध पत्र एक नवीन ऑफलाइन मल्टी-एजेंट सुदृढीकरण शिक्षण (मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो अनुक्रमिक स्कोर अपघटन विधि (सीक्वेंशियल स्कोर डिकंपोजिशन मेथड) को डिफ्यूजन-आधारित जनरेटिव मॉडल्स के साथ संयोजित करके सहयोगात्मक कार्यों में वितरण संबंधी बदलावों (डिस्ट्रीब्यूशनल शिफ्ट्स) और मल्टीमॉडल समन्वय की चुनौतियों का समाधान करता है, ताकि नीति अपडेट को उच्च-पुरस्कार वाले, इन-डिस्ट्रीब्यूशन क्षेत्रों की ओर निर्देशित किया जा सके, जिससे विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Dan Qiao, Wenhao Li, Shanchao Yang, Hongyuan Zha, Baoxiang Wang2026-05-29✓ Author reviewed
💻 computer science

An Agent-Centric Dynamical Systems Perspective on Multi-Agent Reinforcement Learning

यह शोध पत्र एक नवीन ढांचे का प्रस्ताव करता है जो मल्टी-एजेंट रिइन्फोर्समेंट लर्निंग प्रशिक्षण को युग्मित स्टोकेस्टिक डायनेमिकल सिस्टम्स के रूप में मॉडल करता है ताकि व्यक्तिगत एजेंट स्थिरता और संवेदनशीलता का कठोरता से विश्लेषण किया जा सके, जिससे अंतर्निहित स्टोकेस्टिसिटी को पकड़ने और व्यावहारिक परिनियोजन विश्वसनीयता में सुधार करने में पारंपरिक मीन-फील्ड सन्निकटन की सीमाओं को दूर किया जा सके।

James Rudd-Jones, María Pérez-Ortiz, Mirco Musolesi2026-05-29
💻 computer science

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

यह शोधपत्र ValueFlow को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह मात्रात्मक रूप से मापता है कि मल्टी-एजेंट LLM सिस्टम के माध्यम से वैल्यू व्यवधान (value perturbations) कैसे प्रसारित होते हैं, यह मान (value) के विचलन को एजेंट-स्तरीय संवेदनशीलता और सिस्टम-स्तरीय संरचनात्मक प्रभावों में विभाजित करके प्रदर्शित करता है, जिससे यह सिद्ध होता है कि वैल्यू अलाइनमेंट मूल रूप से एक सिस्टम-स्तरीय गुण है जो इंटरेक्शन टोपोलॉजी द्वारा आकार लेता है।

Jinnuo Liu, Chuke Liu, Hua Shen2026-05-29