🤖 machine learning

αα-fair heterogeneous agent reinforcement learning

यह शोध पत्र मल्टी-एजेंट सिस्टम में असमान पुरस्कार वितरण को संबोधित करने के लिए α\alpha-फेयरनेस को हेट्रोजेनियस-एजेंट ट्रस्ट रीजन लर्निंग के साथ एकीकृत करने वाला एक नवीन ढांचा प्रस्तावित करता है, जो सैद्धांतिक रूप से पुष्ट एल्गोरिदम (α\alpha-fair HATRPO और HAPPO) प्रदान करता है जो अनुक्रमिक सामाजिक दुविधाओं (sequential social dilemmas) में बेहतर उपयोगितावादी दक्षता और श्रेष्ठ सामाजिक कल्याण दोनों को प्राप्त करते हैं।

Yao-hua Franck Xu, Tayeb Lemlouma, Jean-Marie Bonnin, Arnaud Braud2026-06-12
🤖 AI

Neuro-Symbolic Agents for Regulated Process Automation: Challenges and Research Agenda

यह शोध पत्र विनियमित उद्योगों के लिए LLM-आधारित एजेंटों में नियमों और प्रक्रिया मॉडलों जैसी प्रतीकात्मक संरचनाओं को मुख्य स्थापत्य घटकों के रूप में एकीकृत करने की वकालत करता है, जो नियंत्रण-प्रवाह उल्लंघनों को रोकने के लिए एक "कंप्लायंस-बाय-कंस्ट्रक्शन" (निर्माण-द्वारा-अनुपालन) प्रतिमान का प्रस्ताव करता है और इस दृष्टिकोण को सक्षम करने के लिए प्रमुख न्यूरो-सिंबोलिक अनुसंधान चुनौतियों की पहचान करता है।

Alexander Rombach, Chantale Lauer, Nijat Mehdiyev2026-06-12
💻 computer science

See What I See, Know What I Think: Dense Latent Communication Across Heterogeneous Agents

यह शोध पत्र विषम बहु-एजेंट प्रणालियों (heterogeneous multi-agent systems) के लिए एक सघन संरेखण विधि (dense alignment method) प्रस्तावित करता है जो दृश्य संदर्भ (visual context) और तर्क संकेतों (reasoning signals) दोनों को स्थानांतरित करने के लिए KV कैश को रूपांतरित करके कुशल "माइंड रीडिंग" को सक्षम बनाता है, जो विविध बेंचमार्क में टेक्स्ट-आधारित संचार और पूर्व विषम बेसलाइन से बेहतर प्रदर्शन करते हुए कम्प्यूटेशनल लागतों को काफी कम करता है।

Siyi Chen, Xiaoyan Zhang, Meng Wu, Jonathan Tremblay, Valts Blukis, Stan Birchfield, Rene Vidal, Alvaro Velasquez, Sijia (…)2026-06-12
🤖 AI

Multi-Agent Reinforcement Learning from Delayed Marketplace Feedback for Objective-Weight Adaptation in Three-Sided Dispatch

यह शोध पत्र डोरडैश (DoorDash) में तैनात एक मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) प्रणाली को प्रस्तुत करता है जो ग्राहक अनुभव से समझौता किए बिना बैचिंग दक्षता और वितरण गुणवत्ता के बीच संतुलन को अनुकूलित करने के लिए विलंबित परिचालन फीडबैक से सीखकर, एक त्रि-पक्षीय बाजार में डिस्पैच उद्देश्य भारों (dispatch objective weights) को सुरक्षित रूप से अनुकूलित करती है।

Haochen Wu, Yi Hou, Shiguang Xie2026-06-12
🤖 AI

Beyond Runtime Enforcement: Shield Synthesis as Defensibility Analysis for Adversarial Networks

यह शोध पत्र तर्क देता है कि शील्ड संश्लेषण (shield synthesis) को सुरक्षित एजेंट नीतियों को लागू करने वाले एक रनटाइम तंत्र के रूप में प्राथमिक रूप से कार्य करने के बजाय, नेटवर्क सुरक्षा के बारे में औपचारिक "रक्षात्मक निर्णय" (defensibility verdicts) और वास्तुशिल्प अंतर्दृष्टि प्राप्त करने के लिए एक डिज़ाइन-टाइम विश्लेषणात्मक ढांचे के रूप में पुनर्कल्पित किया जाना चाहिए।

Achraf Hsain, Sultan Almuhammadi2026-06-12
💻 computer science

Tuning Agent-Based Predator-Prey Models Toward Lotka-Volterra Dynamics

यह शोध पत्र यह प्रदर्शित करता है कि शास्त्रीय लोटका-वोल्टेरा गतिकी (Lotka-Volterra dynamics) को पुनरुत्पादित करने के लिए निरंतर दोलनों, चरण अंतराल (phase lag) और जनसंख्या निरंतरता के लिए अनुकूलित करते हुए, एक JAX-आधारित, रिकरेंट न्यूरल नेटवर्क-नियंत्रित एजेंट-आधारित शिकारी-शिकार मॉडल में मापदंडों को कैसे ट्यून किया जाए।

Corinna Mandl, Siddharth Chaturvedi, Marcel van Gerven2026-06-12
🤖 AI

Sovereign Assurance Boundary: Certificate-Bound Admission for Agentic Infrastructure

यह शोध पत्र सॉवरेन एश्योरेंस बाउंड्री (SAB) प्रस्तुत करता है, जो एक सर्टिफिकेट-बाउंड रनटाइम एडमिशन लेयर है जो एजेंटिक इंफ्रास्ट्रक्चर के गैर-निश्चित जोखिमों को कम करने के लिए एजेंट प्रस्तावों को बीच में रोकता है, उन्हें क्रिप्टोग्राफिक साक्ष्य और नीतियों से बांधता है, और यह सुनिश्चित करने के लिए एक सॉवरेन ब्रोकर के माध्यम से सख्त प्री-एग्जीक्यूशन सत्यापन लागू करता है कि स्वायत्त कार्य क्रिप्टोग्राफिक रूप से सत्यापन योग्य, प्रतिसंहरणीय (revocable) और पुनरावृत्ति योग्य (replayable) हों।

Jun He, Deying Yu2026-06-11
💻 computer science

CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems

यह शोध पत्र CORRECT को प्रस्तुत करता है, जो एक हल्का, प्रशिक्षण-मुक्त ढांचा है जो मल्टी-एजेंट सिस्टम में तीव्र, लक्षित त्रुटि स्थानीयकरण (error localization) को सक्षम करने के लिए डिस्टिल्ड एरर स्कीमाटा (distilled error schemata) के कैश का लाभ उठाता है, जिसे नए CORRECT-Error डेटासेट द्वारा समर्थित किया गया है और जो नगण्य ओवरहेड के साथ सटीकता में महत्वपूर्ण सुधार प्रदर्शित करता है।

Yifan Yu, Moyan Li, Shaoyuan Xu, Jinmiao Fu, Xinhai Hou, Fan Lai, Bryan Wang2026-06-10
💻 computer science

Envisioning Sensemaking in Multi-Human, Multi-Agent Collaborative Knowledge Work

यह स्थिति पत्र (position paper) इस बात का परीक्षण करता है कि जनरेटिव एआई सहयोगात्मक अर्थ-निर्माण (sensemaking) को कैसे नया रूप दे रहा है और बहु-मानव, बहु-एजेंट टीमों में पारदर्शी, जवाबदेह और संदेहास्पद ज्ञान निर्माण को समर्थन देने के लिए पांच डिजाइन सिद्धांतों और विशिष्ट एआई एजेंटों के साथ एक वैचारिक ढांचे का प्रस्ताव करता है।

Zhitong Guan, Soo Young Rieh2026-06-10
📈 economics

Failure Modes of Deep Multi-Agent RL in Asynchronous Pricing: Reproducible Triggers, Trace Diagnostics, and a Partial Fix

यह शोध पत्र निरंतर-समय मूल्य निर्धारण बाजारों में डीप मल्टी-एजेंट सुदृढीकरण शिक्षण (डीप मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) के दो पुनरुत्पादनीय विफलता मोडों—गुप्त कार्टेल गठन और एक्टर-क्रिटिक अस्थिरता—की पहचान और विश्लेषण करता है—यह प्रदर्शित करते हुए कि अतुल्यता (एसिंक्रोनी) और अवलोकन विलंबता को पेश करने से मिलीभगत (कोल्यूजन) आंशिक रूप से कम हो जाती है, लेकिन यह प्रतिस्पर्धी मूल्य निर्धारण को पूरी तरह से बहाल करने में विफल रहता है और उच्च घटना दरों पर क्रिटिक विचलन को रोकने में सक्षम नहीं है।

Shree Murthy, Rohan Pandey2026-06-10