🤖 AI

MARFT: Multi-Agent Reinforcement Fine-Tuning

यह शोधपत्र मल्टी-एजेंट रिइन्फोर्समेंट फाइन-ट्यूनिंग (MARFT) प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें फ्लेक्स-एमजी (Flex-MG) नामक एक नया मार्कोव गेम फॉर्मूलेशन और एक सार्वभौमिक एल्गोरिद्मिक दृष्टिकोण शामिल है, जिसे लार्ज लैंग्वेज मॉडल-आधारित मल्टी-एजेंट सिस्टम पर रिइन्फोर्समेंट लर्निंग लागू करने की अनूठी चुनौतियों से निपटने के लिए डिज़ाइन किया गया है।

Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang2026-06-02
💻 computer science

CrazyMARL: Decentralized Direct Motor Control Policies for Cooperative Aerial Transport of Cable-Suspended Payloads

यह शोध पत्र CrazyMARL को प्रस्तुत करता है, जो एक विकेंद्रीकृत सुदृढीकरण लर्निंग (reinforcement learning) ढांचा है जो जटिल गैररेखीय गतिकी (nonlinear dynamics), केबल ढीले-तनाव संक्रमणों (cable slack-taut transitions) और बाहरी व्यवधानों को ज़ीरो-शॉट सिम-टू-रियल ट्रांसफर के माध्यम से सफलतापूर्वक संभालते हुए, अनस्ट्रक्चर्ड वातावरण में मल्टी-UAV टीमों को मजबूती से केबल-लटकते पेलोड को ले जाने में सक्षम बनाता है।

Viktor Lorentz, Khaled Wahba, Sayantan Auddy, Marc Toussaint, Wolfgang Hönig2026-06-02
💬 NLP

The Social Cost of Intelligence: Emergence, Propagation, and Amplification of Stereotypical Bias in Multi-Agent Systems

यह शोध पत्र मल्टी-एजेंट सिस्टम का मूल्यांकन करने के लिए एक रूपरेखा प्रस्तुत करता है और यह प्रकट करता है कि LLMs के बीच सहयोग, उद्भव (emergence), प्रसार (propagation) और प्रवर्धन (amplification) के माध्यम से रूढ़िवादी पूर्वाग्रह को महत्वपूर्ण रूप से बढ़ाता है, साथ ही इन प्रणालियों को पूर्वाग्रह इंजेक्शन हमलों (bias injection attacks) के प्रति अत्यधिक संवेदनशील भी बनाता है।

Thi-Nhung Nguyen, Linhao Luo, Amardeep Kaur, Rollin Omari, Tamas Abraham, Junae Kim, Thuy-Trang Vu, Dinh Phung2026-06-02
💻 computer science

Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)

यह शोध पत्र एजेंट्स ऑफ डिफ्यूजन (AoD) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो मॉडल मापदंडों को संशोधित किए बिना, अर्थपूर्ण समृद्धि को सख्त संरचनात्मक अनुपालन के साथ जोड़कर, उच्च गुणवत्ता वाले, स्कीमा-संगत संरचित डेटा उत्पन्न करने में डिफ्यूजन लैंग्वेज मॉडल्स को निर्देशित करने के लिए मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग का लाभ उठाता है।

Aja Khanal, Kaushik T. Ranade, Rishabh Agrawal, Kalyan S. Basu, Apurva Narayan2026-06-02
💻 computer science

Symphony-Coord: Adaptive Routing for Multi-Agent LLM Systems

Symphony-Coord मल्टी-एजेंट LLM सिस्टम के लिए एक विकेंद्रीकृत समन्वय ढांचा (decentralized coordination framework) है जो एजेंट चयन को एक दो-चरणीय बीकन प्रोटोकॉल (two-stage beacon protocol) और LinUCB सेलेक्टर का उपयोग करके, टास्क रूटिंग और फॉल्ट रिकवरी को वास्तविक समय की प्रतिक्रिया के आधार पर गतिशील रूप से अनुकूलित करने के लिए एक अनुकूलन योग्य ऑनलाइन मल्टी-आर्म्ड बैंडिट समस्या में बदलकर स्थिर रूटिंग की सीमाओं को संबोधित करता है।

Zhaoyang Guan, Huixi Cao, Ming Zhong, Yin Wang, Guanyu Liu, Eric Yang, Lynn Ai, Yongxin Ni, Bill Shi2026-06-02
🤖 AI

Atomix: Timely, Transactional Tool Use for Reliable Agentic Workflows

एटॉमिक्स (Atomix) एक रनटाइम सिस्टम है जो प्रोग्रेस-अवेयर ट्रांजेक्शन (progress-aware transactions) के माध्यम से प्रभाव समूहीकरण (effect grouping) को संघर्ष समाधान (conflict resolution) से अलग करके विश्वसनीय एजेंटिक वर्कफ़्लो सुनिश्चित करता है, जो टूल प्रभावों (tool effects) को बफर करता है और उन्हें केवल यह पुष्टि करने के बाद ही कमिट करता है कि कोई भी पिछला संघर्षपूर्ण कार्य आ सकता है, जिससे आंशिक अवस्थाओं (partial states), पुराने डेटा लेखन (stale writes) और अपरिवर्तनीय रिसाव (irreversible leaks) को रोका जा सके।

Bardia Mohammadi, Nearchos Potamitis, Lars Klein, Akhil Arora, Laurent Bindschaedler2026-06-02
💻 computer science

When Agents Talk: Discourse, Manipulation, and Risk in an Agentic Social Network

यह शोध पत्र मोल्टबुक (Moltbook) के एक बड़े पैमाने के डेटासेट का विश्लेषण करता है, जो एआई एजेंटों द्वारा संचालित एक सोशल प्लेटफॉर्म है, जिससे यह पता चलता है कि लगभग 18% पोस्ट में विषाक्त या दुर्भावनापूर्ण सामग्री शामिल है—जिसमें क्रेडेंशियल हार्वेस्टिंग और समन्वित हेरफेर अभियान भी शामिल हैं—जो अक्सर वैध परिचालन चर्चाओं के भीतर ही समाहित होते हैं।

10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle L (…)2026-06-02
🔬 physics

Civilizational Metamaterials: Engineering Coordination Under Capability Gradients and Structural Turbulence

यह शोध पत्र एआई-संचालित निर्णय वेग (decision velocity) के तहत संस्थागत समन्वय को मॉडल करने के लिए मेटा-मटेरियल्स से प्रेरित एक औपचारिक इंजीनियरिंग ढांचे का प्रस्ताव करता है, जो एक वि constitutive नियम (constitutive law) प्रस्तुत करता है जो तब एक विनाशकारी "फ्रीजिंग इक्विलिब्रियम" (Freezing Equilibrium) की भविष्यवाणी करता है जब सत्यापन लागत उपयोगिता से अधिक हो जाती है, और अनुकूलित प्रोवेनेंस (provenance) एवं सत्यापन संरचनाओं के माध्यम से इस चरण संक्रमण (phase transition) को रोकने के लिए परीक्षण योग्य परिकल्पनाएं प्रदान करता है।

David Orban2026-06-02✓ Author reviewed
🤖 AI

MindZero: Learning Online Mental Reasoning With Zero Annotations

यह शोध पत्र माइंडज़ीरो (MindZero) को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित सुदृढीकरण शिक्षण (self-supervised reinforcement learning) ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को बिना किसी ग्राउंड-ट्रुथ मेंटल स्टेट एनोटेशन की आवश्यकता के, कुशल और सुदृढ़ ऑनलाइन मेंटल रीजनिंग करने के लिए प्रशिक्षित करता है, जो सटीकता और गति में स्टैंडअलोन एलएलएम (LLMs) और पारंपरिक मॉडल-आधारित विधियों दोनों से काफी बेहतर प्रदर्शन करता है।

Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu2026-06-02
💻 computer science

Leveraging the Learning Curve: Reusing Existing Architectural Patterns to Design and Implement MAS

यह शोध पत्र एजेंट अवधारणाओं के एक न्यूनतम सेट को डिस्ट्रीब्यूटेड सिस्टम्स (DS) पैटर्न में एकीकृत करके मल्टी-एजेंट सिस्टम्स (MAS) के लिए एक एकीकृत इंजीनियरिंग दृष्टिकोण प्रस्तावित करता है, जो व्यावहारिक अध्ययनों के माध्यम से यह प्रदर्शित करता है कि यह विधि डिस्ट्रीब्यूटेड सिस्टम्स के सीमित अनुभव वाले छात्रों को स्थापित DS उपकरणों और तकनीकों का उपयोग करके जटिल MAS को सफलतापूर्वक डिजाइन और कार्यान्वित करने में सक्षम बनाती है।

Arthur Casals, Anarosa A. F. Brandão2026-06-02