💻 computer science

ATOM: Instantiating Budget-Controllable Multi-Agent Collaboration via Nucleus-Electron Hierarchy

यह शोध पत्र ATOM को प्रस्तुत करता है, जो एक अनुकूलन योग्य बहु-एजेंट फ्रेमवर्क है जो न्यूक्लियस-इलेक्ट्रॉन पदानुक्रम और कार्य-संचालित सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके गतिशील रूप से बजट-नियंत्रणीय सहयोग ग्राफ को स्थापित करता है, जिससे क्वेरी की कठिनाई के साथ कम्प्यूटेशनल संसाधनों को संरेखित करके 30% तक बेहतर टोकन दक्षता के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xinkui Zhao, Sai Liu, Yifan Zhang, Qingyu Ma, Zewen Lin, Naibo Wang, Guanjie Cheng, Chang Liu, Yueshen Xu2026-05-27
💻 computer science

Decoupled Delay Compensation: Enhancing Pre-trained MARL Policies via Learned Dynamics Filtering

यह शोध पत्र एक मॉड्यूलर, प्लग-इन स्टेट-एस्टिमेशन लेयर का प्रस्ताव करता है जो संचार विलंब (कम्युनिकेशन डिले) और पैकेट लॉस की भरपाई के लिए एक सीखे हुए गेटेड ट्रांजिशन मॉडल को रिकर्सिव कलमन फ़िल्टरिंग के साथ जोड़ता है, जिससे प्री-ट्रेन्ड मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग पॉलिसियों की वास्तविक दुनिया के एसिंक्रोनस वातावरण में मजबूती और प्रदर्शन में उल्लेखनीय वृद्धि होती है।

Maxim Mednikov, Oren Gal2026-05-27
🤖 AI

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

यह शोध पत्र ScientistOne को प्रस्तुत करता है, जो एक 'चेन-ऑफ-एविडेंस' (साक्ष्य की श्रृंखला) ढांचे पर निर्मित एक स्वायत्त अनुसंधान प्रणाली है जो निर्माण द्वारा सत्यापन सुनिश्चित करती है, जिससे काल्पनिक उद्धरणों (hallucinated citations) को समाप्त किया जा सके और पूर्ण स्कोर सत्यापन तथा उत्कृष्ट विधि-कोड संरेखण प्राप्त किया जा सके, साथ ही विविध फ्रंटियर अनुसंधान कार्यों में मानव विशेषज्ञ के प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन किया जा सके।

Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Rajarish (…)2026-05-27
💻 computer science

Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure

यह शोध पत्र प्रदर्शित करता है कि एक पब्लिक गुड्स गेम में सहकारी और फ्री-राइडिंग एलएलएम (LLM) एजेंटों के बीच प्राकृतिक-भाषा संविधानों का प्रतिकूल सह-विकास (adversarial co-evolution) व्यवहार्य है और व्याख्या योग्य रेड-टीम आर्टिफैक्ट्स उत्पन्न करता है, लेकिन यह केवल युग्मित फिटनेस फंक्शन और मोड रिग्रेशन को रोकने के लिए पर्याप्त मूल्यांकन बजट का उपयोग करने पर ही संभव है।

Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan T (…)2026-05-27
🤖 AI

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

UnityMAS-O एक सामान्य सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो संपूर्ण वर्कफ़्लो को प्रशिक्षण इकाई के रूप में मानकर और एक लचीले चार-वस्तु अमूर्तता (four-object abstraction) के माध्यम से तार्किक भूमिकाओं को मॉडल मापदंडों से अलग करके LLM-आधारित मल्टी-एजेंट सिस्टम को अनुकूलित करता है, और QA तथा कोड जनरेशन जैसे विविध कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan (…)2026-05-27
🤖 AI

Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

यह केस स्टडी एक एकल-अन्वेषक शैक्षणिक अनुसंधान परिवेश में 96 दिनों तक अंतर्निहित एक निरंतर AI एजेंट का मूल्यांकन करती है, जो यह प्रकट करती है कि ऐसी प्रणालियाँ कैश-प्रभावी (cache-dominant) होती हैं और प्रति टोकन लागत से प्रति पूर्ण आर्टिफैक्ट (completed artifact) लागत की ओर आर्थिक मूल्यांकन में बदलाव का सुझाव देती हैं।

Anas H. Alzahrani2026-05-27
💬 NLP

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

यह शोध पत्र QUACK को प्रस्तुत करता है, जो एक ओपन-सोर्स मल्टीमॉडल सोशल डिटेक्शन फ्रेमवर्क है जो ग्राउंड-ट्रुथ ट्रेजेक्टरीज (ground-truth trajectories) को पुनर्गठित करके लार्ज लैंग्वेज मॉडल एजेंटों का ऑडिट करता है ताकि मतिभ्रम (hallucinations), निराधार आरोपों और भाषा एवं कार्यों के बीच विसंगतियों का स्वतः पता लगाया जा सके और उन्हें मापा जा सके।

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong (…)2026-05-27
🤖 machine learning

Cost of Structural Learning Under Censored Feedback: A Threshold-Bandit Approach

यह शोध पत्र सेंसर फीडबैक के तहत सीखने की समस्या को संबोधित करने के लिए थ्रेशोल्ड-एक्टिवेटेड कोऑपरेटिव मल्टी-आर्म्ड बैंडिट (TAC-MAB) फ्रेमवर्क पेश करता है, जो लॉगरिदमिक रिग्रेट वाला एक केंद्रीकृत एल्गोरिदम और एक विकेंद्रीकृत इवेंट-ट्रिगर्ड प्रोटोकॉल प्रस्तावित करता है जो संचार में 23 गुना कमी के साथ लगभग केंद्रीकृत प्रदर्शन प्राप्त करता है।

Michael Ledford, William Regli2026-05-27
💻 computer science

Autonomic Federated-Market Orchestration for the Edge-Cloud Continuum

यह शोधपत्र न्यूरल पब/सब (Neural Pub/Sub) को प्रस्तुत करता है, जो एज-क्लाउड निरंतरता (edge-cloud continuum) के लिए एक फेडरेटेड-ब्रोकर ऑटोनोमिक सबस्ट्रेट है, जो स्व-संगठित, संप्रभुता-अनुपालक संसाधन ऑर्केस्ट्रेशन प्राप्त करने के लिए बाजार-आधारित मूल्य संकेतों और वॉलरसियन अभिसरण (Walrasian convergence) का लाभ उठाता है, जिसका प्रदर्शन केंद्रीकृत ओरेकल के तुलनीय है जबकि उच्च भार के तहत पारंपरिक राउंड-रॉबिन शेड्यूलिंग से काफी बेहतर प्रदर्शन करता है।

Lauri Lovén, Roberto Morabito, Abhishek Kumar, Susanna Pirttikangas, Jukka Riekki, Sasu Tarkoma2026-05-27
🤖 AI

MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

यह शोध पत्र MUSE-Autoskill को प्रस्तुत करता है, जो एक स्व-विकसित (self-evolving) एजेंट फ्रेमवर्क है जो कौशल (skills) को निर्माण, स्मृति, प्रबंधन, मूल्यांकन और परिशोधन के एक एकीकृत जीवनचक्र के माध्यम से प्रबंधित करके कार्य-समाधान क्षमताओं को बढ़ाता है, और उन्हें पुन: प्रयोज्यता, विश्वसनीयता और क्रॉस-टास्क स्थानांतरण में सुधार के लिए दीर्घकालिक, अनुभव-जागरूक परिसंपत्तियों के रूप में मानता है।

Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang2026-05-27