🤖 AI

Cohort Organized Learning: Clustering Through Agreement

यह शोध पत्र कोहोर्ट ऑर्गेनाइज्ड लर्निंग (CoOL) का परिचय देता है, जो एक न्यूरल नेटवर्क-आधारित क्लस्टरिंग विधि है जो प्रशिक्षण, अभिसरण निगरानी (convergence monitoring) और विभिन्न डेटा प्रकारों में मूल्यांकन के लिए एक्सपेक्टेशन मैक्सिमाइजेशन का उपयोग करके स्पष्ट दूरी या समानता गणना के बिना डेटा को समूहित करती है।

Finn Henry O'Shea, Maria Elena Monzani2026-06-23
💻 computer science

GARIP: A Running-Average Moving Reference for Last-Iterate Self-Play in Two-Player Zero-Sum Games

यह शोध पत्र GARIP को प्रस्तुत करता है, जो एक सेल्फ-प्ले विधि है जो पॉलिसी अपडेट को रनिंग एवरेज रेफरेंस के साथ एंकर करती है ताकि विशिष्ट रूप से रेफरेंस लैग को कम किया जा सके और स्थानीय लास्ट-इटरेट कन्वर्जेंस सुनिश्चित किया जा सके, जो विभिन्न टू-प्लेयर ज़ीरो-सम गेम्स में फिक्स्ड या स्नैपशॉट-आधारित बेसलाइन्स की तुलना में बेहतर मजबूती और स्थिरता प्रदर्शित करता है।

Can Savcı2026-06-23
🤖 AI

RaMem: Contextual Reinstatement for Long-term Agentic Memory

राMem एक ऐसा फ्रेमवर्क है जिसे साक्ष्य एंकरिंग (evidence anchoring), रिकॉल कंडीशन इंडक्शन (recall condition induction), वैधता-जागरूक पुनर्प्राप्ति (validity-aware retrieval), और संदर्भ-संरक्षित संश्लेषण (context-preserved synthesis) की एक चार-चरणीय प्रक्रिया को लागू करके दीर्घकालिक एजेंटिक मेमोरी में संदर्भ पतन (context collapse) को रोकने के लिए डिज़ाइन किया गया है, ताकि पुनर्प्राप्त मेमोरी अंशों को सत्यापन योग्य साक्ष्य में परिवर्तित किया जा सके, जिससे दीर्घकालिक बेंचमार्क पर एजेंट के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Wei Yang, Bryce Kan, Shixuan Li, Li Li, Yuehan Qin, Jiate Li, Paul Bogdan, Jesse Thomason2026-06-23
💻 computer science

R2BC: Multi-Agent Imitation Learning from Single-Agent Demonstrations

यह शोध पत्र राउंड-रॉबिन बिहेवियर क्लोनिंगिंग (R2BC) को प्रस्तुत करता है, जो एक विधि है जो एक एकल मानव ऑपरेटर को व्यक्तिगत एजेंटों पर क्रमवार कार्यों का प्रदर्शन करके मल्टी-रोबोट प्रणालियों को प्रभावी ढंग से प्रशिक्षित करने में सक्षम बनाती है, जिससे सिंक्रोनाइज्ड मल्टी-एजेंट प्रदर्शन की आवश्यकता वाले दृष्टिकोणों के तुलनीय या बेहतर प्रदर्शन प्राप्त होता है।

Connor Mattson, Varun Raveendra, Ellen Novoseller, Nicholas Waytowich, Vernon J. Lawhern, Daniel S. Brown2026-06-19
💻 computer science

Iterative Negotiation and Oversight: A Case Study in Decentralized Air Traffic Management

यह शोध पत्र एक विनियमित विकेंद्रीकृत वार्ता ढांचे का प्रस्ताव करता है जो संपत्ति व्यापार के साथ कराधान जैसी निगरानी को जोड़ता है ताकि स्वार्थी एजेंटों को प्रणाली-कुशल और न्यायसंगत परिणामों पर आम सहमति बनाने में सक्षम बनाया जा सके, जिसमें अभिसरण (convergence) और समाप्ति (termination) पर औपचारिक गारंटी दी गई है, जैसा कि विकेंद्रीकृत हवाई यातायात प्रबंधन के एक केस स्टडी के माध्यम से प्रदर्शित किया गया है।

Jaehan Im, John-Paul Clarke, Ufuk Topcu, David Fridovich-Keil2026-06-19
💻 computer science

Characterizing Opinion Evolution of Networked LLMs

यह शोध पत्र प्रदर्शित करता है कि जहाँ शास्त्रीय ओपिनियन डायनेमिक्स मॉडल एलएलएम (LLM) नेटवर्क व्यवहार की भविष्यवाणी करने में विफल रहते हैं, वहीं एक अंतर्निहित बायस पैरामीटर को शामिल करने से विविध मॉडल परिवारों, विषयों और नेटवर्क संरचनाओं में मॉडलिंग सटीकता में महत्वपूर्ण सुधार होता है।

Caleb Probine, Yigit Ege Bayiz, Filippos Fotiadis, Samuel Li, Yunhao Yang, Ufuk Topcu2026-06-19
💻 computer science

LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

यह शोध पत्र LLMZero को प्रस्तुत करता है, जो एक LLM एजेंट सिस्टम है जो निरंतर बढ़ते हुए क्षमता और दोलन करते हुए रेगुलराइजेशन मापदंडों द्वारा अभिलक्षित अनुकूल, बहु-चरणीय RL पोस्ट-ट्रेनिंग रणनीतियों की खोज के लिए ट्री सर्च का उपयोग करता है, जो विविध कार्यों में फिक्स्ड शेड्यूल्स, ग्रिड सर्च और रैंडम सर्च की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Haoyang Fang, Wei Zhu, Boran Han, Alex Zhang, Zhenyu Pan, Shuo Yang, Shuai Zhang, Jiading Gai, Peng Tang, Cuixiong Hu, X (…)2026-06-19
💻 computer science

EARS: Explanatory Abstention for Reliable Sub-Agent Modeling in Large-scale Multi-Agent Systems

यह शोध पत्र EARS प्रस्तुत करता है, जो एक ऐसा ढांचा है जो उप-एजेंटों को अपनी सीमाओं का पता लगाने और भ्रमित आउटपुट (hallucinated outputs) देने के बजाय व्याख्यात्मक त्याग (explanatory abstentions) और तर्कों के साथ प्रतिक्रिया करने के लिए प्रशिक्षित करके बड़े पैमाने के मल्टी-एजेंट सिस्टम की विश्वसनीयता को बढ़ाता है, जिससे उत्पादन वातावरण में समग्र कार्य सफलता दर में सुधार होता है।

Shuang Xie, Yunan Lu, Han Li, Lingyun Wang2026-06-19
💻 computer science

Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

यह शोध पत्र डिकपल्ड सर्च ग्राउंडिंग (DSG) का परिचय देता है, जो एक वेंडर-अज्ञेय (vendor-agnostic) आर्किटेक्चर है जो रूटिंग और कैशिंग पर सूक्ष्म नियंत्रण प्रदान करने के लिए सर्च रिट्रीवल को रीजनिंग मॉडल्स से अलग करता है, जिससे विविध LLM वर्कलोड्स में मूल-सटीकता (near-native accuracy) प्राप्त करते हुए लागत और विलंबता (latency) में भारी कमी आती है।

Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar, Siddharth Kodwani, Sudeep Das2026-06-19
💻 computer science

A Technical Taxonomy of LLM Agent Communication Protocols

यह शोध पत्र नौ ओपन-सोर्स एलएलएम (LLM) एजेंट संचार प्रोटोकॉल को वर्गीकृत और विश्लेषण करने के लिए पांच आयामों के साथ एक तकनीकी वर्गीकरण (taxonomy) स्थापित करता है, जो वर्तमान वास्तुशिल्प पैटर्न (architectural patterns) को प्रकट करता है और एक एकल सार्वभौमिक मानक के बजाय एक संघीय, स्तरित प्रोटोकॉल स्टैक की ओर भविष्य के विकास की भविष्यवाणी करता है।

Linus Sander, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll2026-06-19