🤖 machine learning

Human-like autonomy emerges from self-play and a pinch of human data

यह शोध पत्र एक हाइब्रिड प्रशिक्षण पद्धति प्रस्तावित करता है जो सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) को मानव प्रदर्शन डेटा की एक न्यूनतम मात्रा (केवल 30 मिनट) के साथ एक नियमितीकरण उद्देश्य (regularization objective) के रूप में जोड़ता है, जिससे व्यापक मानव डेटासेट या नाजुक रिवॉर्ड इंजीनियरिंग की आवश्यकता के बिना, सुरक्षित और स्वाभाविक रूप से मानव व्यवहार के अनुरूप स्वायत्त ड्राइविंग नीतियों का कुशल निर्माण संभव हो पाता है।

Daphne Cornelisse, Julian Hunt, Zixu Zhang, Waël Doulazmi, Kevin Joseph, Jaime Fernández Fisac, Eugene Vinitsky2026-06-19
💻 computer science

Mesh Inference: A Formal Model of Collective Intelligence Without a Center

यह शोधपत्र मेश इन्फरेंस (mesh inference) के एक औपचारिक मॉडल को प्रस्तुत करता है जहाँ स्वतंत्र एजेंट बिना किसी केंद्रीय समन्वयक या डेटा एक्सपोज़र के, एक प्रवेश/निकास नीति (admission/emission policy) द्वारा नियंत्रित एक युग्मित मुक्त ऊर्जा प्रणाली (coupled free energy system) को स्थानीय रूप से शिथिल करके सामूहिक रूप से एक अद्वितीय, इष्टतम निष्कर्ष निकालते हैं जो अभिसरण (convergence), पहचान-पूर्णता (identification-completeness) और गोपनीयता सुनिश्चित करता है।

Hongwei Xu2026-06-19
💻 computer science

Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience

यह शोध पत्र प्रदर्शित करता है कि जहाँ विषम (heterogeneous) LLM बहसों में प्रतिकूल समकक्ष (adversarial peers) हानिकारक संशोधनों को प्रेरित करके ईमानदार एजेंटों को गंभीर रूप से कमजोर कर सकते हैं, वहीं ईमानदार विषम समकक्षों का परिचय प्रभावी रूप से इन हमलों को कम करता है और हानिकारक संशोधनों तथा प्रारंभ में सही उत्तरों की हानि, दोनों को कम करके प्रणाली की लचीलापन (resilience) को महत्वपूर्ण रूप से बढ़ाता है।

Prashanti Nilayam, Kiran Kumar Ramanna, Prashil Tumbade, Sankalp Nayak2026-06-19
🤖 machine learning

Deep-Unfolded Coordination

यह शोध पत्र डीप कोऑर्डिनेटर (Deep Coordinator) का परिचय देता है, जो एक डीप-अनफोल्डिंग फ्रेमवर्क है जो समाधान-समय (solve-time) पर ADMM-DDP हाइपरपैरामीटर्स को गतिशील रूप से समायोजित करने के लिए एक अनसुपरवाइज्ड लर्निंग स्कीम का उपयोग करता है, जिससे वितरित मल्टी-एजेंट रोबोटिक्स अनुकूलन को प्रशिक्षण के लिए उपयोग किए गए सिस्टमों से काफी बड़े सिस्टमों पर प्रदर्शन बनाए रखते हुए पारंपरिक सॉल्वर की तुलना में 6.18–9.44 गुना तेज़ी से तुलनीय प्रक्षेपवक्र गुणवत्ता (trajectory quality) प्राप्त करने में सक्षम बनाया जा सके।

Hunter Kuperman, Minchan Jung, Rahul V. Ghosh, Alex Oshin, Evangelos A. Theodorou2026-06-19
💻 computer science

Blame is easier than praise: Measuring off-ball defensive performance in football

यह शोध पत्र रक्षात्मक दबाव क्षेत्रों और भूमिका-आधारित बेसलाइन के माध्यम से व्यक्तिगत खिलाड़ियों को अपेक्षित खतरे (expected threat) में परिवर्तन का श्रेय देकर, फुटबॉल में बॉल-रहित रक्षात्मक प्रदर्शन को मापने के लिए एक नवीन ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह "दोष" (blame) मीट्रिक विविध डेटासेट में पारंपरिक क्रिया-आधारित मापों की तुलना में वैधता और बाहरी रेटिंग के साथ बेहतर सहसंबंध प्रदर्शित करता है।

Jonas Bischofberger, Runqing Ma, Pascal Bauer, Kilian Arnsmeyer, Arnold Baca2026-06-19
🤖 AI

RACL: Reasoning-Agent Control Layers for Continuous Metaheuristic Learning

यह शोध पत्र RACL को प्रस्तुत करता है, जो एक रीजनिंग-एजेंट कंट्रोल लेयर (Reasoning-Agent Control Layer) है जो मौजूदा मेटाहेयुरिस्टिक्स (metaheuristics) के ऊपर स्थित है ताकि सीमित परिकल्पनाओं और हस्तक्षेपों के माध्यम से एक ऑप्टिमाइज़र के आंतरिक खोज व्यवहार का अवलोकन, तर्क और गतिशील समायोजन किया जा सके, जो व्यावसायिक बाधाओं में संशोधन किए बिना या महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के बिना वाहन रूटिंग कार्यों में महत्वपूर्ण लागत सुधार प्रदर्शित करता है।

Antón Asla Manzárraga2026-06-19✓ Author reviewed
🤖 AI

A Multi-Agent system for Multi-Objective constrained optimization

यह शोध पत्र MAMO को प्रस्तुत करता है, जो एक मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) ढांचा है जो गतिशील वातावरणों में प्राथमिक उद्देश्यों और बाधा उल्लंघनों के बीच संतुलन बनाने के लिए इष्टतम रिवॉर्ड वेट्स (reward weights) को स्वायत्त रूप से सीखता है, जिससे पारंपरिक लैग्रेंजियन-आधारित दृष्टिकोणों में मैन्युअल वेट चयन की सीमाओं को दूर किया जा सके।

Federica Filippini2026-06-19
💻 computer science

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

फिनिक्स (Phoenix) एक मल्टी-एजेंट एलएलएम (LLM) सिस्टम है जो सात स्तरित सुरक्षा नियंत्रणों और एक बेसलाइन-जागरूक मूल्यांकन रणनीति को नियोजित करते हुए, ट्राइएज से लेकर पुल-रिक्वेस्ट निर्माण तक GitHub इश्यूज़ को सुरक्षित रूप से हल करता है, जिससे एक क्यूरेटेड SWE-bench Lite स्लाइस पर 75% ऑरेकल-रेज़ोल्यूशन दर प्राप्त होती है और वास्तविक दुनिया के इश्यूज़ पर 100% शुद्धता संरक्षण बनाए रखा जाता है।

Kipngeno Koech, Muhammad Adam, Baimam Boukar Jean Jacques, Joao Barros2026-06-19
🤖 machine learning

Contagion Networks: Evaluator Bias Propagation in Multi-Agent LLM Systems

यह शोध पत्र 'कंटेजन नेटवर्क' (Contagion Networks) ढांचे को पेश करता है जो यह मापने के लिए है कि मल्टी-एजेंट एलएलएम (LLM) प्रणालियों के माध्यम से मूल्यांकनकर्ता पूर्वाग्रह कैसे प्रसारित होते हैं, जो यह प्रकट करता है कि जबकि पूर्वाग्रह लगातार फैलते हैं, सजातीय मॉडल क्रॉस-मॉडल सेटअप की तुलना में काफी कमजोर संक्रामकता प्रदर्शित करते हैं और मूल्यांकनकर्ता समिति का आकार बढ़ाना एक प्रभावी शमन रणनीति प्रदान करता है।

Zewen Liu2026-06-19
🤖 machine learning

Moving Out: Physically-grounded Human-AI Collaboration

यह शोध पत्र "मूविंग आउट" (Moving Out) को प्रस्तुत करता है, जो भौतिक रूप से आधारित मानव-एआई सहयोग के लिए एक नया बेंचमार्क है जो मौजूदा असतत या गैर-भौतिक डेटासेट की सीमाओं को संबोधित करता है, और एजेंटों की विविध मानव व्यवहारों और जटिल भौतिक बाधाओं के अनुकूल होने की क्षमता को बढ़ाने के लिए BASS पद्धति का प्रस्ताव करता है।

Xuhui Kang, Sung-Wook Lee, Haolin Liu, Yuyan Wang, Yen-Ling Kuo2026-06-17