🤖 AI

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

यह शोधपत्र PACE को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), किसी भी समय वैध (anytime-valid) सांख्यिकीय ढांचा है, जो स्वयं-विकसित एजेंटों में अविश्वसनीय लालची स्वीकृति नियमों (greedy acceptance rules) को गलत कमिट और प्रदर्शन विचलन को रोकने तथा मूल्यांकन लागत को महत्वपूर्ण रूप से कम करने के लिए एक कठोर अनुक्रमिक परिकल्पना परीक्षण (sequential hypothesis test) से बदल देता है।

Zayx Shawn2026-06-09
🤖 AI

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

यह शोध पत्र *alem* को प्रस्तुत करता है, जो लंबी अवधि के उत्तरजीविता कार्यों (long-horizon survival tasks) में ओपन-एंडेड मल्टी-एजेंट समन्वय के मूल्यांकन के लिए एक JAX-आधारित बेंचमार्क है, जो यह प्रकट करता है कि जहाँ फ्रंटियर LLMs व्यक्तिगत कार्यों में उत्कृष्ट हैं, वहीं वे समन्वय के मामले में काफी संघर्ष करते हैं—जो एक विशिष्ट बाधा है जहाँ संचार महत्वपूर्ण सिद्ध होता है और मॉडलों के बीच प्रदर्शन व्यापक रूप से भिन्न होता है।

Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Go (…)2026-06-09
💻 computer science

The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment

यह शोध पत्र मल्टी-एजेंट मेडिकल क्यू-एंड-ए (QA) सिस्टम में "कंसिस्टेंसी इल्यूजन" (संगति का भ्रम) को प्रस्तुत करता है, जहाँ एजेंट तर्क के गलत संरेखण के बावजूद उत्तर पर सहमति प्राप्त कर लेते हैं, और बिना किसी संरचनात्मक परिवर्तन के तर्क संरेखण में उल्लेखनीय सुधार करने के लिए ग्राउंडेड डिबेट प्रोटोकॉल (GDP) का प्रस्ताव करता है।

Xiaoyang Wang, Christopher C. Yang2026-06-09
🤖 AI

RAILS: Verification-Native Clearing For Agentic Commerce

यह शोधपत्र RAILS को प्रस्तुत करता है, जो एजेंटिक कॉमर्स (agentic commerce) के लिए एक वेरिफिकेशन-नेटिव क्लियरिंग प्रोटोकॉल है जो एक औपचारिक, फाल्सीफिएबल (falsifiable) साउंडनेस प्रॉपर्टी स्थापित करता है, जो यह सुनिश्चित करता है कि बिना किसी साक्ष्य के जो दायित्व की स्वीकार्यता सीमा (admissibility floor) को पूरा करता हो, कोई भी वित्तीय रूप से महत्वपूर्ण सेटलमेंट न हो, जिससे वह महत्वपूर्ण अंतर भरा जा सके जो स्वायत्त एजेंटों के कार्यों और तटस्थ दायित्व सत्यापन के बीच विद्यमान है।

Adrian de Valois-Franklin, Alex Bogdan2026-06-09
🤖 AI

Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

यह शोध पत्र "हैकर-फिक्सर लूप" (hacker-fixer loop) को प्रस्तुत करता है, जो रिवॉर्ड हैकिंग के विरुद्ध नाजुक एजेंट बेंचमार्क को सशक्त बनाने के लिए प्रतिस्पर्धी एलएलएम (LLM) एजेंटों का उपयोग करने वाली एक स्वचालित विधि है, जो हमले की सफलता दर को सफलतापूर्वक शून्य के करीब तक कम करती है और 323 असुरक्षित वातावरणों तथा 3,632 शोषण प्रक्षेप पथों (exploit trajectories) का एक नया डेटासेट जारी करती है।

Ziqian Zhong, Ivgeni Segal, Ivan Bercovich, Shashwat Saxena, Kexun Zhang, Aditi Raghunathan2026-06-09
⚡ electrical engineering

Revisiting mesoscopic traffic flow simulation in SUMO: Limitations, analysis, and an alternative

यह शोध पत्र LWR सिद्धांतों और कतार गतिशीलता (queue dynamics) के प्रति SUMO के वर्तमान मेसोस्कोपिक ट्रैफ़िक मॉडल की सीमाओं की पहचान करता है, और एक नया डिस्क्रीट-टाइम लिंक ट्रांसमिशन मॉडल प्रस्तावित करता है जो भीड़ के आगमन, सुधार और स्पिलबैक को अधिक सटीक रूप से सिम्युलेट करने के लिए स्पष्ट रूप से बैकवर्ड ट्रैवलिंग स्पेस को शामिल करता है।

Ying-Chuan Ni, Alina Akopian, Anastasios Kouvelas, Michail A. Makridis2026-06-09
🤖 machine learning

High entropy leads to symmetry-equivariant policies in Dec-POMDPs

यह शोध पत्र प्रदर्शित करता है कि Dec-POMDPs में उच्च एंट्रॉपी नियमितीकरण (high entropy regularization) सैद्धांतिक रूप से एक अद्वितीय, समरूपता-समतुल्य (symmetry-equivariant) नीति के अभिसरण की गारंटी देता है और अनुभवजन्य रूप से दिखाता है कि एंट्रॉपी गुणांकों को बढ़ाने से स्वतंत्र रूप से प्रशिक्षित एजेंटों के बीच क्रॉस-प्ले अनुकूलता में महत्वपूर्ण सुधार होता है, जो हनाबी (Hanabi) जैसे वातावरणों में नए अत्याधुनिक परिणाम सक्षम बनाता है।

Johannes Forkel, Constantin Ruhdorfer, Michael Beukman, Andreas Bulling, Jakob Foerster2026-06-08
🤖 AI

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

यह शोध पत्र TRAP को प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रदर्शित करता है कि वेब-आधारित LLM एजेंट मनोवैज्ञानिक अनुनय तकनीकों (psychological persuasion techniques) का लाभ उठाने वाले प्रॉम्प्ट इंजेक्शन हमलों के प्रति काफी संवेदनशील हैं, जिससे विभिन्न फ्रंटियर मॉडलों में 43% तक के मामलों में वे अपने इच्छित कार्यों से विचलित हो जाते हैं।

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Phil (…)2026-06-08