🤖 AI

PEAR: Permutation-Equivariant Adaptive Routing Multi-Agent Debate

यह शोध पत्र PEAR को प्रस्तुत करता है, जो मल्टी-एजेंट बहसों के लिए एक क्रम-तुल्य (permutation-equivariant) अनुकूली रूटिंग प्रोटोकॉल है जो स्थितिजन्य पूर्वाग्रहों को समाप्त करने और विविध लार्ज लैंग्वेज मॉडल्स में तर्क की सटीकता को महत्वपूर्ण रूप से सुधारने के लिए एजेंटों की भूमिकाओं और विरल टोपोलॉजी (sparse topologies) को गतिशील रूप से पुनर्गठित करता है।

Yang Feng, Ziwei Xu, Xia Hu, Fengxiang He2026-06-23
🤖 AI

Darwin Mobile Agent: A Roadmap for Self-Evolution

यह शोधपत्र डार्विन मोबाइल एजेंट (Darwin Mobile Agent) को प्रस्तुत करता है, जो एक ओपन-सोर्स इंफ्रास्ट्रक्चर है जो डेटा बाधाओं को दूर करने के लिए समानांतर क्लाउड-फोन इंटरैक्शन का लाभ उठाता है और टास्क करिकुलम (task curricula), सत्यापन (verification) एवं मेमोरी से मानवीय पूर्वग्रहों (human priors) को हटाने के लिए एक रोडमैप स्थापित करता है, जिससे स्वायत्त, स्व-विकसित एजेंट जटिल मोबाइल GUI वातावरण के साथ इंटरैक्शन के माध्यम से सामान्य व्यवहार सीख सकें।

Daniel Beechey, Derek Yuen, Jianheng Liu, Dezhao Luo, Tiantian He, Weilin Luo, Jun Wang, Kun Shao2026-06-23
🤖 AI

In LLM Reasoning, there is Irrationality on top of Value Misalignment

यह शोध पत्र "तर्कसंगत मूल्य जोखिम" (rational value risk) को एक एलएलएम (LLM) की तैनात तर्क रणनीति और उसके इष्टतम तर्कसंगत समकक्ष के बीच उपयोगिता अंतराल के रूप में प्रस्तुत और औपचारिक रूप देता है, जो कई मॉडलों और बेंचमार्क के माध्यम से व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि अच्छी तरह से संरेखित (aligned) मॉडल भी अनुमान-समय तर्क सीमाओं, सीमित डेटा बाधाओं और अपूर्ण सत्यापन के कारण अपेक्षित उपयोगिता को अधिकतम करने में अक्सर विफल रहते हैं।

Kejiang Qian, Fengxiang He2026-06-23
🤖 AI

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

अल्फामेमो (AlphaMemo) अल्फा माइनिंग के लिए एक स्व-विकसित (self-evolving) एलएलएम (LLM) एजेंट है जो पुन: प्रयोज्य एडिट मोटिफ्स (reusable edit motifs), कॉन्फिडेंस-गेटेड रेसिडुअल्स (confidence-gated residuals) और विफलता पैटर्न के विरुद्ध एसिमेट्रिक वीटो कंट्रोल्स (asymmetric veto controls) को रिकॉर्ड करने और लाभ उठाने के लिए एक संरचित खोज-प्रक्रिया मेमोरी का उपयोग करके खोज दक्षता और आउट-ऑफ-सैंपल प्रदर्शन को बढ़ाता है।

Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He2026-06-23
🤖 AI

Latent Goal Prediction from Language for Model-Based Planning

यह शोध पत्र LAGO को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो भाषा संबंधी निर्देशों को एक एकीकृत लेटेंट स्पेस (latent space) के भीतर मध्यवर्ती लेटेंट सबगोल्स (intermediate latent subgoals) और एक्शन-कंडीशन्ड रोलआउट्स में गतिशील रूप से विघटित करके सुदृढ़ लॉन्ग-होरिज़न मॉडल-बेस्ड प्लानिंग को सक्षम बनाता है, जिससे यह विजुअल टारगेट्स और शोर युक्त क्रॉस-मोडल एलाइनमेंट की सीमाओं को दूर करता है।

Samuel Barbeau, Simon Roy, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome2026-06-23
🤖 AI

RIZZ: Routing Interactions to Near Zero-Interference Zones for Continual Adaptation of Black-Box Agents

RIZZ ब्लैक-बॉक्स लैंग्वेज मॉडल एजेंटों के लिए एक निरंतर अनुकूलन ढांचा है जो इंटरैक्शन को विशिष्ट मेमोरी शाखाओं में गतिशील रूप से रूट करके और उन्हें केवल सत्यापनकर्ता-गेटेड फीडबैक के माध्यम से अपडेट करके गैर-स्थिर वातावरण में हस्तक्षेप को कम करता है।

Sonali Goel, Pranav Vaidhyanathan, Lucas Schorling, Natalia Ares, Maike Osborne2026-06-23
🤖 AI

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

यह शोध पत्र एक ऐसा नवीन ढांचा प्रस्तावित करता है जो यात्री-निर्देशित स्वायत्त ड्राइविंग के लिए ड्युलिंग डबल डीप क्यू-नेटवर्क को सुरक्षा-उन्मुख स्पष्टीकरण उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल मॉड्यूल के साथ एकीकृत करता है, जिससे पारदर्शी और व्याख्या योग्य निर्णय लेने के माध्यम से सार्वजनिक विश्वास में वृद्धि होती है।

Ouided Braoui, Meriem Bouali, Nadir Farhi2026-06-23
⚡ electrical engineering

Platooning Connected, Autonomous, and Human-Driven Vehicles: A Deep Reinforcement Learning-based Approach

यह शोध पत्र एक डीप रीइन्फोर्समेंट लर्निंग-आधारित हाइब्रिड प्लूटनिंग नियंत्रण रणनीति प्रस्तावित करता है जो लचीलेपन को बढ़ाने के लिए गैर-कनेक्टेड वाहनों को मिश्रित यातायात में गतिशील रूप से एकीकृत करता है और व्यवधान प्रसार को दबाते हुए यातायात थ्रूपुट और स्थिरता के बीच संतुलन को अनुकूलित करता है।

Zhen Qina, Dong-Fan Xie, Heng Ma, Xiaomei Zhao, Zhengbing He2026-06-23
🤖 AI

A-Evolve-Training: Autonomous Post-Training of a 30B Model

यह शोध पत्र एक स्वायत्त प्रणाली द्वारा बिना किसी मानवीय हस्तक्षेप के एक 30B फ्रंटियर मॉडल के एंड-टू-एंड पोस्ट-ट्रेनिंग को सफलतापूर्वक निष्पादित करने के पहले सार्वजनिक रूप से प्रलेखित उदाहरण की रिपोर्ट करता है, जिसने प्रतिस्पर्धी लीडरबोर्ड प्रदर्शन हासिल किया है और अपने स्वयं के भ्रामक मूल्यांकन मेट्रिक्स को स्वतंत्र रूप से पहचानने और सुधारने की क्षमता प्रदर्शित की है।

Zhan Shi, Bing He, Yisi Sang, Hanqing Lu2026-06-23
🤖 AI

Skill Coverage: A Test Adequacy Metric for Agent Skills

यह शोध पत्र "स्किल कवरेज" (skill coverage) को प्रस्तुत करता है, जो एक टेस्ट पर्याप्तता मीट्रिक है जो यह मूल्यांकन करता है कि एजेंट के कौशल कितनी व्यापकता से प्रशिक्षित किए गए हैं, यह मापने के लिए कि एजेंट के प्रक्षेप पथों (trajectories) में प्रलेखित व्यवहार बाधाओं का अवलोकन किस सीमा तक किया जाता है, जिससे यह पता चलता है कि वर्तमान बेंचमार्क कार्य सफलता के बावजूद इन बाधाओं के 44% से भी कम हिस्से को कवर करते हैं।

Boyin Tan, Xiaowei Huang, Youcheng Sun2026-06-23