🤖 AI

Internal vs. External: Comparing Deliberation and Evolution for Multi-Agent Constitutional Design

यह शोध पत्र एक नियंत्रित तुलना प्रस्तुत करता है जो यह दर्शाता है कि जहाँ बाहरी विकासवादी अनुकूलन (external evolutionary optimization) प्रभावी दंड तंत्र की खोज करके सामूहिक-कार्रवाई परिवेशों में आंतरिक एजेंट विचार-विमर्श (internal agent deliberation) से काफी बेहतर प्रदर्शन करता है, वहीं यह लाभ उन विशिष्ट प्रोत्साहन स्थितियों के तहत उलट जाता है जहाँ विकास मूल्य-विनाशकारी सहयोग को मजबूर करता है, जो बहु-एजेंट संवैधानिक डिजाइन में अनुकूलन शिखरों (optimization peaks) और संरचनात्मक प्रतिक्रियाशीलता के बीच एक मौलिक व्यापार-व्यवहार (trade-off) को रेखांकित करता है।

Hershraj Niranjani, Ujwal Kumar, Phan Xuan Tan2026-05-12
🤖 AI

Data-driven Circuit Discovery for Interpretability of Language Models

यह शोध पत्र डेटासेट-विशिष्ट सर्किट उत्पन्न करने वाली मौजूदा परिकल्पना-संचालित सर्किट खोज विधियों की आलोचना करता है जो भाषा मॉडलों की वास्तविक यांत्रिक विविधता को पकड़ने में विफल रहती हैं, और डेटा-संचालित सर्किट डिस्कवरी (DCD) का प्रस्ताव करता है, जो एक नया ढांचा है जो प्रसंस्करण समानता द्वारा उदाहरणों को क्लस्टर करता है ताकि एक ही कार्य के लिए कई विशिष्ट, उच्च-सटीक सर्किटों को प्रकट किया जा सके।

Daking Rai, Mor Geva, Ziyu Yao2026-05-12
🤖 AI

MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments

MCP-Cosmos एक ऐसा फ्रेमवर्क है जो जनरेटिव वर्ल्ड मॉडल्स (World Models) को मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) इकोसिस्टम में एकीकृत करता है, जिससे एजेंटों को निष्पादन से पहले एक लेटेंट स्पेस (latent space) में स्टेट ट्रांजिशन को सिम्युलेट करने और योजनाओं को परिष्कृत करने में सक्षम बनाया जाता है, जिससे जटिल कार्यों पर टूल की सफलता दर और पैरामीटर सटीकता में उल्लेखनीय सुधार होता है।

Giridhar Ganapavarapu, Dhaval Patel2026-05-12
🤖 AI

BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models

BoostAPR एक तीन-चरणीय ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग को निष्पादन-सत्यापित तर्क (execution-verified reasoning) और दोहरे रिवॉर्ड मॉडल के साथ जोड़कर स्वचालित प्रोग्राम रिपेयर को बढ़ाता है ताकि सुदृढीकरण शिक्षण (reinforcement learning) के दौरान सूक्ष्म, लाइन-स्तरीय क्रेडिट असाइनमेंट सक्षम किया जा सके, जिससे कई बेंचमार्क में अत्याधुनिक प्रदर्शन और मजबूत क्रॉस-लैंग्वेज सामान्यीकरण प्राप्त होता है।

Yuanhao Li, Hongbo Wang, Xiaotang Shang, Xunzhu Tang, Yiming Cao, Xuhong Chen2026-05-12
📊 statistics

From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages

यह शोध पत्र एक व्यवस्थित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि बड़े भाषा मॉडल, विशेष रूप से जब उन्हें फाइन-ट्यून किया जाता है या क्रॉस-लिंगुअल ट्रांसफर लर्निंग के माध्यम से लाभान्वित किया जाता है, ऑक्सिटन (Occitan), कैटलन (Catalan) और फ्रेंच (French) जैसी कम संसाधनों वाली मध्यकालीन रोमांस भाषाओं के लिए पार्ट-ऑफ-स्पीच टैगिंग में पारंपरिक तरीकों से काफी बेहतर प्रदर्शन करते हैं।

Matthias Schöffel, Esteban Garces Arias2026-05-12
🤖 AI

Lost in Translation? Exploring the Shift in Grammatical Gender from Latin to Occitan

यह शोधपत्र लैटिन की त्रिपक्षीय से ओक्सिटन की द्विपक्षीय व्याकरणिक लिंग प्रणाली में कालक्रमिक बदलाव का विश्लेषण करने के लिए एक बेहतर टोकेनाइज़र के साथ एक व्याख्यात्मक डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है, जो लिंग भविष्यवाणी में रूपात्मक विशेषताओं और वाक्यगत संदर्भ के सापेक्ष योगदान को परिमाणित करता है।

Ahan Chatterjee, Matthias Schöffel, Matthias Aßenmacher, Esteban Garces Arias2026-05-12
🤖 machine learning

Revisiting Mixture Policies in Entropy-Regularized Actor-Critic

यह शोध पत्र मिश्रण नीतियों (mixture policies) में मानक लाइकलीहुड-रेश्यो विधियों की उच्च विचरण (high variance) की समस्या को दूर करने के लिए एक मार्जिनलाइज्ड रीपैरामीट्राइजेशन (MRP) एस्टिमेटर का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण मिश्रण नीतियों को निरंतर एक्शन सुदृढीकरण लर्निंग (continuous action reinforcement learning) कार्यों में गॉसियन नीतियों के प्रदर्शन के बराबर या उससे बेहतर बनाने में सक्षम बनाता है।

Jiamin He, Samuel Neumann, Jincheng Mei, Adam White, Martha White2026-05-12
🤖 AI

Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas

यह शोध पत्र एलएलएम (LLM) तर्क के दौरान हिडन एक्टिवेशन्स (hidden activations) के साथ पर्सोना वेक्टर्स (persona vectors) के गतिशील संरेखण का विश्लेषण करने के लिए "पॉलीलॉग" (polylogue) की अवधारणा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इन टाइम-सीरीज़ फीचर्स की निगरानी करना व्याख्यात्मक, स्टेज-अवेयर हस्तक्षेपों को सक्षम बनाता है जो जटिल तर्क कार्यों पर मॉडल की सटीकता में सुधार करते हैं।

Nils A. Herrmann, Leander Girrbach, Kirill Bykov, Zeynep Akata2026-05-12
🤖 AI

FORTIS: Benchmarking Over-Privilege in Agent Skills

यह शोध पत्र FORTIS को प्रस्तुत करता है, जो यह प्रदर्शित करने वाला एक बेंचमार्क है कि लार्ज लैंग्वेज मॉडल एजेंट नियमित रूप से अत्यधिक विशेषाधिकार प्राप्त कौशल (skills) का चयन और निष्पादन करके अति-विशेषाधिकार प्राप्त व्यवहार (over-privileged behavior) प्रदर्शित करते हैं, जिससे यह उजागर होता है कि कौशल परत (skill layer) स्वयं एक रोकथाम तंत्र के बजाय विशेषाधिकार वृद्धि (privilege escalation) का प्राथमिक स्रोत है।

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhan (…)2026-05-12
🤖 AI

WorldSpeech: A Multilingual Speech Corpus from Around the World

यह शोध पत्र WorldSpeech को प्रस्तुत करता है, जो 76 भाषाओं में 65,000 घंटों के संरेखित (aligned) ऑडियो-ट्रांसक्रिप्ट डेटा वाला एक बड़े पैमाने का बहुभाषी संग्रह है, जो कम संसाधन वाली भाषाओं के लिए स्वचालित वाक् पहचान (automatic speech recognition) प्रदर्शन में सुधार करते हुए शब्द त्रुटि दर (word error rate) को औसतन 63.5% तक कम कर देता है।

Antonis Asonitis, Luca A. Lanzendörfer, Frédéric Berdoz, Roger Wattenhofer2026-05-12