🤖 machine learning

Revisiting Mixture Policies in Entropy-Regularized Actor-Critic

यह शोध पत्र मिश्रण नीतियों (mixture policies) में मानक लाइकलीहुड-रेश्यो विधियों की उच्च विचरण (high variance) की समस्या को दूर करने के लिए एक मार्जिनलाइज्ड रीपैरामीट्राइजेशन (MRP) एस्टिमेटर का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण मिश्रण नीतियों को निरंतर एक्शन सुदृढीकरण लर्निंग (continuous action reinforcement learning) कार्यों में गॉसियन नीतियों के प्रदर्शन के बराबर या उससे बेहतर बनाने में सक्षम बनाता है।

Jiamin He, Samuel Neumann, Jincheng Mei, Adam White, Martha White2026-05-12
🤖 AI

Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas

यह शोध पत्र एलएलएम (LLM) तर्क के दौरान हिडन एक्टिवेशन्स (hidden activations) के साथ पर्सोना वेक्टर्स (persona vectors) के गतिशील संरेखण का विश्लेषण करने के लिए "पॉलीलॉग" (polylogue) की अवधारणा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इन टाइम-सीरीज़ फीचर्स की निगरानी करना व्याख्यात्मक, स्टेज-अवेयर हस्तक्षेपों को सक्षम बनाता है जो जटिल तर्क कार्यों पर मॉडल की सटीकता में सुधार करते हैं।

Nils A. Herrmann, Leander Girrbach, Kirill Bykov, Zeynep Akata2026-05-12
🤖 AI

FORTIS: Benchmarking Over-Privilege in Agent Skills

यह शोध पत्र FORTIS को प्रस्तुत करता है, जो यह प्रदर्शित करने वाला एक बेंचमार्क है कि लार्ज लैंग्वेज मॉडल एजेंट नियमित रूप से अत्यधिक विशेषाधिकार प्राप्त कौशल (skills) का चयन और निष्पादन करके अति-विशेषाधिकार प्राप्त व्यवहार (over-privileged behavior) प्रदर्शित करते हैं, जिससे यह उजागर होता है कि कौशल परत (skill layer) स्वयं एक रोकथाम तंत्र के बजाय विशेषाधिकार वृद्धि (privilege escalation) का प्राथमिक स्रोत है।

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhan (…)2026-05-12
🤖 AI

WorldSpeech: A Multilingual Speech Corpus from Around the World

यह शोध पत्र WorldSpeech को प्रस्तुत करता है, जो 76 भाषाओं में 65,000 घंटों के संरेखित (aligned) ऑडियो-ट्रांसक्रिप्ट डेटा वाला एक बड़े पैमाने का बहुभाषी संग्रह है, जो कम संसाधन वाली भाषाओं के लिए स्वचालित वाक् पहचान (automatic speech recognition) प्रदर्शन में सुधार करते हुए शब्द त्रुटि दर (word error rate) को औसतन 63.5% तक कम कर देता है।

Antonis Asonitis, Luca A. Lanzendörfer, Frédéric Berdoz, Roger Wattenhofer2026-05-12
🤖 AI

CIVeX: Causal Intervention Verification for Language Agents

यह शोध पत्र CIVeX को प्रस्तुत करता है, जो एक कारण संबंधी हस्तक्षेप सत्यापनकर्ता (causal intervention verifier) है जो प्रस्तावित कार्यों को संरचनात्मक कारण प्रश्नों (structural causal queries) में मैप करके भाषा एजेंटों में विश्वसनीय टूल उपयोग सुनिश्चित करता है ताकि पहचान योग्य कारण प्रभावों की गारंटी दी जा सके, जिससे उन कन्फाउंडेड वर्कफ़्लो (confounded workflows) में गलत निष्पादन को रोका जा सके जहाँ मानक सत्यापन सुरक्षा उपाय विफल हो जाते हैं।

Fabio Rovai2026-05-12
🤖 machine learning

Prediction Bottlenecks Don't Discover Causal Structure (But Here's What They Actually Do)

यह शोध पत्र एक मानकीकृत मिथ्याकरण बेंचमार्क (falsification benchmark) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि यह दावा कि प्रेडिक्शन बॉटलनैक्स (prediction bottlenecks) कारण संरचना (causal structure) की खोज करते है, गलत है, जो इसके बजाय यह प्रकट करता है कि देखे गए लाभ काफी हद तक नमूना-आकार के भ्रम (sample-size confounds) या विधि-अज्ञेय प्रभाव (method-agnostic effects) हैं जो ग्रेंजर कॉज़ैलिटी (Granger causality) और लासो (Lasso) जैसी शास्त्रीय विधियों द्वारा पीछे छोड़ दिए जाते हैं।

Ankit Hemant Lade, Sai Krishna Jasti, Indar Kumar, Aman Chadha2026-05-12
🤖 machine learning

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

यह सर्वेक्षण बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए अनुकूलन एल्गोरिदम (ऑप्टिमाइज़ेशन एल्गोरिदम) की एक व्यापक समीक्षा प्रदान करता है, जो शास्त्रीय प्रथम-क्रम दृष्टिकोणों से लेकर म्यूऑन (Muon) जैसे उन्नत मैट्रिक्स-आधारित ऑप्टिमाइज़र तक विधियों को वर्गीकृत करता है, और एक कठोर, स्केल-जागरूक बेंचमार्किंग का समर्थन करता है जो अभिसरण (कन्वर्जेंस), स्थिरता, मेमोरी दक्षता और कार्यान्वयन जटिलता का संयुक्त रूप से मूल्यांकन करता है।

Aditya Ranganath2026-05-12
🤖 AI

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

यह शोध पत्र ओपन ऑन्टोलॉजीज (Open Ontologies) का परिचय देता है, जो एक ओपन-सोर्स रस्ट-आधारित (Rust-based) प्रणाली है जो यह प्रदर्शित करती है कि स्थिर 1-टू-1 मिलान उच्च-गुणवत्ता वाले ऑन्टोलॉजी संरेखण के लिए एक महत्वपूर्ण कारक है और संरचित मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) टूल एक्सेस, एलएलएम-संचालित (LLM-driven) ऑन्टोलॉजी इंटरेक्शन के लिए रॉ फ़ाइल रीडिंग और नो-फ़ाइल बेसलाइन दोनों की तुलना में काफी बेहतर प्रदर्शन करता है।

Fabio Rovai2026-05-12
🤖 AI

Agentic MIP Research: Accelerated Constraint Handler Generation

यह शोध पत्र एक एजेंटिक फ्रेमवर्क प्रस्तुत करता है जो मिश्रित-पूर्णांक प्रोग्रामिंग (mixed-integer programming) के लिए SCIP बाधा हैंडलर्स (constraint handlers) को स्वायत्त रूप से उत्पन्न करने, सत्यापित करने और मूल्यांकन करने के लिए LLMs का लाभ उठाता है, जो सफलतापूर्वक वैश्विक बाधा संरचनाओं को पुनः प्राप्त करने और नवीन प्रवर्धन रणनीतियों (propagation strategies) की खोज करने में सफल रहा है जो बेंचमार्क इंस्टेंस पर सॉल्वर के प्रदर्शन में सुधार करती हैं।

Liding Xu, Yugeng Zhou, Sebastian Pokutta2026-05-12
🤖 AI

Emergent Semantic Role Understanding in Language Models

यह शोध पत्र यह प्रदर्शित करता है कि लीनियर प्रोब्स (linear probes) द्वारा प्रमाणित, प्री-ट्रेनिंग के दौरान फ्रोजन डिकोडर-ओनली ट्रांसफॉर्मर में सिमेंटिक रोल (semantic role) की समझ आंशिक रूप से उभरती है, हालांकि पूर्ण प्रदर्शन के लिए फाइन-ट्यूनिंग की आवश्यकता होती है और मॉडल स्केल बढ़ने के साथ इन भूमिकाओं का आंतरिक प्रतिनिधित्व तेजी से वितरित होता जाता है।

Carla Griffiths, Mirco Musolesi2026-05-12