🤖 machine learning

PC3D: Zero-Shot Cooperation Across Variable Rosters via Personalized Context Distillation

यह शोध पत्र PC3D का प्रस्ताव करता है, जो एक ऐसी विधि है जो विकेंद्रीकृत मल्टी-एजेंट सुदृढीकरण लर्निंग एजेंटों को विविध टीम रोस्टर के बीच ज़ीरो-शॉट सहयोग प्राप्त करने में सक्षम बनाती है, जो एक केंद्रीकृत शिक्षक से व्यक्तिगत समन्वय संदर्भों को स्थानीय नीतियों में आसतित (distill) करती है ताकि वे इंटरेक्शन इतिहास से प्रासंगिक टीम जानकारी को अनुकूल रूप से पुनः प्राप्त कर सकें।

Ahmet Onur Akman, Rafał Kucharski2026-05-12
🤖 machine learning

The Polynomial Counting Capabilities of Message Passing Neural Networks

यह शोध पत्र मैसेज पासिंग न्यूरल नेटवर्क्स (MPNNs) की बहुपद गणना क्षमताओं (polynomial counting capabilities) की जांच करता है, जो यह प्रदर्शित करता है कि वे मीन एग्रीगेशन (mean aggregation) का उपयोग करके, विशेष रूप से रेगुलर ग्राफ, नॉन-नेस्टेड मोडैलिटीज या ट्री-लाइक संरचनाओं जैसी स्थितियों के तहत, नोड-लेबल वाले ग्राफ में वैश्विक और विशिष्ट स्थानीय बहुपद बाधाओं (global and specific local polynomial constraints) को सत्यापित कर सकते हैं।

Marco Sälzer, Pascal Bergsträßer, Anthony W. Lin2026-05-12
📊 statistics

Sharp feature-learning transitions and Bayes-optimal neural scaling laws in extensive-width networks

यह शोध पत्र यह स्थापित करता है कि उच्च-आयामी, विस्तृत-चौड़ाई वाले न्यूरल नेटवर्क में पदानुक्रमित विशेषताओं (hierarchical features) को सीखते समय, विशेषता अधिग्रहण (feature acquisition) तीक्ष्ण क्रमिक चरण संक्रमणों (sharp sequential phase transitions) के माध्यम से होता है जो एक "प्रभावी चौड़ाई" (effective width) को परिभाषित करते हैं और विशिष्ट सामान्यीकरण त्रुटि स्केलिंग नियमों (generalization error scaling laws) को एक एकल इष्टतम संबंध में एकीकृत करते हैं, जिसे एडम-प्रशिक्षित छात्रों (Adam-trained students) द्वारा अनुभवजन्य रूप से प्राप्त किया जा सकता है।

Minh-Toan Nguyen, Jean Barbier2026-05-12
🤖 machine learning

Causal Explanations from the Geometric Properties of ReLU Neural Networks

यह शोध पत्र ReLU न्यूरल नेटवर्क के लिए सटीक कारण संबंधी स्पष्टीकरण (causal explanations) उत्पन्न करने की एक विधि प्रस्तावित करता है, जो उनके ज्यामितीय ढांचे से, जिन्हें उत्तल बहुभुजों (convex polytopes) द्वारा परिभाषित खंडित रैखिक फलनों (piecewise linear functions) के रूप में माना जाता है, सीधे निर्णय नियमों को निकालकर किया जाता है, जिससे व्याख्यात्मकता के लिए मॉडलों के डिस्टिलेशन (distilling) से जुड़ी प्रदर्शन गिरावट और निष्ठा संबंधी समस्याओं से बचा जा सके।

Hector Woods, Philippa Ryan, Rob Alexander2026-05-12
🤖 machine learning

Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization

यह शोध पत्र एक सिद्धांत-आधारित ढांचे का प्रस्ताव करता है जो फिक्स्ड बेंचमार्क पर सर्वश्रेष्ठ लार्ज लैंग्वेज मॉडल की सांख्यिकीय रूप से वैध और लागत-कुशल पहचान करने में सक्षम बनाने के लिए लो-रैंक फैक्टराइजेशन प्रेडिक्शन्स के साथ मल्टी-आर्म्ड बैंडिट एल्गोरिदम को जोड़कर डबली रोबस्ट एस्टिमेटर्स का निर्माण करता है।

Elad Tolochinsky, Yaniv Tenzer, Yaniv Romano2026-05-12
📊 statistics

Real vs. Semi-Simulated: Rethinking Evaluation for Treatment Effect Estimation

यह शोध पत्र उपचार प्रभाव अनुमान (treatment effect estimation) में पद्धतिगत अनुसंधान और व्यावहारिक अनुप्रयोग के बीच एक महत्वपूर्ण विच्छेद को प्रकट करता है, जो यह दर्शाता है कि काउंटरफैक्चुअल मेट्रिक्स और अर्ध-सिम्युलेटेड बेंचमार्क वास्तविक दुनिया के डेटा पर मॉडल के प्रदर्शन की विश्वसनीय रूप से भविष्यवाणी करने में विफल रहते हैं, जिससे अवलोकन योग्य मेट्रिक्स और वास्तविक-डेटा सत्यापन की ओर बदलाव का समर्थन मिलता है।

George Panagopoulos2026-05-12
🤖 machine learning

Beyond Spatial Compression: Interface-Centric Generative States for Open-World 3D Structure

यह शोध पत्र C2LT-3D टोकेनाइज़र के माध्यम से "इंटरफ़ेस-केंद्रित जनरेटिव अवस्थाओं" (interface-centric generative states) का प्रस्ताव देता है, जो 3D प्रतिनिधित्व को निष्क्रिय स्थानिक संपीड़न (passive spatial compression) से एक ऐसी परिचालन अवस्था में स्थानांतरित करता है जो ओपन-वर्ल्ड 3D एसेट्स में सुदृढ़ संरचनात्मक तर्क और मरम्मत को सक्षम करने के लिए ज्यामिति, घटक स्वामित्व और जुड़ाव वैधता को स्पष्ट रूप से प्रदर्शित करती है।

Xiang Chen, Alexander Binder2026-05-12
🤖 machine learning

SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding

SlimSpec ड्राफ्टर के लैंग्वेज मॉडल हेड के लिए एक लो-रैंक पैरामीट्राइजेशन पेश करता है जो आंतरिक प्रस्तुतियों (inner representations) को संकुचित करता है ताकि पूर्ण वोकैबुलरी सपोर्ट को बनाए रखते हुए और न्यूनतम पाइपलाइन समायोजन की आवश्यकता के साथ 4-5 गुणा त्वरण और मौजूदा तरीकों की तुलना में 8-9% अधिक एंड-टू-एंड स्पीडअप प्राप्त किया जा सके।

Anton Plaksin, Sergei Krutikov, Sergei Skvortsov, Alexander Samarin2026-05-12
🔬 materials science

QT-Net: Rethinking Evaluation of AI Models in Atomic Chemical Space

यह शोध पत्र QT-Net प्रस्तुत करता है, जो एक रोटेशनली ऑगमेंटेड ग्राफ न्यूरल नेटवर्क है जिसका मूल्यांकन SOAP डिस्क्रिप्टर्स पर आधारित एक सिद्धांतपूर्ण आउट-ऑफ-डिस्ट्रीब्यूशन प्रोटोकॉल के माध्यम से किया गया है, जो यह प्रदर्शित करता है कि इलेक्ट्रॉन पॉपुलेशन और मल्टीपोल जैसी परमाणु गुणों का अनुमान लगाना डाउनस्ट्रीम मॉलिक्यूलर प्रॉपर्टी प्रेडिक्शन में सुधार करता है और ग्राउंड-ट्रुथ डाइपोल मोमेंट्स को सटीक रूप से रिकवर करता है।

Pablo Martínez Crespo, Stefano Ribes, Martin Rahm, Richard Beckmann, Robert S. Jordan, Marisa Gliege, Santiago Miret, Vi (…)2026-05-12
🤖 machine learning

Can Muon Fine-tune Adam-Pretrained Models?

यह शोध पत्र प्री-ट्रेन्ड मॉडल्स की फाइन-ट्यूनिंग के लिए Adam से Muon पर स्विच करने के कारण होने वाले प्रदर्शन ह्रास (performance degradation) की जांच करता है, जो यह प्रदर्शित करता है कि परिणामी ऑप्टिमाइज़र मिसमैच (optimizer mismatch) सीखे गए ज्ञान को बाधित करता है और इसे LoRA जैसे तरीकों के माध्यम से अपडेट स्ट्रेंथ को सीमित करके प्रभावी ढंग से कम किया जा सकता है।

Xingyu Qu, Peigeng Huang, Samuel Horvath2026-05-12