💻 computer science

stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation

यह शोध पत्र **stable-worldmodel (swm)** को प्रस्तुत करता है, जो एक उच्च-प्रदर्शन डेटा लेयर, पुनरुत्पादनीय बेसलाइन कार्यान्वयन और व्यवस्थित सामान्यीकरण बेंचमार्क प्रदान करके वर्तमान विखंडन और पुनरुत्पादकता की चुनौतियों को दूर करने के लिए वर्ल्ड मॉडलिंग अनुसंधान को एकीकृत और मानकीकृत करने हेतु डिज़ाइन किया गया एक ओपन-सोर्स प्लेटफॉर्म है।

Lucas Maes, Quentin Le Lidec, Luiz Facury, Nassim Massaudi, Ayush Chaurasia, Francesco Capuano, Richard Gao, Taj Gillin (…)2026-05-22
💬 NLP

Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

यह शोध पत्र पोस्ट-ट्रेनिंग लार्ज लैंग्वेज मॉडल्स के लिए मौजूदा एंट्रॉपी-आधारित अनिश्चितता अनुमानकों (uncertainty estimators) में महत्वपूर्ण एनिसोट्रोपिक (anisotropic) और कैलिब्रेशन अंतराल की पहचान करता है और ज्योमेट्री-अवेयर कैलिब्रेटेड पॉलिसी ऑप्टिमाइज़ेशन (GCPO) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो ग्रेडिएंट परिवर्तनशीलता को अधिक निष्ठा से ट्रैक करने और अनुकूलन स्थिरता में सुधार करने के लिए ज्योमेट्री-अवेयर मापों और रिवॉर्ड-आधारित कैलिब्रेशन को एकीकृत करता है।

Zheyuan Zhang, Kaiwen Shi, Han Bao, Zehong Wang, Tianyi Ma, Yanfang Ye2026-05-22
💻 computer science

Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws

यह शोधपत्र यह प्रदर्शित करता है कि ऑप्टिमाइज़र का चयन ट्रांसफॉर्मर मॉडलों के स्पेक्ट्रल स्केलिंग लॉज़ (spectral scaling laws) को मौलिक रूप से बदल देता है, यह प्रकट करते हुए कि Muon जैसे ऑप्टिमाइज़र्स, AdamW की तुलना में कठिन-से-सीखने वाले (hard-to-learn) परिदृश्यों में स्पेक्ट्रल क्षमता के काफी बेहतर उपयोग को प्राप्त कर सकते हैं, जिससे अनुकूलन (optimization) को प्रतिनिधित्व स्केलिंग (representation scaling) के एक महत्वपूर्ण, स्वतंत्र अक्ष के रूप में स्थापित किया गया है जो वास्तुशिल्प डिजाइन (architectural design) के समकक्ष है।

Nandan Kumar Jha, Brandon Reagen2026-05-22
💻 computer science

Symbolic Density Estimation for Discrete Distributions

यह शोध पत्र सिम्बोलिक डेंसिटी एस्टीमेशन (SDE) प्रस्तुत करता है, जो एक अनसुपरवाइज्ड फ्रेमवर्क है जो डोमेन-विशिष्ट प्रायर्स (priors) को इवोल्यूशनरी सर्च के साथ जोड़कर डिस्क्रीट डिस्ट्रीब्यूशन्स के लिए व्याख्या योग्य, क्लोज्ड-फॉर्म प्रोबेबिलिटी मास फंक्शन्स को स्वचालित रूप से खोजता है, जिसे एक नए बेंचमार्क डेटासेट और बेहतर मॉडल फिट दिखाने वाले वास्तविक दुनिया के अनुप्रयोगों के माध्यम से मान्य किया गया है।

Ziwen Liu, Meng Li2026-05-22
💻 computer science

On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation

यह शोध पत्र ऑन-पॉलिसी कंसिस्टेंसी ट्रेनिंग (OPCT) को प्रस्तुत करता है, जो एक नवीन अलाइनमेंट विधि है जो पारंपरिक ऑफलाइन सुपरवाइज्ड फाइन-ट्यूनिंग दृष्टिकोणों के कारण होने वाली क्षमता में गिरावट और खराब सामान्यीकरण से बचते हुए, सिकोफैंसी (sycophancy) और जेलब्रेक्स के विरुद्ध एलएलएम (LLM) सुरक्षा में महत्वपूर्ण सुधार करता है।

Andy Han, Kristina Fujimoto, Avidan Shah, Kiet Nguyen, Kai Xu, Chen Yueh-Han, Ilia Sucholutsky, Rico Angell2026-05-22
⚡ electrical engineering

Energy-Gated Attention: Spectral Salience as an Inductive Bias for Transformer Attention

यह शोध पत्र एनर्जी-गेटेड अटेंशन (EGA) प्रस्तुत करता है, जो एक पैरामीटर-कुशल ट्रांसफॉर्मर संशोधन है जो सूचनात्मक रूप से सघन टोकन को प्राथमिकता देने के लिए टोकन एम्बेडिंग की सीखी गई स्पेक्ट्रल ऊर्जा के आधार पर वैल्यू एग्रीगेशन को गेट करता है, जो भाषा मॉडलिंग बेंचमार्क पर निरंतर वैलिडेशन लॉस सुधार प्राप्त करता है और यह प्रकट करता है कि इष्टतम ऊर्जा थ्रेसहोल्ड अंग्रेजी टेक्स्ट में कंटेंट वर्ड्स के स्थिर अंश के अनुरूप है।

Athanasios Zeris2026-05-22
📊 statistics

Causal Discovery in Structural VAR Models Under Equal Noise Variance

यह शोध पत्र समान शोर प्रसरण (noise variance) वाले रैखिक गाऊसी स्ट्रक्चरल VAR मॉडलों में कारण खोज (causal discovery) की चुनौती को संबोधित करता है, जिसमें अवलोकन संबंधी तुल्यता (observational equivalence) के लिए एक सैद्धांतिक ढांचा स्थापित किया गया है और ENVAR प्रस्तावित किया गया है, जो एक स्पर्सिटी-आधारित एल्गोरिदम है जो तुल्यता वर्ग के भीतर एक प्रतिनिधि कारण ग्राफ की पहचान करता है, जिसे सिंथेटिक और fMRI डेटा दोनों पर मान्य किया गया है।

SeyedSina Seyedi HasanAbadi, Fahimeh Arab, Erfan Nozari, AmirEmad Ghassami2026-05-22
💬 NLP

Geometry-Adaptive Explainer for Faithful Dictionary-Based Interpretability under Distribution Shift

यह शोध पत्र ज्योमेट्री-एडेप्टिव एक्सप्लेनर (GAE) को प्रस्तुत करता है, जो एक ग्रेडिएंट-फ्री विधि है जो डिक्शनरी-आधारित व्याख्यात्मकता उपकरणों (interpretability tools) को आउट-ऑफ-डिस्ट्रीब्यूशन एक्टिवेशन सबस्पेस के साथ पुनर्गठित करती है ताकि वितरण बदलावों (distribution shifts) के तहत कॉज़ल फेथफुलनेस (causal faithfulness) में महत्वपूर्ण सुधार किया जा सके।

Sungjun Lim, Heedong Kim, Andrew Lee, Kyungwoo Song2026-05-22
💻 computer science

OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

यह शोध पत्र ऑरेकल-प्रॉम्प्टेड पॉलिसी ऑप्टिमाइज़ेशन (OPPO) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो ऑरेकल-कंडीशन्ड लाइकलीहुड रेश्यो से टोकन-स्तरीय लाभ (एडवांटेज) प्राप्त करने के लिए बायेसियन वैल्यू रिकर्सन का लाभ उठाता है, जिससे सीखे गए वैल्यू नेटवर्क की आवश्यकता समाप्त हो जाती है और यह जटिल तर्क बेंचमार्क पर GRPO जैसी मौजूदा विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

Yu Li, Rui Miao, Tian Lan, Zhengling Qi2026-05-22
💻 computer science

The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation

यह शोध पत्र ज़ीरो-सीओटी प्रोब (ZCP) को प्रस्तुत करता है, जो एक नवीन ब्लैक-बॉक्स डिटेक्शन विधि है जो लेटेंट मेमोराइजेशन (latent memorization) को प्रकट करने के लिए चेन-ऑफ-थॉट रीजनिंग को ट्रंकेट करके और आइसोमॉर्फिक परटर्बेशन (isomorphic perturbation) के माध्यम से संदूषण की गंभीरता को परिमाणित करके बड़े भाषा मॉडलों में इवेसिव डेटा कंटैमिनेशन (evasive data contamination) को उजागर करती है।

Yifan Lan, Yuanpu Cao, Hanyu Wang, Lu Lin, Jinghui Chen2026-05-22