🔬 physics

jNO: A JAX Library for Neural Operator and Foundation Model Training

jNO एक एकीकृत, JAX-नेटिव लाइब्रेरी है जो डेटा-संचालित और भौतिकी-सूचित (physics-informed) दृष्टिकोणों को एक एकल प्रतीकात्मक ट्रेसिंग सिस्टम (symbolic tracing system) में एकीकृत करके न्यूरल ऑपरेटर्स और फाउंडेशन मॉडल्स के प्रशिक्षण को सुव्यवस्थित करती है, जिससे बिना किसी कोड पुनर्गठन के ऑपरेटर रिग्रेशन, मेश-अवेयर रेसिडुअल इवैल्यूएशन और PDE-प्रतिबंधित अनुकूलन (PDE-constrained optimization) के बीच निर्बाध संक्रमण सक्षम होता है।

Leon Armbruster, Rathan Ramesh, Georg Kruse, Christopher Straub2026-05-12
🤖 machine learning

OUIDecay: Adaptive Layer-wise Weight Decay for CNNs Using Online Activation Patterns

यह शोध पत्र OUIDecay को प्रस्तुत करता है, जो CNNs के लिए एक अनुकूली वेट डिके शेड्यूलर (adaptive weight decay scheduler) है, जो एक्टिवेशन-आधारित ओवरफिटिंग-अंडरफिटिंग संकेतकों (Overfitting-Underfitting Indicators) का उपयोग करके ऑनलाइन रूप से लेयर-विशिष्ट रेगुलराइजेशन स्ट्रेंथ को गतिशील रूप से समायोजित करता है, और बिना वैलिडेशन डेटा की आवश्यकता के कई आर्किटेक्चर और डेटासेट्स पर बेहतर वैलिडेशन प्रदर्शन प्राप्त करता है।

Alberto Fernández-Hernández, Jose I. Mestre, Cristian Pérez-Corral, Manuel F. Dolz, Jose Duato, Enrique S. Quintana-Ortí2026-05-12
📊 statistics

Coarsening Linear Non-Gaussian Causal Models with Cycles

यह शोध पत्र चक्रों वाले उच्च-आयामी रैखिक गैर-गाऊसी मॉडलों से निम्न-आयामी कारणत्मक DAGs सीखने के लिए एक विधि प्रस्तावित करता है, जो यह प्रदर्शित करता है कि ऐसे सारांश पहचान योग्य, प्रेक्षण तुल्यता वर्गों (observational equivalence classes) में अपरिवर्तनीय और स्पष्ट नमूना जटिलता सीमाओं के साथ घनीय समय (cubic time) में गणनीय हैं।

Francisco Madaleno, Francisco C Pereira, Alex Markham2026-05-12
📊 statistics

Hyperparameter Transfer for Dense Associative Memories

यह शोध पत्र डेंस एसोसिएटिव मेमोरीज (Dense Associative Memories) के लिए हाइपरपैरामीटर ट्रांसफर विधियों की कमी को संबोधित करता है, जो साझा भार (shared weights) और अद्वितीय सक्रियण फलनों (unique activation functions) द्वारा जटिल बनाई गई एक कार्य के लिए छोटे से बड़े मॉडलों तक हाइपरपैरामीटरों को सफलतापूर्वक स्केल करने हेतु स्पष्ट सैद्धांतिक नुस्खे व्युत्पन्न करता है, और इन निष्कर्षों को मजबूत अनुभवजन्य सहमति के साथ मान्य करता है।

Roi Holtzman, Dmitry Krotov, Boris Hanin2026-05-12
🤖 machine learning

Fix the Loss, Not the Radius: Rethinking the Adversarial Perturbation of Sharpness-Aware Minimization

यह शोध पत्र लॉस-इक्वेटेड SAM (LE-SAM) का प्रस्ताव करता है, जो एक नवीन अनुकूलन विधि है जो शार्पनेस-अवेयर मिनिमाइजेशन के निश्चित पैरामीटर-स्पेस त्रिज्या को एक निश्चित लॉस-स्पेस बजट से बदल देती है ताकि फ्लैट मिनिमा की वक्रता-आधारित प्रकृति के साथ बेहतर तालमेल बिठाया जा सके, जिससे विविध बेंचमार्क पर अत्याधुनिक सामान्यीकरण प्रदर्शन प्राप्त किया जा सके।

Jinping Wang, Qinhan Liu, Zhiwu Xie, Zhiqiang Gao2026-05-12
🤖 AI

TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment

यह शोध पत्र TRACE का प्रस्ताव करता है, जो एक टोकन-रूटेड सेल्फ-डिस्टिलेशन विधि है जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) के दौरान एनोटेटर द्वारा चिह्नित महत्वपूर्ण स्पैन (critical spans) पर चुनिंदा रूप से KL डाइवर्जेंस लागू करती है, जिससे ग्रेडिएंट बर्बादी और विशेषाधिकार प्राप्त सूचना रिसाव (privileged-information leakage) को कम किया जाता है, जिससे मानक GRPO और फुल-रिस्पॉन्स सेल्फ-डिस्टिलेशन बेसलाइनों की तुलना में लॉन्ग-हॉरइजन मैथ रीजनिंग और आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन में महत्वपूर्ण सुधार होता है।

Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen, Yulan Hu, Zheng Pan, Xin Li, Lan-Zhe Guo2026-05-12
🤖 machine learning

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

यह शोध पत्र SPACE का प्रस्ताव करता है, जो एक मेमोरी-कुशल विधि है जो बड़े पैमाने के डिफ्यूजन मॉडल्स से विशिष्ट अवधारणाओं को प्रभावी ढंग से मिटाने के लिए क्रॉस-अटेंशन मापदंडों में पुनरावृत्ति से स्पर्सिटी (sparsity) उत्पन्न करती है, जबकि प्रतिकूल प्रॉम्प्ट्स (adversarial prompts) के विरुद्ध मजबूती बनाए रखती है।

Nicola Novello, Andrea M. Tonello2026-05-12
🤖 machine learning

Task-Aware Calibration: Provably Optimal Decoding in LLMs

यह शोध पत्र "टास्क कैलिब्रेशन" (task calibration) प्रस्तुत करता है, जो एक ऐसा प्रतिमान (paradigm) है जो एक कार्य-विशिष्ट लेटेंट स्पेस (task-specific latent space) के भीतर भविष्य कहनेवाला वितरण (predictive distributions) को कैलिब्रेट करके LLM डिकोडिंग को अनुकूलित करता है, जिससे यह प्रमाणित रूप से न्यूनतम बेयस जोखिम (Minimum Bayes Risk) प्राप्त करता है और विविध अनुप्रयोगों में जनरेशन की गुणवत्ता में सुधार करता है।

Tim Tomov, Dominik Fuchsgruber, Rajeev Verma, Stephan Günnemann2026-05-12
🤖 machine learning

Unveiling High-Probability Generalization in Decentralized SGD

यह शोध पत्र पॉइंटवाइज यूनिफॉर्म स्टेबिलिटी (pointwise uniform stability) पर आधारित एक नए लर्निंग थ्योरी को विकसित करके विकेंद्रीकृत SGD (decentralized SGD) के लिए उच्च-संभाव्यता सामान्यीकरण बाउंड्स (high-probability generalization bounds) और पारंपरिक SGD के बीच के अंतर को पाटता है, जो उत्तल (convex), दृढ़ उत्तल (strongly convex) और गैर-उत्तल (non-convex) परिवेशों में इष्टतम O(1mnlog⁡(1/δ))\mathcal{O}\left(\frac{1}{\sqrt{mn}}\log (1/\delta)\right) दर प्राप्त करता है।

Jiahuan Wang, Ping Luo, Ziqing Wen, Dongsheng Li, Tao Sun2026-05-12
🔭 astrophysics

Stellar Age Compression Reshapes Interpretations of the Milky Way Thick-Disk Formation History

यह अध्ययन प्रदर्शित करता है कि स्पेक्ट्रोस्कोपिक तारकीय आयु अनुमानों में व्यवस्थित संपीड़न (systematic compression), न कि एक स्वाभाविक रूप से विरल (bursty) निर्माण इतिहास, कृत्रिम रूप से उन तीव्र आयु-धातु संबंधों और तीव्र संयोजन समयसीमाओं को उत्पन्न कर सकता है जिनका उपयोग पहले मिल्की वे के मोटे डिस्क (thick disk) को चित्रित करने के लिए किया गया था, जो यह सुझाव देता है कि एस्टरोसेइस्मिक एंकरिंग (asteroseismic anchoring) एक काफी अधिक विस्तृत निर्माण अवधि को प्रकट करती है।

Zhipeng Zhang2026-05-12