🤖 machine learning

Gradient Flow Structure and Quantitative Dynamics of Multi-Head Self-Attention

यह शोध पत्र एक प्राकृतिक ऊर्जा फलन (energy functional) की एकदिष्टता (monotonicity) को सिद्ध करके, रेडियल शैडो टर्म्स (radial shadow terms) को प्रति-हेड एकदिष्टता (per-head monotonicity) के मुख्य अवरोध के रूप में पहचानकर, और क्लस्टरिंग दरों और एंट्रॉपी उत्पादन पर मात्रात्मक परिणाम निकालकर मल्टी-हेड सेल्फ-अटेंशन डायनेमिक्स के लिए एक सैद्धांतिक ढांचा स्थापित करता है जो ट्रांसफॉर्मर मॉडलों में स्थिरता और क्लस्टरिंग की समझ को एकीकृत करता है।

Ayan Pendharkar2026-05-07
📊 statistics

Probabilistic Classification and Uncertainty Quantification of Sahara Desert Climate Using Feedforward Neural Networks

यह लेख एक संभाव्यता ढांचा प्रस्तुत करता है जो 1960 से 1989 की अवधि के लिए सहारा मरुस्थल के जलवायु क्षेत्रों को वर्गीकृत करने और अनिश्चितताओं को मापने के लिए जनरेटिव न्यूरल नेटवर्क का उपयोग करता है, जो पारंपरिक नियतात्मक कोपेन-ट्रेवर्था वर्गीकरणों के मुकाबले एक अधिक सूक्ष्म विकल्प प्रदान करता है और साथ ही मरुस्थलीकरण के टेम्पोरल रुझानों का विश्लेषण भी करता है।

Stephen Tivenan, Indranil Sahoo, Yanjun Qian2026-05-07
🤖 machine learning

LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy

यह लेख एडेप्टिव कॉन्फॉर्मल सिमेंटिक एंट्रॉपी (ACSE) प्रस्तावित करता है, जो एक नवीन विधि है जो विविध प्रतिक्रियाओं में सिमेंटिक डिस्पर्शन (अर्थ संबंधी फैलाव) को अनुकूल रूप से मापकर और वितरण संबंधी धारणाओं के बिना परिमित-नमूना त्रुटि गारंटी प्रदान करने के लिए कॉन्फॉर्मल कैलिब्रेशन लागू करके LLMs की अनिश्चितता को मात्रात्मक रूप से मापता है, जिससे यह सुरक्षा-महत्वपूर्ण अनुप्रयोगों में मौजूदा लेक्सिकल और प्रोबेबिलिस्टिक बेसलाइन विधियों से आगे निकल जाता है।

Hamed Karimi, Vaishali Meyappan, Reza Samavi2026-05-07
🤖 machine learning

Memory as a Markov Matrix: Sample Efficient Knowledge Expansion via Token-to-Dictionary Mapping

यह लेख मेमोरी को एक मार्कोव ट्रांज़िशन मैट्रिक्स के रूप में दर्शाकर और कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) से बचने के लिए न्यूनतम एम्बेडिंग अपडेट के साथ एक टोकन-टू-वोकैबुलरी मैपिंग रणनीति का उपयोग करके, लार्ज लैंग्वेज मॉडल्स में निरंतर ज्ञान विस्तार के लिए एक सैंपल-एफिशिएंट फ्रेमवर्क प्रस्तावित करता है।

Kaustubh Pethkar, Ziyang Xiong, Zuofeng Shang, Yingcong Li2026-05-07
🤖 machine learning

LUCAS-MEGA: A Large-Scale Multimodal Dataset for Representation Learning in Soil-Environment Systems

यह शोध पत्र SoilFuser पाइपलाइन के माध्यम से निर्मित 70,000 से अधिक मृदा-पर्यावरण नमूनों के एक बड़े पैमाने के मल्टीमॉडल डेटासेट, LUCAS-MEGA का परिचय देता है, और डेटा-संचालित मृदा मॉडलिंग के लिए मजबूत, अनिश्चितता-जागरूक प्रतिनिधित्व सीखने वाले एक स्व-पर्यवेक्षित ट्रांसफॉर्मर, SoilFormer के प्रीट्रेनिंग के माध्यम से इसकी उपयोगिता को प्रदर्शित करता है।

Kuangdai Leng, Simon Jeffery, Panos Panagos, Tarje Nissen-Meyer2026-05-07
🤖 machine learning

On the Architectural Complexity of Neural Networks

यह शोधपत्र टेंसर ऑपरेशन्स को स्पष्ट रूप से मॉडल करके डीप न्यूरल नेटवर्क्स के विश्लेषण और निर्माण के लिए एक एकीकृत सैद्धांतिक ढांचा प्रस्तुत करता है, जो वास्तुशिल्प जटिलता और महत्वपूर्ण सफलताओं के बीच ऐतिहासिक संबंधों को उजागर करता है और 3,000 से अधिक अनछुए उच्च-जटिलता वाले आर्किटेक्चर के एक डेटासेट की पहचान कर उसे जारी करता है।

Nicholas J. Cooper, François G. Meyer, Michael L. Roberts, Carlos Zapata-Carratalá, Lijun Chen, Danna Gurari2026-05-07✓ Author reviewed ⓘ
🤖 machine learning

Budgeted LoRA: Distillation as Structured Compute Allocation for Efficient Inference

यह योगदान बजटेड लोरा (Budgeted LoRA) को प्रस्तुत करता है, जो एक डिस्टिलेशन फ्रेमवर्क है जो मॉडल संपीड़न को कम्प्यूटेशनल संसाधन आवंटन की एक संरचित समस्या के रूप में मानता है ताकि एक वैश्विक कम्प्यूटेशनल बजट के तहत डेंस और लो-रैंक पाथ्स के बीच क्षमता को गतिशील रूप से पुनर्वितरित करके स्पष्ट अनुमान दक्षता वाले स्टूडेंट मॉडल्स का उत्पादन किया जा सके।

Mohammed Sabry, Anya Belz2026-05-07
🤖 machine learning

Structural Equivalence and Learning Dynamics in Delayed MARL

यह शोध पत्र सहकारी बहु-एजेंट प्रणालियों में अवलोकन (observation) और क्रिया (action) विलंबों के बीच संरचनात्मक तुल्यता को औपचारिक रूप से स्थापित करता है, यह सिद्ध करते हुए कि वे समान इष्टतम समाधान प्रदान करते हैं जबकि यह भी प्रदर्शित करता है कि उनकी शिक्षण गतिशीलता (learning dynamics) महत्वपूर्ण रूप से भिन्न है, जिससे अवलोकन-विलंबित से क्रिया-विलंबित वातावरण में सफल ज़ीरो-शॉट नीति हस्तांतरण (zero-shot policy transfer) सक्षम होता है।

Jules Sintes, Ana Bušić, Jiamin Zhu2026-05-07
🤖 machine learning

Covariance-Aware Goodness for Scalable Forward-Forward Learning

यह शोध पत्र कोवेरियेंस-अवेयर गुडनेस (Covariance-Aware Goodness) का परिचय देता है, जो एक स्केलेबल फॉरवर्ड-फॉरवर्ड लर्निंग फ्रेमवर्क है जिसमें कॉन्वोल्यूशनल सेटिंग्स में संरचनात्मक बाधाओं को दूर करने के लिए बाई-एक्सिस कोवेरियेंस गुडनेस (Bi-axis Covariance Goodness), लॉजिस्टिक फ्यूजन (Logistic Fusion) और फीचर एलाइनमेंट लेयर्स (Feature Alignment Layers) शामिल हैं, जो इमेजनेट-100 (ImageNet-100) और टाइनी-इमेजनेट (Tiny-ImageNet) पर बैकप्रोपैगेशन के समान प्रदर्शन प्राप्त करते हुए पीक मेमोरी उपयोग को लगभग 50% कम करता है।

Xiaoyi Jiang, Bashir M. Al-Hashimi, Kai Xu2026-05-07
🤖 machine learning

Probing Structural Mathematical Reasoning in Language Models with Algebraic Trapdoors

यह शोध पत्र भाषा मॉडलों में संरचनात्मक गणितीय तर्क (structural mathematical reasoning) का मूल्यांकन करने के लिए SL(3, Z) में उपसमूह-निर्माण समस्याओं (subgroup-construction problems) पर आधारित एक बेंचमार्क सुइट प्रस्तुत करता है, जो यह प्रकट करता है कि कैसे ऐसे बेंचमार्क आंतरिककृत बीजगणितीय पूर्वग्रहों (internalized algebraic priors) बनाम सामान्य गणना (general computation) पर निर्भर मॉडलों के बीच अंतर कर सकते हैं और खुले-निर्णायकता सीमाओं (open-decidability boundaries) का सामना करते समय कैलिब्रेटेड मेटा-कॉग्निशन (calibrated meta-cognition) के महत्व को उजागर करते हैं।

Igor Rivin2026-05-07