🤖 machine learning

Hierarchical Mixture-of-Experts with Two-Stage Optimization

यह शोध पत्र Hi-MoE को प्रस्तुत करता है, जो एक पदानुक्रमित (hierarchical) Mixture-of-Experts फ्रेमवर्क है जो इंटर-ग्रुप लोड बैलेंसिंग और इंट्रा-ग्रुप एक्सपर्ट स्पेशलाइजेशन को एक साथ लागू करने के लिए दो-चरणीय अनुकूलन रणनीति का उपयोग करता है, जिससे रूटिंग स्थिरता और विविधता के बीच के ट्रेड-ऑफ को हल करते हुए मौजूदा बेसलाइनों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Gleb Molodtsov, Alexander Miasnikov, Aleksandr Beznosikov2026-05-12
🤖 machine learning

In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification

यह शोध पत्र प्रकट करता है कि इन-कॉन्टेक्स्ट लर्निंग मॉडल यांत्रिक रूप से प्रदर्शित टोकन को एक संपूर्ण शब्दावली के रूप में मानने के लिए बाध्य हैं, जिससे सटीकता तब ढह जाती है जब लेबल स्लॉट्स को सजातीय या यहाँ तक कि अर्थपूर्ण टोकनों से भरा जाता है, जो एक ऐसी घटना है जो विशिष्ट तंत्रिका परिपथों (न्यूरल सर्किट्स) तक सीमित है जो अर्थ संबंधी समझ को प्रारूप-संचालित टोकन पुनर्प्राप्ति के साथ ओवरराइड कर देते हैं।

Ming Liu2026-05-12
🤖 machine learning

A Qualitative Test-Risk Mechanism for Scaling Behavior in Normalized Residual Networks

यह शोध पत्र एक सैद्धांतिक ढांचा स्थापित करता है जो यह सिद्ध करता है कि नॉर्मलाइज्ड नेटवर्क्स में रेसिड्यूअल ब्लॉक्स को सम्मिलित करने से टेस्ट रिस्क में सुधार होता है, क्योंकि यह स्केलिंग लाभ को एक कम-जोखिम वाले "जंपबोर्ड" मॉडल से प्राप्त होने वाले रिप्रेजेंटेशनल गेन्स और नॉर्म-आधारित रेडेमेकर कॉम्प्लेक्सिटी बाउंड्स के माध्यम से नियंत्रित जनरलाइजेशन में विघटित करता है।

Daning Cheng, Zeyu Liu, Jun Sun, Fen Xia, Boyang Zhang, Dongping Liu, Yunquan Zhang2026-05-12
🤖 machine learning

What Cohort INRs Encode and Where to Freeze Them

यह शोधपत्र कोहॉर्ट-प्रशिक्षित इम्पलिसिट न्यूरल रिप्रेजेंटेशन्स (INRs) की जांच करता है, जिसमें यह पहचान की गई है कि फ्रीजिंग के लिए इष्टतम लेयर उच्चतम वेट स्टेबल रैंक (highest weight stable rank) के अनुरूप होती है और स्पार्स ऑटोएन्कोडर विश्लेषण के माध्यम से यह प्रकट किया गया है कि SIREN और फूरियर-फीचर MLPs मौलिक रूप से भिन्न प्रतिनिधित्व—स्थानीयकृत समन्वय टाइल्स (localized coordinate tiles) बनाम इमेज-स्पैनिंग कंटोर्स (image-spanning contours)—एन्कोड करते हैं, जिससे INRs में हस्तांतरणीय प्रतिनिधित्वों की पहली यांत्रिक समझ प्राप्त होती है।

Vasiliki Sideri-Lampretsa, Sophie Starck, Robbie Holland, Julian McGinnis, Daniel Rueckert2026-05-12
🤖 machine learning

mHC-SSM: Manifold-Constrained Hyper-Connections for State Space Language Models with Stream-Specialized Adapters

यह शोध पत्र प्रदर्शित करता है कि स्टेट स्पेस मॉडल्स (SSMs) पर मैनिफोल्ड-कंस्ट्रेंड हाइपर-कनेक्शन्स (mHC) को लागू करने से रेसिडुअल स्ट्रीम मिक्सिंग को डबली स्टोकेस्टिक मैट्रिसेस तक सीमित करके और स्ट्रीम-स्पेशलाइज्ड एडेप्टर्स को शामिल करके WikiText-2 पर लैंग्वेज मॉडलिंग प्रदर्शन में महत्वपूर्ण सुधार होता है, जिससे मेमोरी और थ्रूपुट लागत में मामूली वृद्धि के साथ कम परप्लेक्सिटी प्राप्त होती है।

Abdulvahap Mutlu, Şengül Doğan, Türker Tuncer2026-05-12
🤖 machine learning

SGC-RML: A reliable and interpretable longitudinal assessment for PD in real-world DNS

यह शोध पत्र SGC-RML का प्रस्ताव करता है, जो एक एकीकृत और व्याख्यात्मक ढांचा है जो अधूरे लेबलिंग और क्रॉस-डिवाइस पूर्वाग्रह के तहत पार्किंसंस रोग की गंभीरता के विश्वसनीय, ऑडिट योग्य और अनुकूल अनुदैर्ध्य मूल्यांकन को सक्षम करने के लिए अनिश्चितता अनुमान और कॉन्फॉर्मल अंशांकन के साथ एक साझा लक्षण एटलस में मल्टीमॉडल वास्तविक दुनिया के डेटा को एकीकृत करता है।

Wenbin Wei, Ruixiang Gao, Suyuan Yao, Xuanzhen Zhao, Cheng Huang, Hen-Wei Huang2026-05-12
🤖 machine learning

GNN for Structural Displacement Prediction

यह शोध पत्र एक ग्राफ न्यूरल नेटवर्क (GNN) फ्रेमवर्क प्रस्तावित करता है जो संरचनात्मक प्रणालियों को ग्राफ के रूप में निरूपित करता है ताकि बाहरी लोडिंग के तहत संरचनात्मक विस्थापनों (displacements) की सटीक और कुशल भविष्यवाणी की जा सके, जो पारंपरिक न्यूरल नेटवर्क से बेहतर प्रदर्शन करता है और वास्तविक समय की संरचनात्मक स्वास्थ्य निगरानी के लिए गणनात्मक रूप से महंगी परिमित तत्व विधि (FEM) विश्लेषण के एक तेज़, डेटा-संचालित विकल्प के रूप में कार्य करता है।

Hung-Fu Chang, Tzu-Kang Lin, Yung-Li Cheng2026-05-12
🤖 machine learning

Revitalizing the Beginning: Avoiding Storage Dependency for Model Merging in Continual Learning

यह शोध पत्र ट्रजेक्टरी रेगुलराइज्ड मर्जिंग (TRM) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो एक संवर्धित ट्रजेक्टरी उप-स्थान (augmented trajectory subspace) के भीतर मॉडल मर्जिंग को एक अनुकूलन प्रक्रिया के रूप में पुनर्गठित करके निरंतर शिक्षण (continual learning) में भंडारण सीमाओं और अनुकूलन ठहराव (optimization stagnation) को संबोधित करता है ताकि अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Xi Wang, Cheng Deng2026-05-12
🤖 machine learning

FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast

FlashSVD v1.5, जो चरण-विशिष्ट कर्नेल (phase-specific kernels), डेंस-KV डिकोड (dense-KV decode) और CUDA-ग्राफ रिप्ले (CUDA-graph replay) का उपयोग करने वाले एक एकीकृत रनटाइम को पेश करके SVD-संकुचित ट्रांसफॉर्मर्स में सैद्धांतिक FLOPs कमी और वास्तविक इन्फरेंस गति के बीच के अंतर को संबोधित करता है, 2.55x तक डिकोड स्पीडअप प्राप्त करता है, यह प्रदर्शित करते हुए कि व्यावहारिक लो-रैंक त्वरण के लिए केवल संपीड़न एल्गोरिदम के बजाय रनटाइम को-डिज़ाइन की आवश्यकता होती है।

Wenhao Wu, Zishan Shao, Kangning Cui, Jinhee Kim, Yixiao Wang, Hancheng Ye, Danyang Zhuo, Yiran Chen2026-05-12
🤖 machine learning

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

यह शोध पत्र रिफ्लेक्टिव प्रॉम्प्टेड पॉलिसी ऑप्टिमाइज़ेशन (R2PO) को प्रस्तुत करता है, जो एक दो-चरणीय LLM फ्रेमवर्क है जो विफलताओं का निदान करने और संशोधनों को निर्देशित करने के लिए स्केलर रिवॉर्ड्स के बजाय विस्तृत ट्राजेक्टरी-स्तरीय साक्ष्य का लाभ उठाकर पॉलिसी सर्च को बढ़ाता है, जबकि विशेष रूप से तेज़, अधिक स्थिर और विविध वातावरणों में निकट-इष्टतम प्रदर्शन प्राप्त करने के लिए "सेलिएंस बायस" विफलता मोड को संबोधित करता है।

Rahaf Abu Hara, Vaibbhav Murarri, Claudio Zito2026-05-12