💬 NLP

Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

यह शोधपत्र म्यूचुअल रीइन्फोर्समेंट लर्निंग (Mutual Reinforcement Learning) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विषम भाषा मॉडलों (heterogeneous language models) को एक साझा सबस्ट्रेट (substrate) और टोकेनाइज़र एलाइनमेंट लेयर के माध्यम से टाइप किए गए अनुभवों को समवर्ती रूप से आदान-प्रदान करने में सक्षम बनाता है, यह प्रदर्शित करते हुए कि डेटा-स्तर या वैल्यू-स्तर की साझाकरण रणनीतियों की तुलना में आउटकम-स्तर (outcome-level) का सफलता स्थानांतरण सबसे अनुकूल स्थिरता-समर्थन व्यापार-संतुलन (stability-support trade-off) प्रदान करता है।

Xiaoze Liu, Dhananjay Ram, Yuting Zhang, Zhaoyang Zhang, Wei Xia, Stefano Soatto2026-05-11
💬 NLP

PaT: Planning-after-Trial for Efficient Test-Time Code Generation

यह शोध पत्र प्लानिंग-आफ्टर-ट्रायल (PaT) का प्रस्ताव करता है, जो एक अनुकूली टेस्ट-टाइम कोड जनरेशन पॉलिसी है जो केवल सत्यापन विफलता (verification failure) होने पर ही एक प्लानर को सक्रिय करती है, जिससे एक लागत-कुशल विषम मॉडल कॉन्फ़िगरेशन सक्षम होता है जो कठोर प्लानिंग दृष्टिकोणों की तुलना में लागत-प्रदर्शन के संतुलन (cost-performance trade-off) में महत्वपूर्ण सुधार करता है।

Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok2026-05-11
💬 NLP

When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models

यह शोध पत्र प्रकट करता है कि Mixture-of-Experts मॉडलों में मानक top-kk राउटर अक्सर उन टोकन के लिए इष्टतम विशेषज्ञ पथों (expert paths) का चयन करने में विफल रहते हैं जिन्हें जटिल तर्क की आवश्यकता होती है, लेकिन केवल राउटर में एक न्यूनतम अपडेट विशेषज्ञों को पुनप्रशिक्षित किए बिना इन गलत आवंटनों को सुधारकर चुनौतीपूर्ण बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार कर सकता है।

Youngsik Yoon, Siwei Wang, Wei Chen, Jungseul Ok2026-05-11
⚡ electrical engineering

Resource-Element Energy Difference for Noncoherent Over-the-Air Federated Learning

यह शोध पत्र रिसोर्स-एलिमेंट एनर्जी डिफरेंस (REED) को प्रस्तुत करता है, जो ओवर-द-एयर फेडरेटेड लर्निंग के लिए एक नॉनकोहेरेंट एग्रीगेशन प्रिमिटिव है जो हस्ताक्षरित अपडेट्स को ऑर्थोगोनल रिसोर्स एलिमेंट्स में मैप करके इंस्टेंटेनियस चैनल स्टेट इंफॉर्मेशन की आवश्यकता को समाप्त करता है, जिससे डेटा विषमता के तहत सिद्ध अभिसरण दरों और सुदृढ़ प्रदर्शन के साथ निष्पक्ष एग्रीगेशन प्राप्त होता है।

Hao Chen, Zavareh Bozorgasl2026-05-11
🤖 machine learning

PerCaM-Health: Personalized Dynamic Causal Graphs for Healthcare Reasoning

PerCaM-Health एक नवीन ढांचा है जो ज्ञान-निर्देशित जनसंख्या संरचना के रूढ़िवादी अनुकूलन के माध्यम से व्यक्तिगत, समय-परिवर्तनीय कारण ग्राफ सीखकर जनसंख्या-स्तर और रोगी-विशिष्ट कारण मॉडलिंग के बीच के अंतर को पाटता है, जिससे व्यक्तिगत स्वास्थ्य देखभाल हस्तक्षेपों के लिए अधिक विश्वसनीय प्रतितथ्यात्मक तर्क (counterfactual reasoning) सक्षम होता है।

Elahe Khatibi, Ziyu Wang, Saba A. Farahani, Di Huang, Hung Cao, Ramesh Jain, Amir M. Rahmani2026-05-11
💬 NLP

MIPIAD: Multilingual Indirect Prompt Injection Attack Defense with Qwen -- TF-IDF Hybrid and Meta-Ensemble Learning

यह शोध पत्र MIPIAD को प्रस्तुत करता है, जो अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन हमलों के विरुद्ध एक बहुभाषी रक्षा ढांचा है, जो अंग्रेजी और बांग्ला के बीच क्रॉस-लिंगुअल प्रदर्शन अंतराल को कम करने और उच्च पहचान सटीकता प्राप्त करने के लिए TF-IDF विशेषताओं और मेटा-एन्सेम्बल लर्निंग के साथ एक LoRA-फाइन-ट्यून किए गए Qwen2.5 क्लासिफायर को जोड़ता है।

Al Muhit Muhtadi, Mostafa Rifat Tazwar2026-05-11
🤖 machine learning

bispectrum: Selective GG-Bispectra Made Practical

यह शोध पत्र **bispectrum** को प्रस्तुत करता है, जो एक ओपन-सोर्स PyTorch लाइब्रेरी है जो कम-डेटा, मध्यम-क्षमता वाले डीप लर्निंग परिदृश्यों में मौजूदा पूलिंग विधियों की तुलना में निरंतर प्रदर्शन सुधार प्रदर्शित करते हुए, सात ग्रुप एक्शन्स के लिए कुशल, चयनात्मक GG-बिसस्पेक्ट्रा को लागू करके लगभग-सटीक इनवेरिएंस (invariance) प्राप्त करने के लिए बनाया गया है।

Johan Mathe, Adele Myers, Simon Mataigne, Nina Miolane2026-05-11
🤖 machine learning

Bifurcation Models: Learning Set-Valued Solution Maps with Weight-Tied Dynamics

यह शोधपत्र द्विभाजन मॉडल (bifurcation models) प्रस्तुत करता है, जो एक वेट-टाइड डायनामिकल फ्रेमवर्क है जो एक एकल मनमाने ब्रांच के बजाय एक अट्रैक्टर लैंडस्केप को प्रदर्शित करके सेट-वैल्यूड सॉल्यूशन मैप्स सीखता है, जिससे मैनुअल सेलेक्टर्स की अनियमितता से बचा जा सके और फ्रस्ट्रेटेड आइसिंग मॉडल्स जैसी समस्याओं के लिए कई वैध इक्विलिब्रिया की खोज करने में बेहतर प्रदर्शन प्रदर्शित किया जा सके।

Caleb Jore, Jialin Liu2026-05-11
🤖 machine learning

Mask2Cause: Causal Discovery via Adjacency Constrained Causal Attention

Mask2Cause एक एंड-टू-एंड डीप लर्निंग फ्रेमवर्क है जो टाइम सीरीज़ फोरकास्टिंग के दौरान सीधे कॉज़ल ग्राफ को रिकवर करने के लिए एडजसेंसी-कंस्ट्रेंड मास्क्ड अटेंशन और इनवर्टेड वेरिएबल एम्बेडिंग्स को एकीकृत करता है, जिससे मॉडल की जटिलता को काफी कम करते हुए स्टेट-ऑफ-द-आर्ट डिस्कवरी सटीकता प्राप्त होती है।

Omar Muhammad, Pasupuleti Dhruv Shivkant, Deepak N. Subramani2026-05-11
🤖 machine learning

The Convergence Gap: Instruction-Tuned Language Models Stabilize Later in the Forward Pass

यह शोध पत्र "कन्वर्जेंस गैप" (convergence gap) डायग्नोस्टिक को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि इंस्ट्रक्शन-ट्यून्ड लैंग्वेज मॉडल्स अपने प्रीट्रेन्ड समकक्षों की तुलना में फॉरवर्ड पास के दौरान अपने नेक्स्ट-टोकन प्रेडिक्शन्स को बाद में स्थिर करते हैं, जो मुख्य रूप से लेट एमएलपी (late MLP) लेयर्स में होने वाली गणनाओं द्वारा संचालित होता है।

Yifan Zhou2026-05-11