🤖 machine learning

Continual Learning for Sequential Personalization of Small Language Models: A Stability Monitoring Analysis

यह शोध पत्र एज डिवाइस पर स्मॉल लैंग्वेज मॉडल्स के अनुक्रमिक (sequential) LoRA पर्सनलाइजेशन की जांच करता है, जो यह प्रदर्शित करता है कि हल्के संदर्भ सेट डायग्नोस्टिक्स (lightweight reference set diagnostics) छिपी हुई अस्थिरता और कैटास्ट्रोफिक फॉरगेटिंग का पता लगाने के लिए आवश्यक हैं जिन्हें केवल टास्क-लेवल मेट्रिक्स अनदेखा कर सकते हैं।

Thomas S. Paula, Lucas S. Kupssinskü, Rodrigo C. Barros2026-06-29
🤖 machine learning

Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation

यह शोधपत्र डिस्क्रीट टेक्स्टुअल लेटेंट स्टेट्स और एक फैक्टराइज्ड GRPO ट्रेनिंग मेथड को पेश करके टेक्स्ट-आधारित वर्ल्ड मॉडल्स में हिस्ट्री बाईपास के कारण होने वाली अनआइडेंटिफिएबल लेटेंट स्टेट्स की चुनौती का समाधान करता है, जो सख्त मीडिएशन को लागू करता है और इसके परिणामस्वरूप रिप्रेजेंटेशन क्वालिटी और लॉन्ग-होरिज़न रोलआउट परफॉर्मेंस में महत्वपूर्ण सुधार लाता है।

Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das2026-06-29
🤖 machine learning

Deployment-Side Adaptiveness in Multi-Horizon Volatility Forecasting

यह शोध पत्र यह प्रदर्शित करता है कि मल्टी-होरिज़न अस्थिरता पूर्वानुमान (volatility forecasting) में, एक प्रशिक्षित मल्टी-आउटपुट मॉडल पर लागू की जाने वाली परिनियोजन रणनीति (deployment strategy), मॉडल आर्किटेक्चर जितनी ही महत्वपूर्ण है, जो यह दर्शाता है कि इन्फरेंस-टाइम रोलआउट नियमों का सत्यापन-आधारित चयन सटीकता और लागत-दक्षता में महत्वपूर्ण सुधार कर सकता है और यह भी प्रकट करता है कि इष्टतम नीतियां विशिष्ट आर्किटेक्चर और चुने गए मूल्यांकन मीट्रिक दोनों के प्रति संवेदनशील होती हैं।

Riku Green, Zahraa S. Abdallah, Telmo M Silva Filho2026-06-29
🤖 machine learning

Aurora: A Leverage-Aware Spectral Optimizer

यह शोध पत्र ऑरोरा (Aurora) को प्रस्तुत करता है, जो एक लीवरेज-अवेयर स्पेक्ट्रल ऑप्टिमाइज़र है जो म्यूऑन (Muon) के पोलर फैक्टर ज्योमेट्री को संरक्षित करते हुए मैट्रिक्स पैरामीटर अपडेट में रो-यूनिफॉर्मिटी (row-uniformity) को लागू करता है, जिससे न्यूरॉन स्टैग्नेशनेशन (neuron stagnation) को रोका जा सके और विशेष रूप से बहुत विस्तृत (wide) एमएलपी परतों को प्रशिक्षित करने में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Alec Dewulf, Dhruv Pai, Li Yang, Ashley Zhang, Ben Keigwin2026-06-29
🤖 machine learning

Learning to Reason with Curriculum II: Compositional Generalization

यह शोध पत्र प्रदर्शित करता है कि एक ऑटोकरिकुलम (autocurriculum) दृष्टिकोण, जो लंबी अनुक्रमिक गणना कार्यों को छोटे उप-समस्याओं में पुनरावर्ती रूप से विभाजित करता है, उप-बहुपद (subpolynomial) पर्यवेक्षण टोकन से सीखने में सक्षम बनाकर और संदर्भ मॉडल कवरेज की आवश्यकताओं को पूर्ण अनुक्रम लंबाई से घटाकर बहुत छोटी ब्लॉक लंबाई तक शिथिल करके, प्रत्यक्ष विधियों की तुलना में नाटकीय रूप से बेहतर सांख्यिकीय जटिलता प्राप्त करता है।

Nived Rajaraman, Audrey Huang, Miroslav Dudik, Robert Schapire, Dylan Foster, Akshay Krishnamurthy2026-06-29
🤖 AI

Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

यह शोध पत्र बाइफोकल डिफ्यूजन लैंग्वेज मॉडल्स, विशेष रूप से R2LM आर्किटेक्चर को प्रस्तुत करता है, जो बाइडायरेक्शनल कॉन्टेक्स्ट (bidirectional context) को संरक्षित करते हुए KV कैशिंग के साथ पैरेलल डिकोडिंग को सक्षम करने के लिए कॉज़ल अटेंशन (causal attention) को एक हल्के रिवर्स माम्बा साइडकार (reverse Mamba sidecar) के साथ जोड़कर डिस्क्रीट डिफ्यूजन मॉडल्स में जनरेशन क्वालिटी और इन्फरेंस एफिशिएंसी के बीच के ट्रेड-ऑफ को हल करता है।

Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, F (…)2026-06-29
🤖 machine learning

Reduction of Probabilistic Chemical Reaction Networks

यह शोध पत्र उनके अंतर्निहित फैक्टर ग्राफ संरचना को पुनर्प्राप्त करने और हालिया न्यूनीकरण तकनीकों को लागू करके संभाव्य रासायनिक अभिक्रिया नेटवर्क के आकार को महत्वपूर्ण रूप से कम करने की एक विधि प्रस्तुत करता है, जिससे मौजूदा एनकोडिंग विधियों की अत्यधिक जटिलता को दूर करते हुए उनके बिलीफ-प्रोपैगेशन फिक्स्ड पॉइंट्स को संरक्षित किया जा सके।

Mauricio Montes, Gregoire Sergeant-Perthuis2026-06-29
🤖 machine learning

The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

यह शोध पत्र LCA का प्रस्ताव करता है, जो एक नवीन परिणाम-पर्यवेक्षित (outcome-supervised) प्रक्रिया प्रतिफल मॉडलिंग ढांचा है जो इसे सॉफ्टमैक्स-वेटेड-सम (Softmax-Weighted-Sum) पूलिंग के साथ एक मल्टीपल इंस्टेंस लर्निंग समस्या के रूप में औपचारिक रूप देकर क्रेडिट असाइनमेंट चुनौती का समाधान करता है, जो इस सिद्धांत पर कार्य करता है कि एक तर्क श्रृंखला (reasoning chain) की शक्ति उसकी सबसे कमजोर कड़ी द्वारा निर्धारित होती है ताकि चरण-दर-चरण एनोटेशन की आवश्यकता के बिना प्रक्रियात्मक त्रुटियों को प्रभावी ढंग से पहचाना जा सके।

Tianyu Jia, Yue Fang, Hongxin Ding, Rihong Qiu, Zhibang Yang, Zhijing Wu, Xu Chu, Junfeng Zhao, Yasha Wang2026-06-29
🤖 AI

End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference

यह शोध पत्र लर्निंग टू एलोकेट (L2A) का प्रस्ताव करता है, जो एक एंड-टू-एंड फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को इनपुट की कठिनाई और वास्तविक समय के संसाधन संबंधी बाधाओं दोनों के आधार पर अपने कम्प्यूटेशनल फुटप्रिंट को गतिशील रूप से अनुकूलित करने में सक्षम बनाता है, जिससे बिना किसी अलग मॉडल ट्यूनिंग के दक्षता के एक विस्तृत पारेटो फ्रंटियर (Pareto frontier) में लगभग-डेंस सटीकता प्राप्त होती है।

Yuhang Chen, Jinhao Duan, Ruichen Zhang, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal (…)2026-06-29
🤖 machine learning

Flexformer: Flexible Linear Transformer with Learnable Attention Kernel

फ्लेक्सफॉर्मर (Flexformer) एक लचीला लीनियर ट्रांसफॉर्मर है जो प्रशिक्षण योग्य स्पेक्ट्रल आवृत्तियों के माध्यम से पूरी तरह से डेटा-संचालित तरीके से अटेंशन कर्नेल सीखकर लंबी अनुक्रमों (sequences) के लिए अभिव्यंजना और स्केलेबिलिटी को बढ़ाता है, जो दक्षता और हस्तांतरणीयता बनाए रखते हुए लगातार बेसलाइनों से बेहतर प्रदर्शन करता है।

Haoran Zhang, Feng Zhou2026-06-29