💬 NLP

A Study on Hidden Layer Distillation for Large Language Model Pre-Training

यह अध्ययन लार्ज लैंग्वेज मॉडल प्री-ट्रेनिंग के लिए हिडन लेयर डिस्टिलेशन (Hidden Layer Distillation) की लॉजिट-आधारित (logit-based) विधियों के विरुद्ध बेंचमार्किंग करता है और पाता है कि जहाँ यह लगातार परप्लेक्सिटी (perplexity) में सुधार करता है, वहीं यह डाउनस्ट्रीम कार्यों पर मानक नॉलेज डिस्टिलेशन (knowledge distillation) से विश्वसनीय रूप से बेहतर प्रदर्शन नहीं करता है, जो यह संकेत देता है कि इंटरमीडिएट रिप्रेजेंटेशन सिग्नल्स का पूर्ण लाभ उठाने के लिए आगे और भी बड़ी सफलताओं की आवश्यकता है।

Maxime Guigon, Lucas Dixon, Michaël E. Sander2026-05-13
🤖 AI

Controllable User Simulation

यह शोध पत्र यह पहचान करता है कि यूजर सिम्युलेटर का मानक सुपरवाइज्ड फाइन-ट्यूनिंग 'लुक-अहेड बायस' (look-ahead bias) को पेश करता है और पॉलिसी शिफ्ट के तहत "कंट्रोलेबिलिटी कोलैप्स" (controllability collapse) का कारण बनता है, और एक कॉज़ल इन्फरेंस फ्रेमवर्क के साथ विशिष्ट प्रशिक्षण शमन (training mitigations) प्रस्तावित करता है जो कॉज़ल कंसिस्टेंसी को बहाल करने और संवादात्मक एजेंटों के सुदृढ़, निष्पक्ष मूल्यांकन को सक्षम करने के लिए है।

Guy Tennenholtz, Ofer Meshi, Amir Globerson, Uri Shalit, Jihwan Jeong, Craig Boutilier2026-05-13
💬 NLP

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

यह शोध पत्र कोवेरिएंस-अवेयर (Covariance-Aware) GRPO को प्रस्तुत करता है, जो एक हाइपरपैरामीटर-मुक्त विधि है जो टोकन संभावनाओं और एडवांटेज के बीच कोवेरिएंस पर आधारित गॉसियन-कर्नेल एडवांटेज रीवेटिंग के माध्यम से चरम टोकन अपडेट्स को गतिशील रूप से कम भार देकर प्रशिक्षण को स्थिर करती है और तर्क प्रदर्शन में सुधार करती है।

Cheng Wang, Qin Liu, Wenxuan Zhou, Muhao Chen2026-05-13
🤖 machine learning

Sharpen Your Flow: Sharpness-Aware Sampling for Flow Matching

यह शोध पत्र SharpEuler को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) फ्लो मैचिंग सैंपलर है जो उच्च वेग क्षेत्र की तीक्ष्णता (velocity field sharpness) वाले क्षेत्रों में एकीकरण चरणों (integration steps) को अनुकूल रूप से आवंटित करके अनुमान दक्षता को अनुकूलित करता है, जिससे मॉडल मूल्यांकन की संख्या बढ़ाए बिना नमूना गुणवत्ता और मोड कवरेज में सुधार होता है।

Aditi Gupta, Soon Hoe Lim, Annan Yu, N. Benjamin Erichson2026-05-13
💬 NLP

Three Regimes of Context-Parametric Conflict: A Predictive Framework and Empirical Validation

यह शोध पत्र एक तीन-पद्धति वाले ढांचे (three-regime framework) को प्रस्तावित और मान्य करके इस बात पर विरोधाभासी अनुभवजन्य निष्कर्षों को सुलझाता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) प्रशिक्षण ज्ञान और प्रदान किए गए दस्तावेजों के बीच के विरोधाभासों को कैसे संभालते हैं, जो एकल-स्रोत अद्यतन (single-source updating), प्रतिस्पर्धी एकीकरण (competitive integration) और कार्य-उपयुक्त चयन (task-appropriate selection) के बीच अंतर करता है, और यह प्रदर्शित करता है कि मॉडल का व्यवहार साक्ष्य सामंजस्य (evidence coherence), पैरामीट्रिक निश्चितता (parametric certainty) और कार्य ढांचा आवश्यकताओं (task framing requirements) द्वारा पूर्वानुमेय रूप से नियंत्रित होता है।

Pruthvinath Jeripity Venkata2026-05-13
🧬 biology

EpiCastBench: Datasets and Benchmarks for Multivariate Epidemic Forecasting

यह शोध पत्र EpiCastBench को प्रस्तुत करता है, जो 40 क्यूरेटेड मल्टीवेरिएट महामारी डेटासेट और मानकीकृत मूल्यांकन प्रोटोकॉल वाला एक व्यापक बेंचमार्किंग फ्रेमवर्क है, ताकि सार्वजनिक स्वास्थ्य निर्णय लेने के लिए विविध पूर्वानुमान मॉडलों की कठोर तुलना और प्रगति को सुगम बनाया जा सके।

Madhurima Panja, Danny D'Agostino, Huitao Li, Tanujit Chakraborty, Nan Liu2026-05-13
🤖 AI

GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization

यह शोध पत्र ग्रीन-अवेयर राउटिंग (GAR) को प्रस्तुत करता है, जो एक निरंतर बहु-उद्देश्यीय अनुकूलन ढांचा है जो सटीकता और विलंबता सेवा-स्तर के उद्देश्यों का सख्ती से पालन करते हुए विषम मॉडलों (heterogeneous models) में अनुरोधों को गतिशील रूप से रूट करके LLM इन्फरेंस के लिए CO2 उत्सर्जन को कम करता है।

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta2026-05-13
📊 statistics

Exact Stiefel Optimization for Probabilistic PLS: Closed-Form Updates, Error Bounds, and Calibrated Uncertainty

यह शोध पत्र प्रोबेबिलिस्टिक पार्शियल लीस्ट स्क्वायर्स के लिए एक एंड-टू-एंड फ्रेमवर्क प्रस्तुत करता है जो नॉइज़-सबस्पेस एस्टीमेशन को सटीक स्टिफ़ल-मैनिफ़ोल्ड ऑप्टिमाइज़ेशन के साथ जोड़कर मौजूदा ऑप्टिमाइज़ेशन बाधाओं को दूर करता है, जिससे मिनिमैक्स-ऑप्टिमल कन्वर्जेंस, क्लोज्ड-फॉर्म अनसर्टेनिटी कैलिब्रेशन और मल्टी-ओमिक्स बेंचमार्क पर श्रेष्ठ प्रेडिक्टिव प्रदर्शन प्राप्त होता है।

Haoran Hu, Xingce Wang2026-05-13
🤖 AI

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

यह शोध पत्र बजट-कुशल सोच (BET) का परिचय देता है, जो एक दो-चरणीय ढांचा है जो बड़े रीजनिंग मॉडलों के टेस्ट-टाइम कंप्यूट को अनुकूलित करने के लिए अपेक्षित रिटर्न के आधार पर बजट को गतिशील रूप से आवंटित करना सीखकर, कथित कठिनाई के बजाय, अनुकूलित "शॉर्ट सॉल्व," "नाइस फोल्ड," और "हीरो कॉल" व्यवहारों के माध्यम से प्रदर्शन में सुधार करते हुए महत्वपूर्ण टोकन कमी प्राप्त करता है।

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin2026-05-13
🤖 AI

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes एक एडवरसेरियल सेल्फ-प्ले रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो एक एकल मॉडल को भ्रामक संदर्भ उत्पन्न करने और उनके भीतर समस्याओं को हल करने के लिए एक साथ प्रशिक्षित करके LLM रीजनिंग की मजबूती को बढ़ाता है, जिससे प्रासंगिक हस्तक्षेप को एक सह-विकासवादी पाठ्यक्रम में बदल दिया जाता है जो विभिन्न बेंचमार्क पर प्रदर्शन में सुधार करता है और अन्य मॉडलों की कमजोरियों को उजागर करता है।

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang2026-05-13