🤖 AI

Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

यह शोध पत्र प्रकट करता है कि रीजनिंग मॉडल्स का लो-बिट क्वांटाइजेशन, सटीकता को बनाए रखते हुए भी, अक्सर मध्यवर्ती चरणों और पुनरावृत्ति के माध्यम से चेन्स ऑफ थॉट (chains of thought) की लंबाई बढ़ाकर एक छिपी हुई लागत उत्पन्न करता है, जिससे अपेक्षित इन्फरेंस स्पीडअप (inference speedup) निष्प्रभावी हो जाता है और सटीकता मेट्रिक्स के साथ टोकन उपयोग की रिपोर्ट करना आवश्यक हो जाता है।

Xinyu Lian, Walid Krichene, Beichen Huang, Masahiro Tanaka, Olatunji Ruwase, Li Zhang, Minjia Zhang2026-06-25
🤖 machine learning

Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

यह शोध पत्र तर्क देता है कि ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) के क्षेत्र को सार्वभौमिक समाधानों की खोज से हटकर एक निदान-संचालित दृष्टिकोण की ओर बढ़ना चाहिए जो तैनाती-विशिष्ट साक्ष्यों के आधार पर ऑनलाइन शिक्षण और विविध ऑफलाइन पूर्वग्रहों (priors) के बीच तनाव को गतिशील रूप से प्रबंधित करता है, क्योंकि इन पूर्वग्रहों की वैधता विभिन्न संदर्भों और प्रशिक्षण चरणों में भिन्न होती है।

Guozheng Ma, Lu Li, Zilin Wang, Pierre-Luc Bacon, Dacheng Tao2026-06-25
💬 NLP

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE एक ड्रॉप-इन एडवांटेज एस्टिमेटर पेश करता है जो लॉन्ग-होरिज़न LLM एजेंटों को प्रशिक्षित करने के लिए पॉलिसी-इंड्यूस्ड बिसिमिल्यूशन (policy-induced bisimulation) के माध्यम से स्टेप्स को क्लस्टर करके और एक्शन-कंडीशन्ड काउंटरफैक्चुअल बेसलाइन (action-conditioned counterfactual baselines) लागू करके ग्रुप-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में स्टेट-एक्शन क्रेडिट मिसमैच को हल करता है, जिससे बिना किसी सीखे गए क्रिटिक या अतिरिक्त रोलआउट्स के GiGPO जैसी मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao2026-06-25
📊 statistics

Statistically Valid Hyperparameter Selection: From Tuning to Guarantees

यह शोध प्रबंध 'लर्न-देन-टेस्ट' प्रतिमान (paradigm) पर आधारित एक एकीकृत सांख्यिकीय ढांचे को प्रस्तुत करता है जो अनुप्रयोग-विशिष्ट विश्वसनीयता आवश्यकताओं को पूरा करने के लिए प्रमाण योग्य, परिमित-नमूना गारंटी (finite-sample guarantees) के साथ हाइपरपैरामीटरों के चयन को सक्षम बनाता है, जो पारंपरिक अनुभवजन्य ट्यूनिंग विधियों में औपचारिक सुरक्षा आश्वासन की कमी को संबोधित करता है।

Amirmohammad Farzaneh, Osvaldo Simeone2026-06-25
🤖 machine learning

TL++: Accuracy and Privacy Preserving Traversal Learning for Distributed Intelligent Systems

TL++ एक नवीन टू-मोड ट्रैवर्सल-लर्निंग फ्रेमवर्क है जो वितरित इंटेलिजेंट सिस्टम्स के लिए है, जो कट-लेयर एक्टिवेशन्स और ग्रेडिएंट्स की सीक्रेट-शेयरिंग के माध्यम से कम्युनिकेशन एफिशिएंसी और प्राइवेसी को संतुलित करते हुए वर्चुअल बैच कंस्ट्रक्शन के जरिए सेंट्रलाइज्ड मिनी-बैच ग्रेडिएंट व्यवहार को रिकवर करता है।

Erdenebileg Batbaatar, Young Yoon2026-06-25
🤖 machine learning

Learning Subset-Shared Invariances for Domain Generalization with Mixture-of-Experts

यह शोध पत्र एक डोमेन जनरलाइजेशन फ्रेमवर्क प्रस्तावित करता है जो वैश्विक अपरिवर्तनीयता (global invariance) की प्रतिबंधात्मक धारणा को एक 'मिक्सचर-ऑफ-एक्सपर्ट्स' आर्किटेक्चर के माध्यम से "सबसेट-शेयर्ड इनवेरिएंस" (subset-shared invariance) से प्रतिस्थापित करता है, जिससे सभी डोमेन के बजाय केवल विशिष्ट डोमेन सबसेट्स के भीतर स्थिर रहने वाली प्रेडिक्टिव संरचनाओं को मॉडल करके अनदेखे लक्ष्यों (unseen targets) के लिए सामान्यीकरण में सुधार किया जाता है।

Tien-Hung Nguyen, Tien-Dat Tran, M. -Duong Nguyen, Kok-Seng Wong2026-06-25
🤖 machine learning

Black-Box Assisted Regression: Phase Transitions and Minimax Optimality

यह शोधपत्र ब्लैक-बॉक्स असिस्टेड नॉनपैरामेट्रिक रिग्रेशन का एक फाइनाइट-सैंपल मिनिमैक्स कैरेक्टराइजेशन स्थापित करता है, जो इष्टतम जोखिम (ऑप्टिमल रिस्क) में एक फेज ट्रांजिशन को प्रकट करता है और एक "सेफ रेसिडुअल एस्टिमेटर" प्रस्तावित करता है जो एक निश्चित प्रेडिक्टर को अनुकूल रूप से सुधारता है जबकि केवल ब्लैक-बॉक्स की तुलना में प्रदर्शन में किसी भी गिरावट की गारंटी देता है।

Yan Zhou2026-06-25
📊 statistics

Gaussian Mean Field Variational Inference can Overestimate Predictive Variance

यह शोध पत्र इस पारंपरिक धारणा को चुनौती देता है कि मीन फील्ड वेरिएशनल इन्फरेंस (Mean Field Variational Inference) हमेशा अनिश्चितता को कम करके आंकता है, यह प्रदर्शित करते हुए कि बेयसियन लीनियर रिग्रेशन (Bayesian Linear Regression) में, यह इन-डिस्ट्रीब्यूशन डेटा पर प्रिडिक्टिव वेरिएंस (predictive variance) को वास्तव में बढ़ाकर दिखा सकता है क्योंकि यह एक ऐसे ट्रेड-ऑफ के कारण होता है जहाँ कुछ पैरामीटर दिशाओं में कम आकलन करने के लिए अन्य दिशाओं में अधिक आकलन करना आवश्यक हो जाता है, एक ऐसी घटना जिसे टेम्परेचर स्केलिंग (temperature scaling) के माध्यम से कम किया जा सकता है।

James Odgers, Ben Riegler, Siddharth Swaroop, Vincent Fortuin2026-06-25
💬 NLP

RAS: Measuring LLM Safety Through Refusal Alignment

यह शोध पत्र **RAS (रिफ्यूज़ल अलाइनमेंट स्कोर)** को प्रस्तुत करता है, जो एक तेज़ और सुदृढ़ व्हाइट-बॉक्स मूल्यांकन मीट्रिक है जो सीखे गए रिफ़्यूज़ल दिशाओं (refusal directions) के साथ आंतरिक हिडन स्टेट्स के संरेखण का विश्लेषण करके LLM सुरक्षा को मापता है, जो पारंपरिक आउटपुट-आधारित जज मूल्यांकनों के लिए एक अधिक कुशल और स्थिर विकल्प प्रदान करता है।

Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee2026-06-25
🔬 optics

Gradient-based inverse lithography for EUV masks via the waveguide method and a physics-informed neural operator

यह शोध पत्र EUV मास्क के लिए एक ग्रेडिएंट-आधारित इनवर्स लिथोग्राफी फ्रेमवर्क प्रस्तुत करता है जो अनुकूलतम एब्जॉर्बर परमिटिविटी (permittivity) को स्वचालित रूप से रिकवर करने के लिए डिफरेंशिएबल वेवगाइड विधियों और वेवगाइड न्यूरल ऑपरेटर्स को एंड-टू-एंड फिजिक्स इंजन के रूप में एकीकृत करता है, जो सफलतापूर्वक ऐसे मास्क स्ट्रक्चर उत्पन्न करता है जो 11.2 nm पर यथार्थवादी 2D और 3D सामग्रियों के लिए वांछित वेफर फील्ड्स प्राप्त करते हैं।

Vasiliy A. Es'kin, Egor V. Ivanov2026-06-25