🤖 machine learning

On the Nonlinearity of Learning Rate Scaling for LLM Training

यह शोध पत्र LLM प्रशिक्षण में लॉग-लीनियर लर्निंग रेट स्केलिंग की धारणा को चुनौती देता है, यह प्रदर्शित करते हुए कि इष्टतम लर्निंग रेट बड़े पैमानों पर ऊपर की ओर वक्रता (upward curvature) प्रदर्शित करते हैं, एक ऐसी गैर-रैखिकता जिसे प्रभावी लर्निंग रेट और डेटा-आधारित एक्सट्रपलेशन का उपयोग करके हल किया जाता है, जिससे अधिक सटीक और लागत-कुशल ट्रांसफर लर्निंग सक्षम होती है।

Zaiwen Yang, Huaqing Zhang, Jing Xu, Jingzhao Zhang2026-06-30
🤖 machine learning

Invariant Reasoning Directions in Latent Trajectories of Language Models

यह शोध पत्र ट्रजेक्टरी-इनवेरिएंट लेटेंट रिफाइनमेंट (TILR) प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो सटीकता से समझौता किए बिना तर्क की निरंतरता में सुधार करने और पैराफ्रेसिंग एवं व्यवधानों के प्रति संवेदनशीलता को कम करने के लिए भाषा मॉडल के लेटेंट ट्रजेक्टरीज के भीतर स्थिर, लो-रैंक इनवेरिएंट दिशाओं की पहचान और हेरफेर करता है।

Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut, Yash Ravindra Charde, Vivek Gupta, Yanjie Fu2026-06-30✓ Author reviewed
🤖 machine learning

Symbolic Mechanistic Data Attribution: Tracing Training Influence to Learned Behavioral Policies

यह शोध पत्र सिम्बॉलिक मैकेनिस्टिक डेटा एट्रिब्यूशन (SMDA) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मैकेनिस्टिक इंटरप्रिटेबिलिटी और डेटा एट्रिब्यूशन के बीच सेतु बनाता है, जिससे विश्लेषणात्मक रूप से यह विघटित किया जा सके कि विशिष्ट प्रशिक्षण उदाहरण उच्च-स्तरीय सिम्बॉलिक व्यवहार संबंधी नीतियों को कैसे आकार देते हैं, जिससे बड़े भाषा मॉडलों में व्यवस्थित सुरक्षा अंतराल और फीचर-स्तर के हस्तक्षेप का अनावरण होता है।

Reza Habibi, Darian Lee, Magy Seif El-Nasr2026-06-30
🤖 machine learning

Dead-Direction Conditioners: Gauge-Equivariant Preconditioning for Deep Networks

यह शोध पत्र डेड-डायरेक्शन कंडीशनर्स (DDC) को प्रस्तुत करता है, जो एक गेज-इक्विवेरिएंट प्रीकंडीशनिंग फ्रेमवर्क है जो ऑप्टिमाइज़र प्रक्षेप पथों (trajectories) को डीप नेटवर्क पैरामीटर स्पेस के सिमेट्री कोशेंट (symmetry quotient) के साथ संरेखित करता है, जिससे अनुकूलन बहाव (optimization drift) को रोका जा सके, सामान्यीकरण (generalization) में सुधार किया जा सके और AdamW एवं Muon जैसे मानक तरीकों की तुलना में गहरे मिनिमा की खोज को सक्षम बनाया जा सके।

Tejas Pradeep Shirodkar2026-06-30
💬 NLP

Evidence-Informed LLM Beliefs for Continual Scientific Discovery

यह शोध पत्र एलएलएम (LLM) के साथ निरंतर वैज्ञानिक खोज के लिए एक साक्ष्य-आधारित ढांचे को प्रस्तुत करता है जो स्थिर बेयसियन सरप्राइज (Bayesian surprise) को गैर-स्थिर, विश्वास-अपडेटेड सरप्राइज़ल (belief-updated surprisal) से प्रतिस्थापित करता है और स्पूरियस रिवॉर्ड्स (spurious rewards) को समाप्त करने के लिए फ़िल्टरिंग और विविधता अधिकतमकरण का उपयोग करता है, जिससे कई डोमेन में परिकल्पना अन्वेषण में महत्वपूर्ण सुधार होता है।

Dhruv Agarwal, Reece Adamson, Andrew McCallum, Peter Clark, Ashish Sabharwal, Bodhisattwa Prasad Majumder2026-06-30✓ Author reviewed
🤖 machine learning

Bayesian Best-Arm Identification with Abstention: A Polynomial-to-Exponential Phase Transition

यह शोध पत्र प्रदर्शित करता है कि बेयसियन फिक्स्ड-बजट बेस्ट-आर्म आइडेंटिफिकेशन समस्या में, एक कम बजट के तहत शिक्षार्थी को सिफारिश करने से बचने की अनुमति देने से एक मौलिक चरण संक्रमण (फेज ट्रांजिशन) उत्पन्न होता है जहाँ अन détected त्रुटि की संभावना बहुपद (पॉलीनोमियल) से चरघातांकीय (एक्सपोनेंशियल) क्षय में बदल जाती है, जो कि निकट-तुल्य भुजाओं (नियर-टाइड आर्म्स) के प्रायर घनत्व द्वारा संचालित है और प्रस्तावित PGWS एल्गोरिदम के माध्यम से प्राप्त किया जा सकता है।

Yuqi Huang, Yunlong Hou, Vincent Y. F. Tan2026-06-30
🤖 machine learning

Multi-Block Diffusion Language Models

यह शोध पत्र मल्टी-ब्लॉक डिफ्यूजन लैंग्वेज मॉडल्स (MBD-LMs) को प्रस्तुत करता है, जो एक नवीन मल्टी-ब्लॉक टीचर फोर्सिंग रणनीति और एक अनुकूलित ब्लॉक बफ़र डिकोडिंग एल्गोरिदम के माध्यम से डिफ्यूजन-आधारित टेक्स्ट जनरेशन में ट्रेनिंग-इन्फरेंस अंतराल को पाटते हुए, जनरेशन की गति (टोकन्स पर फॉरवर्ड पास) और सटीकता दोनों में महत्वपूर्ण लाभ प्राप्त करते हैं।

Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng2026-06-30
🤖 machine learning

A Linear Matching Bandit Approach to Online Multi-Human Multi-Robot Teaming

यह शोध पत्र LinMatch प्रस्तुत करता है, जो मल्टी-ह्यूमन मल्टी-रोबोट टीमिंग के लिए एक ऑनलाइन लर्निंग एल्गोरिदम है, जो असाइनमेंट समस्या को लीनियर मैचिंग बैंडिट के रूप में स्वरूपित करता है, हंगेरियन एल्गोरिदम के माध्यम से मैक्सिमम वेटेड मैचिंग को हल करके Θ~(dMKT)\tilde{\Theta}(d\sqrt{MKT}) के स्ट्रिक्टली ऑप्टिमल रिग्रेट बाउंड्स प्राप्त करता है, और हाउसिंग एलोकेशन और रिकमेंडेशन सिस्टम जैसे व्यापक अनुप्रयोगों तक विस्तारित होता है।

Yaohui Guo, X. Jessie Yang, Cong Shi2026-06-30
🤖 machine learning

Depth Exploration for LLM Decoding

यह शोध पत्र डेप्थ एक्सप्लोरेशन डिकोडिंग (DEX) का प्रस्ताव करता है, जो एक लॉसलेस एल्गोरिदम है जो एकल-डेप्थ चयन के स्थान पर कई संभावित डेप्थ्स के समानांतर अन्वेषण (पैरेलल एक्सप्लोरेशन) को अपनाकर LLM इन्फरेंस दक्षता में सुधार करता है, जिससे कम्प्यूटेशनल बर्बादी कम होती है और यह मौजूदा डेप्थ-एडेप्टिव और स्पेकुलेटिव डिकोडिंग विधियों से बेहतर प्रदर्शन करता है।

Weisi Yang, Zipeng Sun, Stephen Xia2026-06-30
🤖 machine learning

Towards Evaluating Data Priors for Tabular Foundation Models

यह शोध पत्र विभिन्न प्रायों (priors) से व्युत्पन्न कार्यों पर समान आर्किटेक्चर को प्रशिक्षित करके टैबुलर फाउंडेशन मॉडल्स के लिए डेटा-जनरेटिंग प्रायों का स्वतंत्र रूप से मूल्यांकन और तुलना करने हेतु एक एकीकृत ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि विभिन्न प्राय केवल डेटा-स्तर की समानता से परे डाउनस्ट्रीम प्रदर्शन और निरंतरता को महत्वपूर्ण रूप से प्रभावित करते हैं।

Zeynep Türkmen, Kürşat Kaya, Alexander Pfefferle, Frank Hutter2026-06-30✓ Author reviewed