🤖 machine learning

BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models

यह शोधपत्र बिट-प्लेन डिकंपोजिशन क्वांटाइजेशन (BPDQ) का प्रस्ताव करता है, जो एक नवीन विधि है जो अत्यंत कम बिट-चौड़ाई (2-3 बिट्स) पर बड़े भाषा मॉडलों की सटीकता में उल्लेखनीय सुधार करने के लिए परिवर्तनीय क्वांटाइजेशन ग्रिड और द्वितीय-क्रम अनुकूलन (second-order optimization) का उपयोग करती है, जिससे एक एकल उपभोक्ता GPU पर 72B मॉडल का कुशल परिनियोजन सक्षम होता है।

Junyu Chen, Jungang Li, Jing Xiong, Wenjie Wang, Qingyao Yang, He Xiao, Zhen Li, Taiqiang Wu, Mengzhao Chen, Zhen Peng (…)2026-05-18
🤖 machine learning

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

यह शोध पत्र ज्योमेट्रिक एंकर प्रिफरेंस ऑप्टिमाइज़ेशन (GAPO) का प्रस्ताव करता है, जो एक नवीन संरेखण विधि है जो डायरेक्ट प्रिफरेंस ऑप्टिमाइज़ेशन में स्थिर संदर्भ नीति (static reference policy) को एक गतिशील, ज्यामिति-जागरूक प्रतिकूल एंकर (dynamic, geometry-aware adversarial anchor) से बदल देती है ताकि प्राथमिकता युग्मों को अनुकूल रूप से पुन: भारित (reweight) किया जा सके, जिससे मानक बेंचमार्क पर मजबूत प्रदर्शन बनाए रखते हुए शोर युक्त पर्यवेक्षण और वितरण बेमेल (distributional mismatch) के विरुद्ध सुदृढ़ता बढ़ाई जा सके।

Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim2026-05-18
🔢 mathematics

RanSOM: Second-Order Momentum with Randomized Scaling for Constrained and Unconstrained Optimization

यह शोधपत्र RanSOM का प्रस्ताव करता है, जो एक एकीकृत अनुकूलन ढांचा (unified optimization framework) है जो रैंडमाइज्ड स्टेप साइज़ और स्टाइन-टाइप आइडेंटिटीज़ का उपयोग करके मोमेंटम विधियों में कर्वेचर-प्रेरित पूर्वाग्रह (curvature-induced bias) को समाप्त करता है ताकि बिना किसी महंगे सहायक सैंपलिंग की आवश्यकता के, बाधित (constrained) और अबाधित (unconstrained) दोनों समस्याओं के लिए इष्टतम अभिसरण दर (optimal convergence rates) प्राप्त की जा सके।

El Mahdi Chayti2026-05-18
🤖 machine learning

Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression

यह शोध पत्र Extra-CoT को प्रस्तुत करता है, जो एक नवीन ढांचा है जो न्यूनतम सटीकता हानि के साथ अत्यधिक चेन-ऑफ-थॉट संपीड़न प्राप्त करता है, जिसमें एक अर्थ-संरक्षित संकुचक (semantically-preserved compressor), मिश्रित-अनुपात सुपरवाइज्ड फाइन-ट्यूनिंग, और एक कंस्ट्रेंड एंड हिरार्किकल रेशियो पॉलिसी ऑप्टिमाइज़ेशन (CHRPO) रणनीति का संयोजन किया गया है ताकि लार्ज लैंग्वेज मॉडल्स में कुशल, उच्च-निष्ठा वाले तर्क (high-fidelity reasoning) को सक्षम बनाया जा सके।

Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Sha (…)2026-05-18
🤖 machine learning

Laplacian Heads Improve Transformers by Smoothing Token Representations

यह शोध पत्र ग्राफ डिफ्यूजन के माध्यम से नियंत्रित स्मूथिंग (smoothing) पेश करने के लिए ट्रांसफॉर्मर्स में मानक अटेंशन हेड्स के एक उपसमूह को लैपलेसियन हेड्स (Laplacian heads) से बदलने का प्रस्ताव देता है, जो टोकन रिप्रजेंटेशन ज्योमेट्री को बेहतर बनाकर सुपरवाइज्ड, लैंग्वेज मॉडलिंग और सेल्फ-सुपरवाइज्ड कार्यों में प्रदर्शन में सुधार प्रदर्शित करता है और इस धारणा को चुनौती देता है कि ओवरस्मूथिंग (oversmoothing) स्वाभाविक रूप से हानिकारक है।

Yuchong Zhang, Vardan Papyan2026-05-18
⚡ electrical engineering

A Gradient Boosted Mixed-Model Machine Learning Framework for Vessel Speed in the U.S. Arctic

यह अध्ययन अमेरिकी आर्कटिक AIS डेटा पर एक टू-स्टेज ग्रेडिएंट बूस्टेड मिक्स्ड-मॉडल फ्रेमवर्क का उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि तट से दूरी और बाथमेट्रिक गहराई जहाज की गति के प्राथमिक चालक हैं, जबकि नेविगेशनल व्यवस्थाओं को चित्रित करने के लिए स्थिर और गतिशील जहाजों के बीच प्रभावी ढंग से अंतर किया गया है।

Mauli Pant, Linda Fernandez, Indranil Sahoo2026-05-18
🤖 machine learning

Algorithmic Simplification of Neural Networks with Mosaic-of-Motifs

यह शोध पत्र "मोज़ेक-ऑफ़-मोटिफ्स" (MoMos) का प्रस्ताव करता है, जो एक नियंत्रित पैरामीट्रिज़ेशन विधि है जो भार (weights) को पुन: प्रयोज्य ब्लॉकों में व्यवस्थित करके न्यूरल नेटवर्क की एल्गोरिद्मिक जटिलता को कम करती है, जिससे मॉडल के प्रदर्शन को बनाए रखते हुए प्रशिक्षण के दौरान संपीड़ितता (compressibility) प्रेरित होती है।

Pedram Bakhtiarifard, Tong Chen, Jonathan Wenshøj, Erik B Dam, Raghavendra Selvan2026-05-18
📊 statistics

Regret and Sample Complexity of Online Q-Learning via Concentration of Stochastic Approximation with Time-Inhomogeneous Markov Chains

यह शोध पत्र बिना आशावाद (optimism) के अनंत-क्षितिज (infinite-horizon) डिस्काउंटेड MDPs में शास्त्रीय ऑनलाइन Q-लर्निंग के लिए प्रथम रिग्रेट और सैंपल कॉम्प्लेक्सिटी बाउंड्स स्थापित करता है, यह प्रदर्शित करते हुए कि जहाँ बोल्ट्ज़मैन एक्सप्लोरेशन का प्रदर्शन महत्वपूर्ण रूप से उप-इष्टतम अंतराल (suboptimality gaps) पर निर्भर करता है, वहीं एक प्रस्तावित स्मूद्ड ϵn\epsilon_n-ग्रीडी योजना, समय-असंगत स्टोकेस्टिक एप्रोक्सिमेशन (time-inhomogeneous stochastic approximation) के लिए एक नवीन उच्च-संभाव्यता एकाग्रता बाउंड (high-probability concentration bound) का लाभ उठाकर, निकट-इष्टतम और गैप-रोबस्ट गारंटी प्राप्त करती है।

Rahul Singh, Siddharth Chandak, Eric Moulines, Vivek S. Borkar, Nicholas Bambos2026-05-18
🤖 machine learning

Improved Bounds for Reward-Agnostic and Reward-Free Exploration

यह शोध पत्र एक नवीन एल्गोरिदम प्रस्तावित करता है जो एपिसोडिक MDPs में रिवॉर्ड-अग्नोस्टिक एक्सप्लोरेशन (reward-agnostic exploration) पर सटीकता संबंधी बाधाओं को महत्वपूर्ण रूप से शिथिल करता है और रिवॉर्ड-फ्री एक्सप्लोरेशन (reward-free exploration) के लिए एक सटीक निचली सीमा (tight lower bound) स्थापित करता है, जिससे ज्ञात ऊपरी और निचली सीमाओं के बीच के अंतर को समाप्त किया जा सके।

Oran Ridel, Alon Cohen2026-05-18
🤖 machine learning

Multi-Probe Zero Collision Hash (MPZCH): Mitigating Embedding Collisions and Enhancing Model Freshness in Large-Scale Recommenders

यह शोध पत्र मल्टी-प्रोब ज़ीरो कोलिजन हैश (MPZCH) प्रस्तुत करता है, जो एक नवीन इंडेक्सिंग तंत्र है जो बड़े पैमाने के रिकमेंडेशन सिस्टम में प्रोडक्शन-स्केल दक्षता बनाए रखते हुए एम्बेडिंग कोलिजन को समाप्त करने और फीचर फ्रेशनेस सुनिश्चित करने के लिए लीनियर प्रोबिंग, ऑक्सिलरी टेंसर और CUDA कर्नेल का लाभ उठाता है।

Ziliang Zhao, Bi Xue, Emma Lin, Tianqi Lu, Mengjiao Zhou, Kaustubh Vartak, Shakhzod Ali-Zade, Tao Li, Bin Kuang, Rui Jia (…)2026-05-18