📊 statistics

Mirror Mean-Field Langevin Dynamics

यह शोध पत्र सीमित उत्तल डोमेन (constrained convex domains) पर प्रायिकता मापों (probability measures) को अनुकूलित करने के लिए मिरर मीन-फील्ड लैंग्विन डायनेमिक्स (MMFLD) का प्रस्ताव करता है, जो इसके विविक्त संस्करणों (discretized versions) के लिए रैखिक अभिसरण गारंटी (linear convergence guarantees) और समय-में-एकसमान अराजकता प्रसार (uniform-in-time propagation of chaos) परिणाम स्थापित करता है।

Anming Gu, Juno Kim2026-05-19
📊 statistics

Improving Random Forests by Smoothing

यह शोध पत्र एक कर्नेल-आधारित स्मूथिंग तंत्र का प्रस्ताव करता है जो इसके अनुकूलन विभाजन (adaptive partitioning) को स्थानीय नियमितता (local regularity) के साथ जोड़कर रैंडम फॉरेस्ट रिग्रेशन को बढ़ाता है, जिससे विशेष रूप से डेटा-दुर्लभ सेटिंग्स में भविष्य कहनेवाला प्रदर्शन में सुधार होता है।

Ziyi Liu, Phuc Luong, Mario Boley, Daniel F. Schmidt2026-05-19
📊 statistics

Nash: Neural Adaptive Shrinkage for Structured High-Dimensional Regression

यह शोध पत्र नैश (Nash) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो स्ट्रक्चर्ड हाई-डायमेंशनल रिग्रेशन में कोवेरिएट-विशिष्ट रेगुलेराइजेशन को अनुकूल रूप से मॉड्युलेट करने के लिए न्यूरल नेटवर्क का लाभ उठाता है, जिससे क्रॉस-वैलिडेशन की आवश्यकता के बिना मौजूदा विधियों की तुलना में महत्वपूर्ण कम्प्यूटेशनल गति और बेहतर सटीकता प्राप्त होती है।

William R. P. Denault2026-05-19
🤖 machine learning

RAP: Runtime Adaptive Pruning for LLM Inference

यह शोध पत्र RAP को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) द्वारा संचालित फ्रेमवर्क है जो बदलते मेमोरी बजट और वर्कलोड स्थितियों के तहत उपयोगिता को अधिकतम करने के लिए मॉडल वेट्स और KV-कैशे रिटेंशन को संयुक्त रूप से अनुकूलित करके, वास्तविक समय में LLM इन्फरेंस प्रूनिंग रणनीतियों को गतिशील रूप से अनुकूलित करता है।

Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li2026-05-19
🤖 machine learning

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

यह शोध पत्र SIPO को प्रस्तुत करता है, जो डिफ्यूजन मॉडल के लिए एक स्थिर और उन्नत प्राथमिकता अनुकूलन (preference optimization) ढांचा है, जो एक नवीन ग्रेडिएंट क्लिपिंग तंत्र और टाइमस्टेप-अवेयर इम्पॉर्टेंस रीवेटिंग के माध्यम से प्रशिक्षण अस्थिरता और ऑफ-पॉलिसी पूर्वाग्रह को संबोधित करता है, तथा इमेज और वीडियो जनरेशन कार्यों में बेहतर प्रदर्शन प्रदर्शित करता है।

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li2026-05-19
📊 statistics

Beyond RLHF: A Unified Theoretical Framework of Alignment

यह शोध पत्र LLM संरेखण (alignment) को युग्मवार प्राथमिकताओं (pairwise preferences) से वितरण शिक्षण (distribution learning) के रूप में पुनर्गठित करके एक एकीकृत सैद्धांतिक ढांचे का प्रस्ताव करता है, जो तीन सिद्धांतपूर्ण उद्देश्यों को व्युत्पन्न करता है जो मजबूत गैर-अनंतस्पर्शी अभिसरण गारंटी (non-asymptotic convergence guarantees) प्रदान करते हैं, RLHF के लिए एक कठोर औचित्य प्रदान करते हैं, और संभावना-आधारित दृष्टिकोणों की तुलना में ऑन-पॉलिसी विधियों की अनुभवजन्य श्रेष्ठता की व्याख्या करते हैं।

Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun2026-05-19
⚛️ lattice

Estimation of the reduced density matrix and entanglement entropies using autoregressive networks

यह शोध पत्र यह प्रदर्शित करता है कि ऑटोरेग्रेसिव न्यूरल नेटवर्क, शास्त्रीय द्वि-आयामी प्रणालियों के साथ अपने पत्राचार का लाभ उठाकर, क्वांटम स्पिन श्रृंखलाओं के लिए रिड्यूस्ड डेंसिटी मैट्रिसेस का कुशलतापूर्वक अनुमान लगाने और बाइपार्टाइट एंटैंगलमेंट एंट्रॉपी की निरंतरता सीमा (कंटीन्यूम लिमिट) की गणना करने में सक्षम हैं, जिसके लिए केवल एक निश्चित विविक्तीकरण (डिस्क्रीटाइजेशन) और आयतन के लिए एक एकल प्रशिक्षण सत्र की आवश्यकता होती है।

Piotr Białas, Piotr Korcyl, Tomasz Stebel, Dawid Zapolski2026-05-19
🔢 mathematics

Glocal Smoothness: Line search and adaptive step sizes can help in theory too!

यह शोध पत्र एक "ग्लोकल" (glocal) स्मूथनेस फ्रेमवर्क प्रस्तुत करता है जो ऑब्जेक्टिव फंक्शन्स के वैश्विक और स्थानीय गुणों को अभिलक्षित करता है ताकि इटरेशन-स्वतंत्र अभिसरण सीमाएं (convergence bounds) स्थापित की जा सकें, यह प्रदर्शित करते हुए कि लाइन सर्च और एडेप्टिव स्टेप साइज, इटरेशन कॉम्प्लेक्सिटी के संदर्भ में, त्वरित एल्गोरिदम सहित फिक्स्ड-स्टेप विधियों से सैद्धांतिक रूप से बेहतर प्रदर्शन कर सकते हैं।

Curtis Fox, Aaron Mishkin, Sharan Vaswani, Mark Schmidt2026-05-19
🤖 machine learning

Memory-Efficient Differentially Private Training with Gradient Random Projection

यह शोध पत्र DP-GRAPE को प्रस्तुत करता है, जो एक मेमोरी-कुशल डिफरेंशियल प्राइवेट प्रशिक्षण विधि है जो मेमोरी उपयोग को 63% से अधिक कम करने के लिए महंगी SVD-आधारित प्रोजेक्शन को रैंडम गॉसियन प्रोजेक्शन से बदल देती है, जिससे प्रतिस्पर्धी सटीकता बनी रहती है और बड़े मॉडलों का प्रशिक्षण सक्षम होता है जो मानक DP-Adam के साथ अव्यवहार्य है।

Alex Mulrooney, Devansh Gupta, James Flemings, Huanyu Zhang, Murali Annavaram, Meisam Razaviyayn, Xinwei Zhang2026-05-19
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

यह शोध पत्र OSWorld-Human प्रस्तुत करता है, जो एक मैन्युअल रूप से एनोटेट किया गया बेंचमार्क है जो यह प्रकट करता है कि वर्तमान कंप्यूटर-उपयोग एजेंट अत्यधिक विलंबता (latency) और अक्षमता से ग्रस्त हैं, जिसका मुख्य कारण योजना बनाने और चिंतन (reflection) के लिए अत्यधिक मॉडल कॉल्स हैं, जिसके परिणामस्वरूप उन्हें कार्य पूरा करने में मनुष्यों की तुलना में 2.7 से 4.3 गुना अधिक कदम उठाने पड़ते हैं।

Reyna Abhyankar, Qi Qi, Yiying Zhang2026-05-19