🤖 machine learning

RAP: Runtime Adaptive Pruning for LLM Inference

यह शोध पत्र RAP को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) द्वारा संचालित फ्रेमवर्क है जो बदलते मेमोरी बजट और वर्कलोड स्थितियों के तहत उपयोगिता को अधिकतम करने के लिए मॉडल वेट्स और KV-कैशे रिटेंशन को संयुक्त रूप से अनुकूलित करके, वास्तविक समय में LLM इन्फरेंस प्रूनिंग रणनीतियों को गतिशील रूप से अनुकूलित करता है।

Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li2026-05-19
🤖 machine learning

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

यह शोध पत्र SIPO को प्रस्तुत करता है, जो डिफ्यूजन मॉडल के लिए एक स्थिर और उन्नत प्राथमिकता अनुकूलन (preference optimization) ढांचा है, जो एक नवीन ग्रेडिएंट क्लिपिंग तंत्र और टाइमस्टेप-अवेयर इम्पॉर्टेंस रीवेटिंग के माध्यम से प्रशिक्षण अस्थिरता और ऑफ-पॉलिसी पूर्वाग्रह को संबोधित करता है, तथा इमेज और वीडियो जनरेशन कार्यों में बेहतर प्रदर्शन प्रदर्शित करता है।

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li2026-05-19
📊 statistics

Beyond RLHF: A Unified Theoretical Framework of Alignment

यह शोध पत्र LLM संरेखण (alignment) को युग्मवार प्राथमिकताओं (pairwise preferences) से वितरण शिक्षण (distribution learning) के रूप में पुनर्गठित करके एक एकीकृत सैद्धांतिक ढांचे का प्रस्ताव करता है, जो तीन सिद्धांतपूर्ण उद्देश्यों को व्युत्पन्न करता है जो मजबूत गैर-अनंतस्पर्शी अभिसरण गारंटी (non-asymptotic convergence guarantees) प्रदान करते हैं, RLHF के लिए एक कठोर औचित्य प्रदान करते हैं, और संभावना-आधारित दृष्टिकोणों की तुलना में ऑन-पॉलिसी विधियों की अनुभवजन्य श्रेष्ठता की व्याख्या करते हैं।

Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun2026-05-19
⚛️ lattice

Estimation of the reduced density matrix and entanglement entropies using autoregressive networks

यह शोध पत्र यह प्रदर्शित करता है कि ऑटोरेग्रेसिव न्यूरल नेटवर्क, शास्त्रीय द्वि-आयामी प्रणालियों के साथ अपने पत्राचार का लाभ उठाकर, क्वांटम स्पिन श्रृंखलाओं के लिए रिड्यूस्ड डेंसिटी मैट्रिसेस का कुशलतापूर्वक अनुमान लगाने और बाइपार्टाइट एंटैंगलमेंट एंट्रॉपी की निरंतरता सीमा (कंटीन्यूम लिमिट) की गणना करने में सक्षम हैं, जिसके लिए केवल एक निश्चित विविक्तीकरण (डिस्क्रीटाइजेशन) और आयतन के लिए एक एकल प्रशिक्षण सत्र की आवश्यकता होती है।

Piotr Białas, Piotr Korcyl, Tomasz Stebel, Dawid Zapolski2026-05-19
🔢 mathematics

Glocal Smoothness: Line search and adaptive step sizes can help in theory too!

यह शोध पत्र एक "ग्लोकल" (glocal) स्मूथनेस फ्रेमवर्क प्रस्तुत करता है जो ऑब्जेक्टिव फंक्शन्स के वैश्विक और स्थानीय गुणों को अभिलक्षित करता है ताकि इटरेशन-स्वतंत्र अभिसरण सीमाएं (convergence bounds) स्थापित की जा सकें, यह प्रदर्शित करते हुए कि लाइन सर्च और एडेप्टिव स्टेप साइज, इटरेशन कॉम्प्लेक्सिटी के संदर्भ में, त्वरित एल्गोरिदम सहित फिक्स्ड-स्टेप विधियों से सैद्धांतिक रूप से बेहतर प्रदर्शन कर सकते हैं।

Curtis Fox, Aaron Mishkin, Sharan Vaswani, Mark Schmidt2026-05-19
🤖 machine learning

Memory-Efficient Differentially Private Training with Gradient Random Projection

यह शोध पत्र DP-GRAPE को प्रस्तुत करता है, जो एक मेमोरी-कुशल डिफरेंशियल प्राइवेट प्रशिक्षण विधि है जो मेमोरी उपयोग को 63% से अधिक कम करने के लिए महंगी SVD-आधारित प्रोजेक्शन को रैंडम गॉसियन प्रोजेक्शन से बदल देती है, जिससे प्रतिस्पर्धी सटीकता बनी रहती है और बड़े मॉडलों का प्रशिक्षण सक्षम होता है जो मानक DP-Adam के साथ अव्यवहार्य है।

Alex Mulrooney, Devansh Gupta, James Flemings, Huanyu Zhang, Murali Annavaram, Meisam Razaviyayn, Xinwei Zhang2026-05-19
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

यह शोध पत्र OSWorld-Human प्रस्तुत करता है, जो एक मैन्युअल रूप से एनोटेट किया गया बेंचमार्क है जो यह प्रकट करता है कि वर्तमान कंप्यूटर-उपयोग एजेंट अत्यधिक विलंबता (latency) और अक्षमता से ग्रस्त हैं, जिसका मुख्य कारण योजना बनाने और चिंतन (reflection) के लिए अत्यधिक मॉडल कॉल्स हैं, जिसके परिणामस्वरूप उन्हें कार्य पूरा करने में मनुष्यों की तुलना में 2.7 से 4.3 गुना अधिक कदम उठाने पड़ते हैं।

Reyna Abhyankar, Qi Qi, Yiying Zhang2026-05-19
🤖 machine learning

CooT: Learning to Coordinate In-Context with Coordination Transformers

CooT एक नवीन ढांचा है जो इन-कॉन्टेक्स्ट लर्निंग का लाभ उठाकर मल्टी-एजेंट सिस्टम को बिना पैरामीटर अपडेट के अपरिचित पार्टनर्स के प्रति तेजी से और मजबूती से अनुकूलित होने में सक्षम बनाता है, जो ओवरकुक्ड (Overcooked) और गूगल रिसर्च फुटबॉल (Google Research Football) जैसे बेंचमार्क पर मौजूदा पॉपुलेशन-आधारित, फाइन-ट्यूनिंग और मेटा-आरएल (Meta-RL) दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Huai-Chih Wang, Hsiang-Chun Chuang, Hsi-Chun Cheng, Dai-Jie Wu, Shao-Hua Sun2026-05-19
💬 NLP

LLM Agents Are the Antidote to Walled Gardens

यह शोध पत्र यह तर्क देता है कि एलएलएम-आधारित एजेंट (LLM-based agents), एआई-मध्यस्थ एडेप्टर (AI-mediated adapters) के माध्यम से "सार्वभौमिक अंतर-संचालनीयता" (universal interoperability) को सक्षम करके 'वॉल्ड गार्डन्स' (walled gardens) के प्रभुत्व को समाप्त कर सकते हैं, जो क्रॉस-प्लेटफ़ॉर्म डेटा विनिमय की लागत को नाटकीय रूप से कम करते हैं, जिससे उपयोगकर्ता की स्वतंत्रता और बाजार प्रतिस्पर्धा बहाल होती है, जबकि इससे जुड़े सुरक्षा और कानूनी जोखिमों को संबोधित करने के लिए नए ढांचे की आवश्यकता भी होती है।

Samuele Marro, Philip Torr2026-05-19
🤖 machine learning

Geometry-aware 4D Video Generation for Robot Manipulation

यह शोध पत्र एक ज्यामिति-जागरूक (geometry-aware) 4D वीडियो जनरेशन मॉडल प्रस्तुत करता है जो नए दृष्टिकोणों (novel viewpoints) से भविष्य के वीडियो अनुक्रमों को टेम्पोरल रूप से सुसंगत और स्थानिक रूप से संरेखित बनाने के लिए क्रॉस-व्यू पॉइंटमैप संरेखण के माध्यम से मल्टी-व्यू 3D निरंतरता लागू करता है, जिससे विभिन्न कैमरा परिप्रेक्ष्यों में सामान्यीकरण करने वाली मजबूत रोबोट मैनिपुलेशन नीतियों को सक्षम बनाया जा सके।

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song2026-05-19