📊 statistics

An Interpretable and Scalable Framework for Evaluating Large Language Models

यह शोध पत्र पारंपरिक आइटम रिस्पॉन्स थ्योरी (Item Response Theory) विधियों की कम्प्यूटेशनल और स्थिरता संबंधी सीमाओं को दूर करने के लिए मेजराइजेशन-मिनिमाइजेशन (majorization-minimization) सिद्धांत पर आधारित एक स्केलेबल और व्याख्या योग्य ढांचे का प्रस्ताव करता है, जो विविध बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स के कुशल और सटीक मूल्यांकन को सक्षम बनाता है।

Xinhao Qu, Qiang Heng, Hao Zeng, Xiaoqian Liu2026-05-11
🤖 machine learning

Unlocking High-Fidelity Molecular Generation from Mass Spectra via Dual-Stream Line Graph Diffusion

यह शोध पत्र DualLGD को प्रस्तुत करता है, जो एक डुअल-स्ट्रीम लाइन ग्राफ डिफ्यूजन मॉडल है जो इंसिडेंस-कंस्ट्रेंड क्रॉस-अटेंशन के माध्यम से एटम- और बॉन्ड-स्तरीय तर्क को स्पष्ट रूप से डिकपल और सिंक्रोनाइज़ करके मौजूदा सिंगल-स्ट्रीम विधियों की आर्किटेक्चरल बाधाओं को दूर करता है, जिससे मास स्पेक्ट्रा से डी नोवो मॉलिक्यूलर जनरेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xujun Che, Xiuxia Du, Depeng Xu2026-05-11
🤖 machine learning

Towards Differentially Private Reinforcement Learning with General Function Approximation

यह शोधपत्र सामान्य फलन सन्निकटन (general function approximation) के साथ विभेदक रूप से निजी ऑनलाइन सुदृढीकरण शिक्षण (differentially private online reinforcement learning) के लिए प्रथम सैद्धांतिक गारंटी प्रस्तुत करता है, जो बैच किए गए नीति अपडेट और एक्सपोनेंशियल मैकेनिज्म के एक नवीन संयोजन के माध्यम से O~(K3/5)\widetilde{O}(K^{3/5}) रिग्रेट बाउंड प्राप्त करता है और साथ ही पूर्व रैखिक सेटिंग्स में अंतराल को स्पष्ट करता है।

Yi He, Xingyu Zhou2026-05-11
🤖 machine learning

Integrating Causal DAGs in Deep RL: Activating Minimal Markovian States with Multi-Order Exposure

यह शोध पत्र MOSE (मल्टी-ऑर्डर स्टेट एक्सपोज़र) को पेश करके डीप रिइन्फोर्समेंट लर्निंग में अनुदैर्ध्य कारण ग्राफों (longitudinal causal graphs) से प्रमाणित रूप से मार्कोवियन अवस्थाओं के निर्माण की चुनौती को संबोधित करता है, जो कि यह दर्शाता है कि नियंत्रित अतिरेक (controlled redundancy), न कि केवल न्यूनतम पर्याप्तता (minimal sufficiency), कारण अवस्था सूचना के प्रदर्शन लाभों को अनलॉक करने के लिए आवश्यक है, और इसके लिए Q-फंक्शन में मल्टी-ऑर्डर ऐतिहासिक अवस्था निर्माणों को फीड किया जाता है।

Jiamin Xu, Jacqueline Maasch, Kyra Gan2026-05-11
🤖 machine learning

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

डॉ. पोस्ट-ट्रेनिंग (Dr. Post-Training) एक नवीन रूपरेखा प्रस्तुत करता है जो प्रचुर सामान्य प्रशिक्षण डेटा को स्कर्स (scarce) लक्ष्य डेटा पर ओवरफिटिंग को रोकने के लिए एक डेटा-प्रेरित रेगुलराइज़र (data-induced regularizer) के रूप में पुनर्गठित करता है, जिससे अपडेट दिशाओं को एक व्यवहार्य सेट (feasible set) पर प्रोजेक्ट किया जाता है, और इस प्रकार न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ SFT, RLHF और RLVR कार्यों में मौजूदा डेटा चयन विधियों से बेहतर प्रदर्शन करता है।

Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma2026-05-11
📊 statistics

Less Random, More Private: What is the Optimal Subsampling Scheme for DP-SGD?

यह शोध पत्र यह प्रदर्शित करता है कि DP-SGD में मानक पॉइसन सबसैंपलिंग (Poisson subsampling) को एक संरचित बैलेंस्ड इटरेशन सबसैंपलिंग (Balanced Iteration Subsampling - BIS) योजना से बदलना, जो समान मार्जिनल भागीदारी बनाए रखते हुए भागीदारी विचरण (participation variance) को समाप्त करता है, बेहतर गोपनीयता प्रवर्धन (privacy amplification) प्राप्त करता है और कम-शोर वाले शासन (low-noise regimes) में आवश्यक शोर गुणक (noise multiplier) को 9.6% तक कम कर देता है।

Andy Dong, Ayfer Özgür2026-05-11
💬 NLP

Self-Consolidating Language Models: Continual Knowledge Incorporation from Context

यह शोध पत्र सेल्फ-कंसोलिडेटिंग लैंग्वेज मॉडल्स (SCoL) का प्रस्ताव करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो मेटा-रीइन्फोर्समेंट लर्निंग के माध्यम से स्पार्स, लेयर-विशिष्ट अपडेट निर्देशों को जेनरेट करके LLMs को अपने वेट्स में नए ज्ञान को निरंतर शामिल करने में सक्षम बनाता है, जिससे मौजूदा बेसलाइन्स की तुलना में सूचना प्रतिधारण (इन्फॉर्मेशन रिटेंशन) में सुधार होता है और इंटरफेरेंस कम होता है।

Zekun Wang, Anant Gupta, Zihan Dong, Christopher J. MacLellan2026-05-11
🤖 machine learning

Test-Time Compositional Generalization in Diffusion Models via Concept Discovery

यह शोध पत्र प्रीट्रेन्ड डिफ्यूजन मॉडल्स के लिए एक टेस्ट-टाइम कंपोजिशनल जनरलाइजेशन पद्धति प्रस्तावित करता है जो पूर्व-निर्धारित कॉन्सेप्ट लाइब्रेरी पर निर्भर किए बिना नवीन कॉन्फ़िगरेशन उत्पन्न करने में सक्षम करने के लिए, टाइम-इंडेक्स्ड स्कोर ज्योमेट्री का विश्लेषण करके क्वेरी-विशिष्ट अवधारणाओं की खोज करता है और एक प्रोडक्ट-ऑफ-एक्सपर्ट्स टीचर मॉडल का निर्माण करता है।

Zekun Wang, Anant Gupta, Tianyi Zhu, Christopher J. MacLellan2026-05-11
🤖 AI

Learning Visual Feature-Based World Models via Residual Latent Action

यह शोध पत्र RLA वर्ल्ड मॉडल को प्रस्तुत करता है, जो कुशल, उच्च-निष्ठा वाले विज़ुअल फीचर प्रेडिक्शन प्राप्त करने और बिना ऑनलाइन इंटरेक्शन या हस्तनिर्मित रिवार्ड्स के ऑफलाइन वीडियो से उन्नत रोबोट लर्निंग को सक्षम करने के लिए DINO रेसिडुअल्स से सीखे गए और फ्लो मैचिंग के माध्यम से प्रेडिक्ट किए गए एक नवीन रेसिडुअल लेटेंट एक्शन रिप्रेजेंटेशन का लाभ उठाता है।

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias2026-05-11
🤖 machine learning

Task Relevance Is Not Local Replaceability: A Two-Axis View of Channel Information

यह शोध पत्र कार्य प्रासंगिकता (task relevance) और स्थानीय प्रतिस्थापनीयता (local replaceability) के बीच अंतर करने वाला एक द्वि-अक्षीय ढांचा प्रस्तावित करता है, जो यह प्रदर्शित करता है कि किसी चैनल की अपने साथियों द्वारा प्रतिस्थापित किए जाने की क्षमता (स्थानीय प्रतिस्थापनीयता), कार्य में उसके प्रत्यक्ष योगदान की तुलना में प्रूनिंग सफलता का अधिक विश्वसनीय भविष्यवक्ता है।

Houman Safaai, Andrew T. Landau, Celia C. Beron, Yasin Mazloumi, Bernardo L. Sabatini2026-05-11