🤖 machine learning

Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks

यह शोधपत्र Delulu को प्रस्तुत करता है, जो 1,951 प्रतिकूल रूप से क्यूरेट किए गए नमूनों से बना एक कठोरता से सत्यापित बहुभाषी बेंचमार्क है, जो फिल-इन-द-मिडल (Fill-in-the-Middle) कार्यों में विश्वसनीय किंतु त्रुटिपूर्ण मतिभ्रम (hallucinations) उत्पन्न करने के प्रति अत्याधुनिक कोड जनरेशन मॉडलों की निरंतर भेद्यता को उजागर करता है।

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu2026-05-11
🤖 machine learning

A Systematic Investigation of The RL-Jailbreaker in LLMs

यह शोध पत्र RL-आधारित जेलब्रेकिंग का पहला व्यवस्थित अपघटन प्रस्तुत करता है, जो यह प्रकट करता है कि पर्यावरणीय औपचारिकीकरण कारक—विशेष रूप से सघन पुरस्कार (dense rewards) और विस्तारित एपिसोड की लंबाई—सभी लक्षित लार्ज लैंग्वेज मॉडल्स और उनके सुरक्षा उपायों के विरुद्ध सफल हमलों के प्राथमिक चालक हैं।

Montaser Mohammedalamen, Kevin Roice, Reginald McLean, Alyssa Lefaivre Škopac2026-05-11
🤖 machine learning

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEvolve++ एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को पेश करता है जो एक प्रशिक्षित सलाहकार (advisor) और एक फ्रंटियर मॉडल का उपयोग करके रणनीतिक परिकल्पना चयन को कार्यान्वयन से अलग करता है, जो विविध इंजीनियरिंग और वैज्ञानिक कार्यों में तेज़ अभिसरण (convergence) और स्थिर टेस्ट-टाइम लर्निंग प्राप्त करने के लिए एक चरण-अनुकूली (phase-adaptive) प्रशिक्षण रणनीति को नियोजित करता है।

Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed (…)2026-05-11
📊 statistics

An Interpretable and Scalable Framework for Evaluating Large Language Models

यह शोध पत्र पारंपरिक आइटम रिस्पॉन्स थ्योरी (Item Response Theory) विधियों की कम्प्यूटेशनल और स्थिरता संबंधी सीमाओं को दूर करने के लिए मेजराइजेशन-मिनिमाइजेशन (majorization-minimization) सिद्धांत पर आधारित एक स्केलेबल और व्याख्या योग्य ढांचे का प्रस्ताव करता है, जो विविध बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स के कुशल और सटीक मूल्यांकन को सक्षम बनाता है।

Xinhao Qu, Qiang Heng, Hao Zeng, Xiaoqian Liu2026-05-11
🤖 machine learning

Unlocking High-Fidelity Molecular Generation from Mass Spectra via Dual-Stream Line Graph Diffusion

यह शोध पत्र DualLGD को प्रस्तुत करता है, जो एक डुअल-स्ट्रीम लाइन ग्राफ डिफ्यूजन मॉडल है जो इंसिडेंस-कंस्ट्रेंड क्रॉस-अटेंशन के माध्यम से एटम- और बॉन्ड-स्तरीय तर्क को स्पष्ट रूप से डिकपल और सिंक्रोनाइज़ करके मौजूदा सिंगल-स्ट्रीम विधियों की आर्किटेक्चरल बाधाओं को दूर करता है, जिससे मास स्पेक्ट्रा से डी नोवो मॉलिक्यूलर जनरेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xujun Che, Xiuxia Du, Depeng Xu2026-05-11
🤖 machine learning

Towards Differentially Private Reinforcement Learning with General Function Approximation

यह शोधपत्र सामान्य फलन सन्निकटन (general function approximation) के साथ विभेदक रूप से निजी ऑनलाइन सुदृढीकरण शिक्षण (differentially private online reinforcement learning) के लिए प्रथम सैद्धांतिक गारंटी प्रस्तुत करता है, जो बैच किए गए नीति अपडेट और एक्सपोनेंशियल मैकेनिज्म के एक नवीन संयोजन के माध्यम से O~(K3/5)\widetilde{O}(K^{3/5}) रिग्रेट बाउंड प्राप्त करता है और साथ ही पूर्व रैखिक सेटिंग्स में अंतराल को स्पष्ट करता है।

Yi He, Xingyu Zhou2026-05-11
🤖 machine learning

Integrating Causal DAGs in Deep RL: Activating Minimal Markovian States with Multi-Order Exposure

यह शोध पत्र MOSE (मल्टी-ऑर्डर स्टेट एक्सपोज़र) को पेश करके डीप रिइन्फोर्समेंट लर्निंग में अनुदैर्ध्य कारण ग्राफों (longitudinal causal graphs) से प्रमाणित रूप से मार्कोवियन अवस्थाओं के निर्माण की चुनौती को संबोधित करता है, जो कि यह दर्शाता है कि नियंत्रित अतिरेक (controlled redundancy), न कि केवल न्यूनतम पर्याप्तता (minimal sufficiency), कारण अवस्था सूचना के प्रदर्शन लाभों को अनलॉक करने के लिए आवश्यक है, और इसके लिए Q-फंक्शन में मल्टी-ऑर्डर ऐतिहासिक अवस्था निर्माणों को फीड किया जाता है।

Jiamin Xu, Jacqueline Maasch, Kyra Gan2026-05-11
🤖 machine learning

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

डॉ. पोस्ट-ट्रेनिंग (Dr. Post-Training) एक नवीन रूपरेखा प्रस्तुत करता है जो प्रचुर सामान्य प्रशिक्षण डेटा को स्कर्स (scarce) लक्ष्य डेटा पर ओवरफिटिंग को रोकने के लिए एक डेटा-प्रेरित रेगुलराइज़र (data-induced regularizer) के रूप में पुनर्गठित करता है, जिससे अपडेट दिशाओं को एक व्यवहार्य सेट (feasible set) पर प्रोजेक्ट किया जाता है, और इस प्रकार न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ SFT, RLHF और RLVR कार्यों में मौजूदा डेटा चयन विधियों से बेहतर प्रदर्शन करता है।

Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma2026-05-11
📊 statistics

Less Random, More Private: What is the Optimal Subsampling Scheme for DP-SGD?

यह शोध पत्र यह प्रदर्शित करता है कि DP-SGD में मानक पॉइसन सबसैंपलिंग (Poisson subsampling) को एक संरचित बैलेंस्ड इटरेशन सबसैंपलिंग (Balanced Iteration Subsampling - BIS) योजना से बदलना, जो समान मार्जिनल भागीदारी बनाए रखते हुए भागीदारी विचरण (participation variance) को समाप्त करता है, बेहतर गोपनीयता प्रवर्धन (privacy amplification) प्राप्त करता है और कम-शोर वाले शासन (low-noise regimes) में आवश्यक शोर गुणक (noise multiplier) को 9.6% तक कम कर देता है।

Andy Dong, Ayfer Özgür2026-05-11
💬 NLP

Self-Consolidating Language Models: Continual Knowledge Incorporation from Context

यह शोध पत्र सेल्फ-कंसोलिडेटिंग लैंग्वेज मॉडल्स (SCoL) का प्रस्ताव करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो मेटा-रीइन्फोर्समेंट लर्निंग के माध्यम से स्पार्स, लेयर-विशिष्ट अपडेट निर्देशों को जेनरेट करके LLMs को अपने वेट्स में नए ज्ञान को निरंतर शामिल करने में सक्षम बनाता है, जिससे मौजूदा बेसलाइन्स की तुलना में सूचना प्रतिधारण (इन्फॉर्मेशन रिटेंशन) में सुधार होता है और इंटरफेरेंस कम होता है।

Zekun Wang, Anant Gupta, Zihan Dong, Christopher J. MacLellan2026-05-11