🤖 AI

Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

यह शोध पत्र बिहेवियर क्यू रीजनिंग (Behavior Cue Reasoning) को प्रस्तुत करता है, जो एक ऐसी विधि है जो लार्ज लैंग्वेज मॉडल्स को विशिष्ट व्यवहारों से पहले विशेष टोकन संकेतों को उत्सर्जित करने के लिए प्रशिक्षित करती है, जिससे कुशल निरीक्षण संभव होता है जो प्रदर्शन से समझौता किए बिना व्यर्थ रीजनिंग टोकन को काफी कम करता है और सुरक्षित कार्यों को पुनः प्राप्त करता है।

Christopher Z. Cui, Taylor W. Killian, Prithviraj Ammanabrolu2026-05-11
🤖 machine learning

A Systematic Investigation of The RL-Jailbreaker in LLMs

यह शोध पत्र RL-आधारित जेलब्रेकिंग का पहला व्यवस्थित अपघटन प्रस्तुत करता है, जो यह प्रकट करता है कि पर्यावरणीय औपचारिकीकरण कारक—विशेष रूप से सघन पुरस्कार (dense rewards) और विस्तारित एपिसोड की लंबाई—सभी लक्षित लार्ज लैंग्वेज मॉडल्स और उनके सुरक्षा उपायों के विरुद्ध सफल हमलों के प्राथमिक चालक हैं।

Montaser Mohammedalamen, Kevin Roice, Reginald McLean, Alyssa Lefaivre Škopac2026-05-11
📊 statistics

An Interpretable and Scalable Framework for Evaluating Large Language Models

यह शोध पत्र पारंपरिक आइटम रिस्पॉन्स थ्योरी (Item Response Theory) विधियों की कम्प्यूटेशनल और स्थिरता संबंधी सीमाओं को दूर करने के लिए मेजराइजेशन-मिनिमाइजेशन (majorization-minimization) सिद्धांत पर आधारित एक स्केलेबल और व्याख्या योग्य ढांचे का प्रस्ताव करता है, जो विविध बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स के कुशल और सटीक मूल्यांकन को सक्षम बनाता है।

Xinhao Qu, Qiang Heng, Hao Zeng, Xiaoqian Liu2026-05-11
🤖 machine learning

Unlocking High-Fidelity Molecular Generation from Mass Spectra via Dual-Stream Line Graph Diffusion

यह शोध पत्र DualLGD को प्रस्तुत करता है, जो एक डुअल-स्ट्रीम लाइन ग्राफ डिफ्यूजन मॉडल है जो इंसिडेंस-कंस्ट्रेंड क्रॉस-अटेंशन के माध्यम से एटम- और बॉन्ड-स्तरीय तर्क को स्पष्ट रूप से डिकपल और सिंक्रोनाइज़ करके मौजूदा सिंगल-स्ट्रीम विधियों की आर्किटेक्चरल बाधाओं को दूर करता है, जिससे मास स्पेक्ट्रा से डी नोवो मॉलिक्यूलर जनरेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xujun Che, Xiuxia Du, Depeng Xu2026-05-11
🤖 machine learning

Towards Differentially Private Reinforcement Learning with General Function Approximation

यह शोधपत्र सामान्य फलन सन्निकटन (general function approximation) के साथ विभेदक रूप से निजी ऑनलाइन सुदृढीकरण शिक्षण (differentially private online reinforcement learning) के लिए प्रथम सैद्धांतिक गारंटी प्रस्तुत करता है, जो बैच किए गए नीति अपडेट और एक्सपोनेंशियल मैकेनिज्म के एक नवीन संयोजन के माध्यम से O~(K3/5)\widetilde{O}(K^{3/5}) रिग्रेट बाउंड प्राप्त करता है और साथ ही पूर्व रैखिक सेटिंग्स में अंतराल को स्पष्ट करता है।

Yi He, Xingyu Zhou2026-05-11
💬 NLP

GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations

यह शोध पत्र GSM-SEM को प्रस्तुत करता है, जो एक स्टोकेस्टिक ढांचा (stochastic framework) है जो LLM मूल्यांकन में मेमोराइजेशन बायस (memorization bias) को कम करने के लिए अर्थपूर्ण रूप से विविध और तथ्यात्मक रूप से परिवर्तित बेंचमार्क वेरिएंट उत्पन्न करता है, जो इन गतिशील रूप से पुनर्जीवित डेटासेट पर परीक्षण किए जाने पर अत्याधुनिक मॉडलों के प्रदर्शन में महत्वपूर्ण गिरावट को प्रकट करता है।

Jyotika Singh, Fang Tu, Aziza Mirzadova, Amit Agarwal, Hitesh Laxmichand Patel, Sandip Ghoshal, Miguel Ballesteros, Yass (…)2026-05-11
🤖 machine learning

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

डॉ. पोस्ट-ट्रेनिंग (Dr. Post-Training) एक नवीन रूपरेखा प्रस्तुत करता है जो प्रचुर सामान्य प्रशिक्षण डेटा को स्कर्स (scarce) लक्ष्य डेटा पर ओवरफिटिंग को रोकने के लिए एक डेटा-प्रेरित रेगुलराइज़र (data-induced regularizer) के रूप में पुनर्गठित करता है, जिससे अपडेट दिशाओं को एक व्यवहार्य सेट (feasible set) पर प्रोजेक्ट किया जाता है, और इस प्रकार न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ SFT, RLHF और RLVR कार्यों में मौजूदा डेटा चयन विधियों से बेहतर प्रदर्शन करता है।

Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma2026-05-11
🤖 AI

2.5-D Decomposition for LLM-Based Spatial Construction

यह शोध पत्र 2.5-D अपघटन (decomposition) का उपयोग करने वाले एक न्यूरो-सिम्बोलिक पाइपलाइन को प्रस्तुत करता है जो मॉडल को 2D योजना बनाने तक सीमित रखकर और एक नियतात्मक निष्पादक (deterministic executor) को ऊर्ध्वाधर प्लेसमेंट संभालने देकर LLM-आधारित स्थानिक निर्माण सटीकता में महत्वपूर्ण सुधार करता है, जिससे बेंचमार्क पर सीलिंग-स्तर का प्रदर्शन प्राप्त होता है और एज हार्डवेयर एवं विविध सहयोगात्मक कार्यों में सफल स्थानांतरण प्रदर्शित होता है।

Paul Whitten, Li-Jen Chen, Sharath Baddam2026-05-11
🤖 AI

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

यह शोध पत्र टीमबेंच (TeamBench) का परिचय देता है, जो एजेंट समन्वय का कठोरता से मूल्यांकन करने के लिए ऑपरेटिंग सिस्टम द्वारा लागू भूमिका पृथक्करण (role separation) का उपयोग करता है, जिससे यह प्रकट होता है कि जबकि केवल प्रॉम्प्ट-आधारित और सैंडबॉक्स-लक्षित टीमें समान पास दर प्राप्त करती हैं, लागू पृथक्करण भूमिका के अतिरेक (role overreach) और अप्रभावी सत्यापन जैसी महत्वपूर्ण खामियों को उजागर करता है जिन्हें मानक मेट्रिक्स अक्सर अनदेखा कर देते हैं।

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin (…)2026-05-11
🤖 AI

Learning Visual Feature-Based World Models via Residual Latent Action

यह शोध पत्र RLA वर्ल्ड मॉडल को प्रस्तुत करता है, जो कुशल, उच्च-निष्ठा वाले विज़ुअल फीचर प्रेडिक्शन प्राप्त करने और बिना ऑनलाइन इंटरेक्शन या हस्तनिर्मित रिवार्ड्स के ऑफलाइन वीडियो से उन्नत रोबोट लर्निंग को सक्षम करने के लिए DINO रेसिडुअल्स से सीखे गए और फ्लो मैचिंग के माध्यम से प्रेडिक्ट किए गए एक नवीन रेसिडुअल लेटेंट एक्शन रिप्रेजेंटेशन का लाभ उठाता है।

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias2026-05-11