🤖 machine learning

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

यह शोध पत्र प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन का उपयोग करने वाले एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे और एक अनुकूलन योग्य, निष्पादन-जागरूक पुरस्कार प्रणाली को पेश करता है ताकि बड़े भाषा मॉडलों को फाइन-ट्यून किया जा सके, जो कोड जनरेशन कार्यों में कार्यात्मक शुद्धता और रोबोटिक्स जैसे डोमेन-विशिष्ट बाधाओं के प्रति उनकी अनुकूलन क्षमता में महत्वपूर्ण सुधार करता है।

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini2026-05-21
🤖 machine learning

Behavior-Consistent Deep Reinforcement Learning

यह शोध पत्र Q-वैल्यू एक्सपेक्टाइल डिसएग्रीमेंट (QED) को प्रस्तुत करता है, जो एक स्टेट-डिपेंडेंट टेम्परेचर शेड्यूलर है जो मैक्सिमम-एन्ट्रॉपी सुदृढीकरण शिक्षण (reinforcement learning) में डबल-क्रिटिक डिसएग्रीमेंट का लाभ उठाकर निरंतर-नियंत्रण कार्यों (continuous-control tasks) में उच्च प्रदर्शन बनाए रखते हुए क्रॉस-रन पॉलिसी डाइवर्जेंस को महत्वपूर्ण रूप से कम करता है।

Marcel Hussing, Liv G. d'Aliberti, Claas Voelcker, Benjamin Eysenbach, Eric Eaton2026-05-21
📊 statistics

Federated LoRA Fine-Tuning for LLMs via Collaborative Alignment

यह शोध पत्र CLAIR प्रस्तुत करता है, जो एक संदूषण-जागरूक (contamination-aware) फेडरेटेड लर्निंग फ्रेमवर्क है जो अत्यधिक विषम सेटिंग्स में लार्ज लैंग्वेज मॉडल्स के फाइन-ट्यूनिंग प्रदर्शन को सुधारने, दुर्भावनापूर्ण क्लाइंट्स का पता लगाने और एक साझा LoRA सबस्पेस को सहयोगात्मक रूप से रिकवर करने के लिए स्ट्रक्चर्ड लो-रैंक प्लस ब्लॉक-स्पार्स डिकंपोजिशन का उपयोग करता है।

Shuaida He, Liwen Chen, Long Feng2026-05-21
🤖 machine learning

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

यह शोध पत्र APEX का प्रस्ताव करता है, जो एक स्वायत्त नीति अन्वेषण (autonomous policy exploration) ढांचा है जो रणनीति मानचित्र (strategy map) और फोर्क डिस्कवरी तंत्र (fork discovery mechanism) का उपयोग करके स्व-विकसित LLM एजेंटों में अन्वेषण पतन (exploration collapse) को दूर करता है, जिससे उन्हें मॉडल-वेट अपडेट के बिना स्मृति और प्रतिबिंब के माध्यम से बेहतर रणनीतियों की खोज करने में सक्षम बनाता है।

Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi2026-05-21
🤖 machine learning

Divide and Contrast: Learning Robust Temporal Features without Augmentation

यह शोधपत्र डिवाइड एंड कॉन्ट्रास्ट (Di-COT) को प्रस्तुत करता है, जो टाइम-सीरीज रिप्रेजेंटेशन लर्निंग के लिए एक कुशल अनसुपरवाइज्ड फ्रेमवर्क है, जो विंडोज़ के भीतर ओवरलैपिंग सब-ब्लॉक्स को कॉन्ट्रास्ट करके कई कार्यों में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है, जिससे डेटा ऑग्मेंटेशन, मल्टीपल एनकोडर पासेस और सीक्वेंस-लेंथ-डिपेंडेंट कंप्यूटेशन्स की आवश्यकता समाप्त हो जाती है।

Abdul-Kazeem Shamba, Kerstin Bach, Gavin Taylor2026-05-21
📊 statistics

Theoretical guidelines for annealed Langevin dynamics in compositional simulation-based inference

यह शोध पत्र कंपोजिशनल सिमुलेशन-आधारित अनुमान (compositional simulation-based inference) में एनेल्ड लैंगिविन डायनेमिक्स (annealed Langevin dynamics) के हाइपरपैरामीटर्स को ट्यून करने के लिए स्पष्ट, सटीकता-गारंटी वाले दिशा-निर्देश स्थापित करने हेतु सैद्धांतिक वासरस्टीन बाउंड्स (Wasserstein bounds) व्युत्पन्न करता है, जो यह प्रदर्शित करता है कि लिनहार्ट एट अल. (2026) का सूत्रीकरण गॉसियन सेटिंग में गेफ़नर एट अल. (2023) की तुलना में सैद्धांतिक रूप से श्रेष्ठ है और ये अंतर्दृष्टि जटिल समस्याओं पर भी सामान्यीकृत होती हैं।

Camille Touron, Gabriel V. Cardoso, Julyan Arbel, Pedro L. C. Rodrigues2026-05-21
🤖 machine learning

On the Cost and Benefit of Chain of Thought: A Learning-Theoretic Perspective

यह शोध पत्र एक लर्निंग-थ्योरेटिक फ्रेमवर्क स्थापित करता है जो चेन ऑफ थॉट (CoT) रीजनिंग जोखिम को एक लाभकारी ओरैकल-ट्रैजेक्टरी घटक और एक लागतपूर्ण ट्रैजेक्टरी-मिसमैच घटक में विभाजित करता है, यह प्रदर्शित करते हुए कि CoT की प्रभावशीलता उन स्थिरता स्थितियों पर महत्वपूर्ण रूप से निर्भर करती है जो मध्यवर्ती रीजनिंग चरणों के लाभों को कम करने के लिए त्रुटि संचय (error accumulation) को बढ़ने से रोकती हैं।

Yue Zhang, Zhiyi Dong, Tommaso Cesari, Yongyi Mao2026-05-21
🤖 machine learning

\textit{Stochastic} MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

यह शोध पत्र स्टोकेस्टिक मीनफ्लो पॉलिसीज़ (SMFP) को प्रस्तुत करता है, जो एक वन-स्टेप जनरेटिव पॉलिसी क्लास है जो मल्टीमॉडल एक्शन डिस्ट्रीब्यूशन को प्रभावी ढंग से संभालने के लिए ट्रैक्टेबल एंट्रॉपी एस्टीमेशन को ऑफ-पॉलिसी मिरर डिसेंट के साथ जोड़ता है, जबकि MuJoCo बेंचमार्क में इन्फरेंस दक्षता और ट्रेनिंग स्थिरता बनाए रखता है।

Zeyuan Wang, Da Li, Yulin Chen, Yuehu Gong, Yanming Guo, Ye Shi, Liang Bai, Tianyuan Yu, Yanwei Fu2026-05-21
🤖 machine learning

A Mechanistic Study of Tabular Foundation Models

यह शोध पत्र टैबुलर फाउंडेशन मॉडल्स के विशिष्ट समानता-आधारित रीडआउट एल्गोरिदम को अभिलक्षणित करके, उन विशिष्ट पोजीशनल पैरामीटर्स की पहचान करके जो क्रमपरिवर्तन अपरिवर्तनीयता (परम्यूटेशन इनवेरिएंस) के लिए उत्तरदायी हैं, और उनके सटीक परिणामों एवं विफलता मोड दोनों की व्याख्या करने वाले कॉज़ल इंटरवेंशन और लक्षित गड़बड़ी (टारगेटेड परटर्बेशन) के माध्यम से इन निष्कर्षों को मान्य करते हुए, उनका एक यांत्रिक विवरण प्रस्तुत करता है।

Marin Biloš, James T. Wilson, Anderson Schneider, Yuriy Nevmyvaka2026-05-21
📊 statistics

Large-Step Training Dynamics of a Two-Factor Linear Transformer Model

यह शोध पत्र एक टू-फैक्टर लीनियर ट्रांसफार्मर मॉडल की लार्ज-स्टेप ट्रेनिंग डायनेमिक्स का विश्लेषण करता है, जो यह प्रदर्शित करता है कि उच्च लर्निंग रेट्स इन-कॉन्टेक्स्ट लीनियर रिग्रेशन के सीखने की गति को तेज करने के बजाय, सिस्टम को मोनोटोन कन्वर्जेंस से बदलकर चक्रों (साइकिल), बाउंडेड केओस, या डाइवर्जेंस की ओर ले जाकर प्रशिक्षण के परिणामों को मौलिक रूप से बदल सकते हैं।

Krishnakumar Balasubramanian2026-05-21