📊 statistics

On the optimization dynamics of RLVR: Gradient gap and step size thresholds

यह शोध पत्र "ग्रेडिएंट गैप" (Gradient Gap) को पेश करके 'वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (RLVR) के लिए एक सैद्धांतिक आधार स्थापित करता है ताकि अभिसरण गतिकी (convergence dynamics) की व्याख्या की जा सके और एक महत्वपूर्ण स्टेप-साइज़ थ्रेशोल्ड (step-size threshold) को व्युत्पन्न किया जा सके जो यह निर्धारित करता है कि सीखना सफल होगा या विफल, जिससे लेंथ नॉर्मलाइजेशन (length normalization) जैसे व्यावहारिक ह्यूरिस्टिक्स और सफलता दरों के ठहराव के लिए एक सिद्धांत-आधारित स्पष्टीकरण प्राप्त होता है।

Joe Suk, Yaqi Duan2026-05-08
🤖 AI

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

यह शोध पत्र मेमोरी-एज़-एक्शन (MemAct) का परिचय देता है, जो एक ऐसा ढांचा है जो वर्किंग मेमोरी प्रबंधन को सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से अनुकूलित सीखने योग्य नीतिगत कार्यों (learnable policy actions) के रूप में मानता है ताकि लंबी अवधि के एजेंटिक कार्यों के लिए कुशल, अनुकूलनीय संदर्भ क्यूरेशन (context curation) को सक्षम किया जा सके, जिससे बहुत बड़े मॉडलों की सटीकता प्राप्त करते हुए संदर्भ लंबाई को काफी कम किया जा सके।

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang2026-05-08
💬 NLP

Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production

यह शोध पत्र "कैच योर ब्रेथ" (CYB) को प्रस्तुत करता है, जो एक अनुक्रमिक निर्णय समस्या के रूप में फ्रेम किया गया एक सुपरवाइज्ड लॉस फंक्शन है जो फाउंडेशन मॉडल्स को इन्फरेंस के दौरान पॉज़ टोकन को स्वायत्त और अनुकूल रूप से सम्मिलित करने में सक्षम बनाता है ताकि कंप्यूट स्टेप्स को गतिशील रूप से आवंटित किया जा सके, जिससे बिना किसी कंप्यूटेशनल या मेमोरी लागत को बढ़ाए परप्लेक्सिटी और डाउनस्ट्रीम सटीकता में सुधार किया जा सके।

Alexandre Galashov, Matt Jones, Rosemary Ke, Yuan Cao, Vaishnavh Nagarajan, Michael C. Mozer2026-05-08
🤖 AI

Accelerating Discrete Facility Layout Optimization: A Hybrid CDCL and CP-SAT Architecture

यह शोध पत्र एक हाइब्रिड CDCL और CP-SAT आर्किटेक्चर प्रस्तुत करता है जो CDCL की बेहतर व्यवहार्यता पहचान गति (feasibility detection speed) का लाभ उठाकर CP-SAT के लिए वॉर्म-स्टार्ट संकेत (warm-start hints) प्रदान करता है, जिससे डिस्क्रिट फैसिलिटी लेआउट समस्याओं के लिए सटीक अनुकूलन (exact optimization) में महत्वपूर्ण रूप से तेजी आती है।

Joshua Gibson, Kapil Dhakal2026-05-08
🤖 machine learning

Generalised Linear Models in Deep Bayesian RL with Learnable Basis Functions

यह शोध पत्र GLiBRL प्रस्तुत करता है, जो एक नवीन डीप बेयसियन रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो पूर्णतः सुलभ बेयसियन अनुमान और सटीक मार्जिनल लाइकलीहुड मूल्यांकन प्राप्त करने के लिए सीखने योग्य बेसिस फंक्शन्स और जनरलाइज्ड लीनियर मॉडल्स का उपयोग करता है, जिससे पूर्ववर्ती विधियों की अस्पष्ट कार्य प्रस्तुतियों (task representations) पर विजय प्राप्त होती है और MuJoCo एवं MetaWorld बेंचमार्क पर अत्याधुनिक प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jingyang You, Hanna Kurniawati2026-05-08
🤖 AI

Mapping Human Anti-collusion Mechanisms to Multi-agent AI Systems

यह शोध पत्र मानव और एआई शासन के बीच के अंतर को पाटने के लिए मानव प्रति-मिलीभगत तंत्रों (anti-collusion mechanisms) का एक वर्गीकरण विकसित करता है और उन्हें मल्टी-एजेंट एआई प्रणालियों के विशिष्ट हस्तक्षेपों के साथ मैप करता है, साथ ही एट्रिब्यूशन, पहचान की तरलता और प्रतिकूल अनुकूलन जैसी प्रमुख चुनौतियों की पहचान भी करता है।

Jamiu Idowu, Ahmed Almasoud, Ayman Alfahid2026-05-08
🤖 AI

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

यह शोध पत्र ओवेन-शापली पॉलिसी ऑप्टिमाइज़ेशन (OSPO) को प्रस्तुत करता है, जो एक सिद्धांत-आधारित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो शापली-ओवेन एट्रिब्यूशंस का उपयोग करके अनुक्रम-स्तरीय पुरस्कारों को अर्थपूर्ण रूप से सुसंगत टोकन में पुनर्वितरित करके जेनेरेटिव सर्च LLMs में क्रेडिट असाइनमेंट अंतराल को संबोधित करता है, जिससे बिना किसी पैरामीट्रिक वैल्यू मॉडल की आवश्यकता के प्रदर्शन और मजबूती में सुधार होता है।

Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy2026-05-08
💬 NLP

Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-Blind

यह शोधपत्र 'कमीलिऑन' (Chameleon) डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडलों के साथ उपयोगकर्ता की अंतःक्रियाएं मुख्य रूप से निश्चित गुणों के बजाय प्रासंगिक स्थिति (contextual state) द्वारा संचालित होती हैं, जो यह प्रकट करता है कि वर्तमान मॉडल "स्टेट-ब्लाइंड" (state-blind) हैं जबकि रिवॉर्ड मॉडल उपयोगकर्ता की स्थितियों के प्रति असंगत रूप से प्रतिक्रिया करते हैं।

Tamunotonye Harry, Ivoline Ngong, Chima Nweke, Yuanyuan Feng, Joseph Near2026-05-08
🤖 machine learning

Dynamic Expert-Guided Model Averaging for Causal Discovery

यह शोध पत्र एक गतिशील विशेषज्ञ-निर्देशित मॉडल औसत फ्रेमवर्क प्रस्तावित करता है जो विविध कारण खोज एल्गोरिदम के बीच अनिश्चितताओं को हल करने के लिए अपूर्ण विशेषज्ञों से चुनिच्छा रूप से पूछताछ करता है, जिससे एज अस्तित्व और ओरिएंटेशन के बीच अंतर करके स्वच्छ और शोर वाले दोनों प्रकार के डेटा पर प्रदर्शन में सुधार होता है।

Adrick Tench, Thomas Demeester2026-05-08
💬 NLP

LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning

LLM-AutoDP एक नवीन फ्रेमवर्क है जो संवेदनशील डेटा तक सीधी मानवीय पहुँच के बिना, मॉडल फाइन-ट्यूनिंग के लिए डेटा प्रोसेसिंग रणनीतियों को स्वचालित रूप से उत्पन्न करने और उन्हें पुनरावृत्ति (iteratively) के माध्यम से अनुकूलित करने के लिए LLM एजेंटों का लाभ उठाता है, जिससे विशेष त्वरण तकनीकों के माध्यम से उच्च-गुणवत्ता वाले परिणाम प्राप्त होते हैं और खोज समय में काफी कमी आती है।

Wei Huang, Anda Cheng, Yinggui Wang, Lei Wang, Tao Wei2026-05-08