🤖 AI

Beyond Value Elicitation: Towards Moral Profiles in Early Requirements Engineering via Role-Playing Games and Anthropologist LLMs

यह अध्ययन रिक्वायरमेंट्स इंजीनियरिंग (Requirements Engineering) में एक नवीन दृष्टिकोण प्रस्तावित करता है जो उपयोगकर्ताओं के अंतर्निहित नैतिक प्रोफाइल्स (tacit moral profiles) को गतिशील कथात्मक निरूपणों (dynamic narrative representations) के रूप में प्राप्त करने और पुनर्निर्मित करने के लिए मानवशास्त्रीय रूप से आधारित लार्ज लैंग्वेज मॉडल्स के साथ इमर्सिव रोल-प्लेइंग गेम्स को जोड़ता है, जिससे पारंपरिक मूल्य निष्कर्षण विधियों की सीमाओं को दूर किया जा सके।

Gianluca De Ninno, Paola Inverardi, Francesca Belotti2026-05-08
💬 NLP

CompassLLM: A Multi-Agent Approach toward Geo-Spatial Reasoning for Popular Path Query

CompassLLM एक अभिनव मल्टी-एजेंट फ्रेमवर्क है जो ऐतिहासिक प्रक्षेप पथों (ट्रैजेक्टरीज) को खोजने और नवीन पथों को उत्पन्न करने के दो-चरणीय पाइपलाइन के माध्यम से लोकप्रिय पथ प्रश्नों को हल करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो व्यापक प्रशिक्षण की आवश्यकता वाले पारंपरिक तरीकों की तुलना में बेहतर सटीकता और लागत-प्रभावशीलता प्रदान करता है।

Md. Nazmul Islam Ananto, Shamit Fatin, Mohammed Eunus Ali, Md Rizwan Parvez2026-05-08
📊 statistics

On the optimization dynamics of RLVR: Gradient gap and step size thresholds

यह शोध पत्र "ग्रेडिएंट गैप" (Gradient Gap) को पेश करके 'वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (RLVR) के लिए एक सैद्धांतिक आधार स्थापित करता है ताकि अभिसरण गतिकी (convergence dynamics) की व्याख्या की जा सके और एक महत्वपूर्ण स्टेप-साइज़ थ्रेशोल्ड (step-size threshold) को व्युत्पन्न किया जा सके जो यह निर्धारित करता है कि सीखना सफल होगा या विफल, जिससे लेंथ नॉर्मलाइजेशन (length normalization) जैसे व्यावहारिक ह्यूरिस्टिक्स और सफलता दरों के ठहराव के लिए एक सिद्धांत-आधारित स्पष्टीकरण प्राप्त होता है।

Joe Suk, Yaqi Duan2026-05-08
🤖 AI

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

यह शोध पत्र मेमोरी-एज़-एक्शन (MemAct) का परिचय देता है, जो एक ऐसा ढांचा है जो वर्किंग मेमोरी प्रबंधन को सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से अनुकूलित सीखने योग्य नीतिगत कार्यों (learnable policy actions) के रूप में मानता है ताकि लंबी अवधि के एजेंटिक कार्यों के लिए कुशल, अनुकूलनीय संदर्भ क्यूरेशन (context curation) को सक्षम किया जा सके, जिससे बहुत बड़े मॉडलों की सटीकता प्राप्त करते हुए संदर्भ लंबाई को काफी कम किया जा सके।

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang2026-05-08
💬 NLP

Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production

यह शोध पत्र "कैच योर ब्रेथ" (CYB) को प्रस्तुत करता है, जो एक अनुक्रमिक निर्णय समस्या के रूप में फ्रेम किया गया एक सुपरवाइज्ड लॉस फंक्शन है जो फाउंडेशन मॉडल्स को इन्फरेंस के दौरान पॉज़ टोकन को स्वायत्त और अनुकूल रूप से सम्मिलित करने में सक्षम बनाता है ताकि कंप्यूट स्टेप्स को गतिशील रूप से आवंटित किया जा सके, जिससे बिना किसी कंप्यूटेशनल या मेमोरी लागत को बढ़ाए परप्लेक्सिटी और डाउनस्ट्रीम सटीकता में सुधार किया जा सके।

Alexandre Galashov, Matt Jones, Rosemary Ke, Yuan Cao, Vaishnavh Nagarajan, Michael C. Mozer2026-05-08
🤖 AI

Accelerating Discrete Facility Layout Optimization: A Hybrid CDCL and CP-SAT Architecture

यह शोध पत्र एक हाइब्रिड CDCL और CP-SAT आर्किटेक्चर प्रस्तुत करता है जो CDCL की बेहतर व्यवहार्यता पहचान गति (feasibility detection speed) का लाभ उठाकर CP-SAT के लिए वॉर्म-स्टार्ट संकेत (warm-start hints) प्रदान करता है, जिससे डिस्क्रिट फैसिलिटी लेआउट समस्याओं के लिए सटीक अनुकूलन (exact optimization) में महत्वपूर्ण रूप से तेजी आती है।

Joshua Gibson, Kapil Dhakal2026-05-08
🤖 machine learning

Generalised Linear Models in Deep Bayesian RL with Learnable Basis Functions

यह शोध पत्र GLiBRL प्रस्तुत करता है, जो एक नवीन डीप बेयसियन रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो पूर्णतः सुलभ बेयसियन अनुमान और सटीक मार्जिनल लाइकलीहुड मूल्यांकन प्राप्त करने के लिए सीखने योग्य बेसिस फंक्शन्स और जनरलाइज्ड लीनियर मॉडल्स का उपयोग करता है, जिससे पूर्ववर्ती विधियों की अस्पष्ट कार्य प्रस्तुतियों (task representations) पर विजय प्राप्त होती है और MuJoCo एवं MetaWorld बेंचमार्क पर अत्याधुनिक प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jingyang You, Hanna Kurniawati2026-05-08
🤖 AI

Mapping Human Anti-collusion Mechanisms to Multi-agent AI Systems

यह शोध पत्र मानव और एआई शासन के बीच के अंतर को पाटने के लिए मानव प्रति-मिलीभगत तंत्रों (anti-collusion mechanisms) का एक वर्गीकरण विकसित करता है और उन्हें मल्टी-एजेंट एआई प्रणालियों के विशिष्ट हस्तक्षेपों के साथ मैप करता है, साथ ही एट्रिब्यूशन, पहचान की तरलता और प्रतिकूल अनुकूलन जैसी प्रमुख चुनौतियों की पहचान भी करता है।

Jamiu Idowu, Ahmed Almasoud, Ayman Alfahid2026-05-08
🤖 AI

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

यह शोध पत्र ओवेन-शापली पॉलिसी ऑप्टिमाइज़ेशन (OSPO) को प्रस्तुत करता है, जो एक सिद्धांत-आधारित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो शापली-ओवेन एट्रिब्यूशंस का उपयोग करके अनुक्रम-स्तरीय पुरस्कारों को अर्थपूर्ण रूप से सुसंगत टोकन में पुनर्वितरित करके जेनेरेटिव सर्च LLMs में क्रेडिट असाइनमेंट अंतराल को संबोधित करता है, जिससे बिना किसी पैरामीट्रिक वैल्यू मॉडल की आवश्यकता के प्रदर्शन और मजबूती में सुधार होता है।

Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy2026-05-08
💬 NLP

Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-Blind

यह शोधपत्र 'कमीलिऑन' (Chameleon) डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडलों के साथ उपयोगकर्ता की अंतःक्रियाएं मुख्य रूप से निश्चित गुणों के बजाय प्रासंगिक स्थिति (contextual state) द्वारा संचालित होती हैं, जो यह प्रकट करता है कि वर्तमान मॉडल "स्टेट-ब्लाइंड" (state-blind) हैं जबकि रिवॉर्ड मॉडल उपयोगकर्ता की स्थितियों के प्रति असंगत रूप से प्रतिक्रिया करते हैं।

Tamunotonye Harry, Ivoline Ngong, Chima Nweke, Yuanyuan Feng, Joseph Near2026-05-08