🤖 machine learning

MCQ Difficulty Prediction via Modeling Learner Heterogeneity Using Data-Driven Cognitive Profiling

यह शोध पत्र एक व्यक्तित्व-संचालित ढांचे का प्रस्ताव करता है जो विविध प्रतिक्रिया पैटर्न को सिम्युलेट करने के लिए एक लार्ज लैंग्वेज मॉडल को अनुकूलित करने हेतु छात्र व्यवहारिक व्यक्तित्वों की पहचान करने के लिए लेटेंट क्लास एनालिसिस का लाभ उठाता है, जिससे उन विधियों की तुलना में बहुविकल्पीय प्रश्नों की कठिनाई के पूर्वानुमान में महत्वपूर्ण सुधार होता है जो एकदिशीय क्षमता वितरण (unimodal ability distributions) मानती हैं।

Dhriti Krishnan, Jaromir Savelka2026-05-19
🤖 machine learning

ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning

ANNEAL एक न्यूरो-सिम्बोलिक एजेंट है जो फाउंडेशन मॉडल के भार (weights) को संशोधित किए बिना, विफलताओं को एक सिम्बोलिक प्रोसेस नॉलेज ग्राफ के नियंत्रित और सत्यापित संवर्द्धनों (edits) में परिवर्तित करके, बार-बार होने वाली निष्पादन त्रुटियों के सुरक्षित और निरंतर उन्मूलन को सुनिश्चित करता है।

Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song2026-05-19
🤖 machine learning

SignMuon: Communication-Efficient Distributed Muon Optimization

SignMuon एक संचार-कुशल, 1-बिट वितरित ऑप्टिमाइज़र है जो बड़े पैमाने पर न्यूरल नेटवर्क प्रशिक्षण में अत्याधुनिक सटीकता और महत्वपूर्ण बैंडविड्थ कमी प्राप्त करने के लिए Muon के मैट्रिक्स-अवेयर पोलर-स्टेप फ्रेमवर्क को signSGD के मेजॉरिटी-वोट एग्रीगेशन के साथ जोड़ता है।

Neel Mishra, Kushagara Trivedi, Pawan Kumar2026-05-19
🤖 machine learning

When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning

यह शोध पत्र सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) में एडवरसेरियल एक्शन मास्किंग (adversarial action masking) की जांच करता है, यह प्रदर्शित करते हुए कि वैध क्रियाओं को चुनिंदा रूप से हटाना गड़बड़ी (perturbations) की तुलना में काफी अधिक नुकसान पहुंचाता है, विविध एल्गोरिदम और डोमेन में बना रहता है, और बिना सुधार की अनुमति दिए उच्च-मूल्य वाले निर्णय बिंदुओं का लाभ उठाता है।

Arahan Kujur2026-05-19
🤖 machine learning

A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning

यह शोध पत्र यह प्रदर्शित करता है कि स्व-खेल सुदृढीकरण शिक्षण (self-play reinforcement learning) एजेंट केवल तभी लगभग-अधिकतम हानि (near-maximal loss) में एक तीव्र, प्रतिवर्ती पतन (reversible collapse) का अनुभव करते हैं जब सभी सकारात्मक-पहुंच आकस्मिक निर्णयों (positive-reach contingent decisions) को समाप्त कर दिया जाता है, जो एक संरचनात्मक सीमा स्थापित करता है जहाँ एक भी ऐसे निर्णय को संरक्षित करना बाधा के तहत सह-अनुकूलन (co-adaptation under constraint) द्वारा संचालित विनाशकारी अभिसरण (catastrophic convergence) को रोकता है।

Arahan Kujur2026-05-19✓ Author reviewed
🤖 machine learning

Investigating Action Encodings in Recurrent Neural Networks in Reinforcement Learning

यह शोध पत्र इस बात की जांच करता है कि रिकरेंट न्यूरल नेटवर्क के स्टेट अपडेट फंक्शन में एक्शन सूचना को शामिल करने की विभिन्न विधियां सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) प्रदर्शन को कैसे प्रभावित करती हैं, जो अनुभवजन्य मूल्यांकन प्रस्तुत करता है और भविष्य की डिजाइन चुनौतियों पर चर्चा करता है।

Matthew Schlegel, Volodymyr Tkachuk, Adam White, Martha White2026-05-19
🧬 biology

A Machine Learning Framework for EEG-Based Prediction of Treatment Efficacy in Chronic Neck Pain

यह शोधपत्र एक मशीन लर्निंग फ्रेमवर्क प्रस्तुत करता है जो क्रोनिक नेक पेन (पुराने गर्दन के दर्द) वाले रोगियों में उपचार की प्रभावकारिता का पूर्वानुमान लगाने और व्यक्तिगत चिकित्सा चयन में सहायता करने के लिए, एक व्यापक साहित्य समीक्षा से सूचित, EEG और EMG डेटा के कठोर, मोडैलिटी-विशिष्ट प्रीप्रोसेसिंग का उपयोग करता है।

Xiru Wang, Aiden Li, Hongzhao Tan, Stevie Foglia, Aimee Nelson, Zhen Gao2026-05-19
🤖 machine learning

Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization

यह शोध पत्र पहचानता है कि Dion ऑप्टिमाइज़र का धीमा अभिसरण (convergence) कॉलम नॉर्मलाइजेशन के कारण उत्पन्न ज्यामितीय बेमेल (geometric mismatch) से उपजा है, और Orth-Dion का प्रस्ताव करता है, जो इस बेमेल को समाप्त करने और संचार लागत बढ़ाए बिना फुल-रैंक स्पेक्ट्रल विधियों के समान अभिसरण दर प्राप्त करने के लिए QR ऑर्थोगोनलाइजेशन का उपयोग करने वाली एक विधि है।

Tatsuhiro Nakamori, Laura Gomezjurado Gonzalez, Ganesh Talluri, Ansh Tiwari, Hideyuki Kawashima, Ioannis Mitliagkas, Gui (…)2026-05-19
🤖 machine learning

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

DACA-GRRO, डैनोइजिंग प्रोग्रेस स्कोर्स (Denoising Progress Scores) और स्ट्रैटिफाइड मास्किंग लाइकलीहुड (Stratified Masking Likelihood) को पेश करके डिफ्यूजन लैंग्वेज मॉडल्स के लिए मौजूदा सुदृढीकरण शिक्षण (reinforcement learning) विधियों की सीमाओं को संबोधित करता है ताकि टेम्पोरल क्रेडिट असाइनमेंट को सक्षम किया जा सके और मीन-फील्ड बायस (mean-field bias) को कम किया जा सके, जिसके परिणामस्वरूप विविध रीजनिंग और जनरेशन बेंचमार्क में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belous (…)2026-05-19
🤖 machine learning

A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems

यह शोध पत्र PRL-PUTS को प्रस्तुत करता है, जो एक प्रोडक्शन-रेडी, रँकर-स्वतंत्र सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो पिंटरेस्ट के होमफीड में मल्टी-ऑब्जेक्टिव ट्रेड-ऑफ्स को गतिशील रूप से अनुकूलित करने के लिए पारेटो स्वीपिंग के माध्यम से व्यक्तिगत उपयोगिता-भार (यूटिलिटी-वेट) ट्यूनिंग को स्वचालित करता है, जिसके परिणामस्वरूप बिना किसी सर्विंग लेटेंसी को बढ़ाए महत्वपूर्ण जुड़ाव (एंगेजमेंट) में सुधार होता है।

Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Ba (…)2026-05-19