🤖 machine learning

When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning

यह शोध पत्र सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) में एडवरसेरियल एक्शन मास्किंग (adversarial action masking) की जांच करता है, यह प्रदर्शित करते हुए कि वैध क्रियाओं को चुनिंदा रूप से हटाना गड़बड़ी (perturbations) की तुलना में काफी अधिक नुकसान पहुंचाता है, विविध एल्गोरिदम और डोमेन में बना रहता है, और बिना सुधार की अनुमति दिए उच्च-मूल्य वाले निर्णय बिंदुओं का लाभ उठाता है।

Arahan Kujur2026-05-19
🤖 machine learning

A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning

यह शोध पत्र यह प्रदर्शित करता है कि स्व-खेल सुदृढीकरण शिक्षण (self-play reinforcement learning) एजेंट केवल तभी लगभग-अधिकतम हानि (near-maximal loss) में एक तीव्र, प्रतिवर्ती पतन (reversible collapse) का अनुभव करते हैं जब सभी सकारात्मक-पहुंच आकस्मिक निर्णयों (positive-reach contingent decisions) को समाप्त कर दिया जाता है, जो एक संरचनात्मक सीमा स्थापित करता है जहाँ एक भी ऐसे निर्णय को संरक्षित करना बाधा के तहत सह-अनुकूलन (co-adaptation under constraint) द्वारा संचालित विनाशकारी अभिसरण (catastrophic convergence) को रोकता है।

Arahan Kujur2026-05-19✓ Author reviewed
🧬 biology

A Machine Learning Framework for EEG-Based Prediction of Treatment Efficacy in Chronic Neck Pain

यह शोधपत्र एक मशीन लर्निंग फ्रेमवर्क प्रस्तुत करता है जो क्रोनिक नेक पेन (पुराने गर्दन के दर्द) वाले रोगियों में उपचार की प्रभावकारिता का पूर्वानुमान लगाने और व्यक्तिगत चिकित्सा चयन में सहायता करने के लिए, एक व्यापक साहित्य समीक्षा से सूचित, EEG और EMG डेटा के कठोर, मोडैलिटी-विशिष्ट प्रीप्रोसेसिंग का उपयोग करता है।

Xiru Wang, Aiden Li, Hongzhao Tan, Stevie Foglia, Aimee Nelson, Zhen Gao2026-05-19
🧬 biology

Retrieval and competition: how a protein foundation model starts a protein

यह शोध पत्र प्रकट करता है कि ESM2-8M प्रोटीन लैंग्वेज मॉडल मेथियोनी इनिशिएशन (methionine initiation) के सार्वभौमिक जैविक नियम की भविष्यवाणी सीधे मास्क किए गए अवशेष (masked residue) की प्रत्यक्ष पहचान के माध्यम से नहीं, बल्कि एक जटिल, वितरित कम्प्यूटेशनल सर्किट के माध्यम से एक सांख्यिकीय पूर्व ज्ञान (statistical prior) को पुनः प्राप्त करके करता है, जिससे यह सिद्ध होता है कि उच्च मॉडल आत्मविश्वास वास्तविक जैविक साक्ष्य के बजाय सांख्यिकीय डिफ़ॉल्ट्स को प्रतिबिंबित कर सकता है।

Piotr Jedryszek, Oliver M. Crook2026-05-19
🤖 machine learning

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

DACA-GRRO, डैनोइजिंग प्रोग्रेस स्कोर्स (Denoising Progress Scores) और स्ट्रैटिफाइड मास्किंग लाइकलीहुड (Stratified Masking Likelihood) को पेश करके डिफ्यूजन लैंग्वेज मॉडल्स के लिए मौजूदा सुदृढीकरण शिक्षण (reinforcement learning) विधियों की सीमाओं को संबोधित करता है ताकि टेम्पोरल क्रेडिट असाइनमेंट को सक्षम किया जा सके और मीन-फील्ड बायस (mean-field bias) को कम किया जा सके, जिसके परिणामस्वरूप विविध रीजनिंग और जनरेशन बेंचमार्क में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belous (…)2026-05-19
🤖 machine learning

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

यह शोध पत्र गोल-कंडीशन्ड सुपरवाइज्ड लर्निंग (GCSL) प्रस्तुत करता है, जो एक कुशल ऑफलाइन फाइन-ट्यूनिंग फ्रेमवर्क है जो फीडबैक संकेतों को स्पष्ट लक्ष्यों के रूप में मानता है और बड़े भाषा मॉडलों (LLMs) को गुणवत्ता थ्रेशोल्ड को लगातार प्राप्त करने के लिए निर्देशित करने हेतु प्राकृतिक भाषा का लाभ उठाता है, जिससे यह ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) की उच्च लागतों से बचते हुए मानक सुपरवाइज्ड विधियों से बेहतर प्रदर्शन करता है।

Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh2026-05-19
🤖 machine learning

Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field

फ्लो-डायरेक्ट (Flow-Direct) एक प्रशिक्षण-मुक्त ढांचा है जो संचित रिवॉर्ड-मूल्यांकित नमूनों से एक निरंतर, गैर-पैरामीट्रिक मार्गदर्शन क्षेत्र का निर्माण करके फ्लो मॉडलों में फीडबैक दक्षता और पुन: प्रयोज्यता को बढ़ाता है, जिससे किसी भी रिवॉर्ड जानकारी को छोड़े बिना पूर्व-प्रशिक्षित वितरणों को लक्षित वितरणों में विश्लेषणात्मक रूप से स्थानांतरित किया जा सकता है।

Kim Yong Tan, Yueming Lyu, Ivor Tsang, Yew-Soon Ong2026-05-19
🤖 machine learning

Federated Nested Learning: Collaborative Training of Self-Referential Memories for Test-Time Adaptation

यह शोध पत्र फेडरेटेड नेस्टेड लर्निंग (FedNL) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो फेडरेटेड लर्निंग को तीन-स्तरीय नेस्टेड अनुकूलन प्रणाली के रूप में पुनर्गठित करता है ताकि अनुकूलन नियमों को सहयोगात्मक रूप से सीखा जा सके, जिससे क्लाइंट्स को नॉन-आईआईडी (Non-IID) डेटा पर स्थिर अनुमान मेमोरी के साथ हल्का, ज़ीरो-शॉट टेस्ट-टाइम अनुकूलन करने में सक्षम बनाया जा सके।

Hong Chen, Pengcheng Wu, Yuanguo Lin, Peilin Zhao, Xiuze Zhou, Fan Lin, Han Yu2026-05-19
🤖 machine learning

PIMSM: Physics-Informed Multi-Scale Mamba for Stable Neural Representations under Distribution Shift

यह शोध पत्र फिजिक्स-इन्फॉर्म्ड मल्टी-स्केल माम्बा (PIMSM) का प्रस्ताव करता है, जो एक स्टेट-स्पेस आर्किटेक्चर है जो टेम्पोरल कर्नेल मिसमैच (temporal kernel mismatch) को दूर करने के लिए मॉडल डिस्क्रीटाइजेशन को भौतिक टाइमस्केल्स के साथ संरेखित करता है, जिससे गंभीर वितरण बदलावों (distribution shifts) के तहत वैज्ञानिक टाइम सीरीज़ के लिए सुदृढ़ और स्थिर न्यूरल रिप्रजेंटेशन प्राप्त होता है।

Sangyoon Bae, Shinjae Yoo, Jiook Cha2026-05-19
⚡ electrical engineering

Learning Displacement-Aware WiFi Representations for Weakly Supervised Relative Localization

यह शोध पत्र इंटरसेक्शन पाथवे (IP) का प्रस्ताव करता है, जो एक कमजोर रूप से पर्यवेक्षित क्रॉस-मोडल लर्निंग फ्रेमवर्क है जो सघन समन्वय एनोटेशन की आवश्यकता के बिना सटीक सापेक्ष इनडोर स्थानीयकरण के लिए विस्थापन-जागरूक प्रतिनिधित्व सीखने हेतु वाई-फाई फिंगरप्रिंट ट्रेस को जड़त्वीय गति वेक्टर्स के साथ संरेखित करता है।

Tzu-Ti Wei, Po-Cheng Chen, Yu-Chee Tseng, Jen-Jee Chen2026-05-19