🤖 machine learning

Dynamic Relational Priming Improves Transformer in Multivariate Time Series

यह शोध पत्र "प्राइम अटेंशन" (prime attention) को प्रस्तुत करता है, जो एक नवीन तंत्र है जो विविध इंटर-चैनल निर्भरताओं को पकड़ने के लिए टोकन रिप्रजेंटेशन को गतिशील रूप से मॉड्युलेट करके मल्टीवेरिएट टाइम सीरीज़ फोरकास्टिंग को बढ़ाता है, और समान कम्प्यूटेशनल जटिलता बनाए रखते हुए मानक स्टेटिक अटेंशन की तुलना में बेहतर सटीकता और दक्षता प्राप्त करता है।

Hunjae Lee, Corey Clark2026-05-26
🤖 machine learning

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

यह शोध पत्र OpenAI के GPT-4o mini में एक महत्वपूर्ण "यूनिमोडल बॉटलनेक" (Unimodal Bottleneck) की पहचान करता है, जहाँ संदर्भ-अंध (context-blind) सुरक्षा फ़िल्टर केवल पृथक दृश्य या पाठ्य संकेतों के आधार पर हानिकारक और निर्दोष दोनों प्रकार की मल्टीमॉडल सामग्री को अंधाधुंध रूप से रोक देते हैं, जिससे मॉडल की उन्नत तर्क क्षमताओं में बाधा आती है और अधिक एकीकृत संरेखण रणनीतियों की आवश्यकता पर बल मिलता है।

Niruthiha Selvanayagam, Ted Kurti2026-05-26
🤖 machine learning

Nonconvex Decentralized Stochastic Bilevel Optimization under Heavy-Tailed Noise

यह शोधपत्र भारी-पूंछ वाले शोर (heavy-tailed noise) के तहत गैर-उत्तल (nonconvex) समस्याओं के लिए कठोर सैद्धांतिक गारंटियों के साथ पहला विकेंद्रीकृत स्टोकेस्टिक बाइलेवल ऑप्टिमाइज़ेशन एल्गोरिदम प्रस्तावित करता है, जो एक नवीन सामान्यीकृत वेरिएंस-रिड्यूस्ड ग्रेडिएंट डिसेंट पद्धति का उपयोग करता है जो ग्रेडिएंट क्लिपिंग की आवश्यकता को समाप्त करता है।

Xinwen Zhang, Yihan Zhang, Heng Liang, Hongchang Gao2026-05-26
🤖 machine learning

Fine-Tuning Masked Diffusion for Provable Self-Correction

यह शोध पत्र PRISM को प्रस्तुत करता है, जो एक हल्का और मॉडल-अज्ञेय (model-agnostic) तरीका है जो अनुमान (inference) के दौरान प्रति-टोकन गुणवत्ता स्कोर की गणना करके प्रीट्रेंड मास्क्ड डिफ्यूजन मॉडल्स के लिए प्रमाणिक स्व-सुधार (provable self-correction) सक्षम बनाता है, ताकि बिना किसी आर्किटेक्चरल परिवर्तन, सुदृढीकरण शिक्षण (reinforcement learning), या बाहरी सत्यापनकर्ताओं (external verifiers) के कम गुणवत्ता वाले टोकन का पता लगाया जा सके और उन्हें संशोधित किया जा सके।

Jaeyeon Kim, Seunggeun Kim, Taekyun Lee, David Z. Pan, Hyeji Kim, Sham Kakade, Sitan Chen2026-05-26
🤖 machine learning

XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation

XRPO एक एकीकृत ढांचा है जो लक्षित अन्वेषण (exploration) के लिए एक अनुकूली रोलआउट आवंटक (adaptive rollout allocator) और बेहतर शोषण (exploitation) के लिए एक नवीनता-जागरूक लाभ तीक्ष्णता तंत्र (novelty-aware advantage sharpening mechanism) को पेश करके बड़े भाषा मॉडलों के लिए GRPO-आधारित सुदृढीकरण लर्निंग (reinforcement learning) को बढ़ाता है, जिसके परिणामस्वरूप गणित और कोडिंग बेंचमार्क पर उत्कृष्ट प्रदर्शन और तेज़ अभिसरण (convergence) प्राप्त होता है।

Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai2026-05-26
🤖 machine learning

Test-Time Graph Search for Goal-Conditioned Reinforcement Learning

यह शोध पत्र टेस्ट-टाइम ग्राफ सर्च (TTGS) को प्रस्तुत करता है, जो एक हल्का, प्रशिक्षण-मुक्त प्लानिंग रैपर है जो बिना किसी अतिरिक्त पर्यवेक्षण या पैरामीटर अपडेट की आवश्यकता के, लंबी अवधि के कार्यों पर सफलता दर में नाटकीय रूप से सुधार करने के लिए मौजूदा ऑफलाइन गोल-कंडीशन्ड आरएल (RL) पॉलिसियों की अंतर्निहित ज्यामितीय संरचना का लाभ उठाता है।

Evgenii Opryshko, Junwei Quan, Claas Voelcker, Yilun Du, Igor Gilitschenski2026-05-26✓ Author reviewed
🤖 machine learning

DeepEN: A Deep Reinforcement Learning Framework for Personalized Enteral Nutrition in Critical Care

DeepEN एक नवीन ऑफलाइन रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जिसे 11,000 से अधिक आईसीयू रोगियों पर प्रशिक्षित किया गया है जो व्यक्तिगत, सुरक्षित एंटरल न्यूट्रिशन सिफारिशें उत्पन्न करता है, जो मानक नैदानिक अभ्यास की तुलना में बेहतर चयापचय स्थिरता और मृत्यु दर में 4.0% की कमी प्रदर्शित करता है।

Daniel Jason Tan, Jiayang Chen, Dilruk Perera, Kay Choong See, Mengling Feng2026-05-26
💬 NLP

Agent Learning via Early Experience

यह शोध पत्र "अर्ली एक्सपीरियंस" (early experience) को प्रस्तुत करता है, जो एक ऐसा प्रतिमान (paradigm) है जहाँ भाषा एजेंट निहित विश्व मॉडलिंग (implicit world modeling) और आत्म-चिंतन (self-reflection) के माध्यम से स्पष्ट पुरस्कार संकेतों के बिना अपने स्वयं के इंटरेक्शन डेटा से सीखते हैं, जो सुपरवाइज्ड फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग के बीच के अंतर को पाटते हुए बेहतर प्रभावशीलता और सामान्यीकरण का प्रदर्शन करता है।

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu (…)2026-05-26
🤖 machine learning

ΔEnergy\Delta \mathrm{Energy}: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

यह शोध पत्र Δ\DeltaEnergy प्रस्तुत करता है, जो विजन-लैंग्वेज अलाइनमेंट के दौरान ऊर्जा परिवर्तनों से प्रेरित एक नवीन OOD स्कोर है, और एक संबंधित फाइन-ट्यूनिंग फ्रेमवर्क (EBM) भी प्रस्तुत करता है जो विजन-लैंग्वेज मॉडल्स में आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन और जनरलाइजेशन को एक साथ बढ़ाता है, जिससे मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye2026-05-26
💬 NLP

False Fixed Points: Kantian Feedback, Stable Miscalibration, and Representational Compression in LLMs

यह शोध पत्र इस विचार को चुनौती देता है कि लार्ज लैंग्वेज मॉडल्स में उच्च-विश्वास वाली त्रुटियाँ केवल क्षणिक विफलताएँ हैं, यह प्रदर्शित करते हुए कि वे स्थिर, आंतरिक रूप से सुसंगत "फॉल्स फिक्स्ड पॉइंट्स" (false fixed points) हो सकती हैं जहाँ मजबूती (robustness), सत्य-अनुसरण (truth-tracking) से विचलित हो जाती है, जो उच्च सिग्नल-टू-नॉइज़ जड़ता (high signal-to-noise inertia) और रिप्रजेंटेशनल कम्प्रेशन (representational compression) जैसी प्रक्रियाओं द्वारा संचालित एक घटना है।

Akira Okutomi2026-05-26