🤖 machine learning

Hierarchical Reinforcement Learning for Sparse-Reward Search in Commutative Algebra

यह शोध पत्र कम्यूटेटिव अलजेब्रा में कालाई के बीजगणितीय हिरश अनुमान (Kalai's algebraic Hirsch conjecture) के लिए प्रति-उदाहरण (counterexamples) निर्मित करने की विरल-पुरस्कार (sparse-reward) चुनौती को प्रभावी ढंग से हल करने के लिए एक इक्विवेरिएंट ग्राफ न्यूरल नेटवर्क पॉलिसी के साथ एक कंस्ट्रेंड ऑप्शंस-आधारित पदानुक्रमित सुदृढीकरण शिक्षण (Hierarchical Reinforcement Learning) ढांचे का प्रस्ताव करता है, जो शास्त्रीय आरएल (RL) और ग्रीडी सर्च विधियों से बेहतर प्रदर्शन करता है।

Giorgi Butbaia, Paul Orland, Coco Huang, Davide Passaro, Lucas Fagan, Michele Tarquini, Hailong Dao, David Eisenbud, Ali (…)2026-06-23
🤖 machine learning

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE एक मेमोरी-कुशल LLM प्रशिक्षण विधि है जो ग्रेडिएंट्स को पूरी तरह से रजिस्टरों में प्रोसेस करके उन्हें भौतिक रूप से निर्मित (materialized) होने से बचाने के लिए बैकवर्ड पास में ऑप्टिमाइज़र स्टेप को फ्यूज करती है, जिससे ऑप्टिमाइज़र मेमोरी का आधा उपयोग होता है, प्रशिक्षण की गति बढ़ती है और अंतर्निहित अपडेट लॉजिक को बदले बिना पूर्ण-परिशुद्धता (full-precision) की सत्यनिष्ठा बनी रहती है।

Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi (…)2026-06-23
🤖 machine learning

Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently

यह शोध पत्र सैद्धांतिक रूप से सिद्ध करता है कि वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग (RLVR), रीजनिंग कार्यों में सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) से बेहतर प्रदर्शन करती है, क्योंकि यह मॉडल्स को डेड एंड्स (dead ends) से बैकट्रैकिंग कुशलतापूर्वक सीखने में सक्षम बनाती है, जिससे इन्फरेंस-टाइम कंप्यूट लागत में घातांकीय कमी आती है।

Stanley Wei, Juno Kim2026-06-23
🤖 machine learning

Neural Operator Processes for Probabilistic Operator Learning under Partial Observations

यह शोध पत्र न्यूरल ऑपरेटर प्रोसेसेज (NOPs) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो न्यूरल ऑपरेटरों के साथ न्यूरल प्रक्रियाओं को जोड़ता है ताकि स्थानीय ज्यामितीय संदर्भ को लेटेंट स्टोकेस्टिक वेरिएबल्स के साथ प्रभावी ढंग से एकीकृत करके विरल, आंशिक अवलोकनों से पूर्ण समाधान क्षेत्रों के संभाव्य पूर्वानुमान को सक्षम बनाया जा सके।

Jose Miguel Lara-Rangel, Serge Guillas2026-06-23
🤖 machine learning

DT-GOL: Dual-Track Geometric Online Learning in Nonstationary Environment with Label Delay

यह शोध पत्र DT-GOL का प्रस्ताव करता है, जो एक नवीन डुअल-ट्रैक फ्रेमवर्क है जो सक्रिय अनुकूलन के लिए अनिश्चितता-जागरूक सॉफ्ट लेबल उत्पन्न करने हेतु वास्तविक समय के टोपोलॉजिकल फीचर इवोल्यूशन का लाभ उठाकर नॉन-स्टेशनरी ऑनलाइन लर्निंग में लेबल लेटेंसी को संबोधित करता है, जिससे यह गतिशील वातावरण में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Yulin Wang, Yi He, Dianlong You, Di Wu2026-06-23
🤖 machine learning

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models

यह शोध पत्र PG-MAP को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो डिफ्यूजन और फ्लो-मैचिंग मॉडलों के लिए इन्फरेंस-टाइम अलाइनमेंट को बेहतर बनाता है, और यह प्रक्रिया को कंडीशनिंग और लेटेंट वेरिएबल्स पर एक संयुक्त गिब्स-MAP अनुकूलन (joint Gibbs-MAP optimization) के रूप में व्यवस्थित करके मौजूदा सिंगल-एक्सिस विधियों की तुलना में विभिन्न मेट्रिक्स और मानव मूल्यांकन में श्रेष्ठ प्रदर्शन प्राप्त करता है।

Ruolan Sun, Pawel Polak2026-06-23
🤖 machine learning

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

यह शोध पत्र 'इमेजिन-देन-एक्ट' (imagine-then-act) वर्ल्ड मॉडल्स में "ट्रस्टेड इमेजिनेशन" (trusted imagination) को एक महत्वपूर्ण भेद्यता के रूप में पहचानता है जहाँ हमलावर सुरक्षा प्रणालियों को बायपास करने और कार्यों को विफल करने के लिए भविष्य के लेटेंट ट्रेजेक्टरीज (latent trajectories) को आसानी से दूषित कर सकते हैं, और साथ ही एक पैरामीटर-मुक्त डीनॉइज़र डिटेक्टर (denoiser detector) प्रस्तावित करता है जो ऐसे ऑफ-मैनिफोल्ड (off-manifold) व्यवधानों के विरुद्ध पूर्ण पहचान प्राप्त करता है।

Linghan Chen, Kaiyan Ji, Minyu Guo2026-06-23
🌀 nonlinear sciences

Topological Out-of-Domain Generalization in Dynamical Systems Reconstruction

यह शोध पत्र संरचनात्मक बेमेल (structural mismatches) की पहचान करके, फीचर स्प्लिटिंग और एक क्लोज्ड-फॉर्म एक्सट्रपलेशन बाउंड का प्रस्ताव देकर और टिपिंग पॉइंट्स के पार सटीक ज़ीरो-शॉट भविष्यवाणियों का प्रदर्शन करके, आउट-ऑफ-डोमेन सामान्यीकरण में वर्तमान डायनामिकल सिस्टम पुनर्निर्माण मॉडलों की सीमाओं को संबोधित करता है।

Georg Trede, Charlotte Ricarda Doll, Elias Weber, Daniel Durstewitz2026-06-23
🤖 machine learning

Understanding Parallel Samplers in Masked Diffusion via Random Walks on Graphs

यह शोधपत्र ग्राफ पर रैंडम वॉक को मास्क्ड डिफ्यूजन मॉडल्स में समानांतर सैंपलिंग रणनीतियों का विश्लेषण करने के लिए एक नियंत्रणीय, सत्यापन योग्य बेंचमार्क के रूप में प्रस्तुत करता है, जो यह प्रकट करता है कि इष्टतम सैंपलिंग विधियाँ ग्राफ संरचना पर निर्भर करती हैं और यह प्रदर्शित करता है कि एक नया 'बाइसेक्शन सैंपलर' बेहतर गति-गुणवत्ता ट्रेडऑफ़ के साथ प्रमाणिक सटीक, लॉगरिदमिक-स्टेप जनरेशन प्राप्त करता है।

Vansh Bansal, Cho Cholyeon, Syamantak Kumar, Sujay Sanghavi, Purnamrita Sarkar2026-06-23
🔬 condensed matter

Scalable Physics-Inspired Transformers for Spin Glasses

यह शोधपत्र एक स्केलेबल, भौतिकी-प्रेरित ट्रांसफॉर्मर प्रस्तुत करता है जिसमें व्याख्यात्मक स्पार्स अटेंशन और विशिष्ट पोजीशनल एम्बेडिंग्स हैं, जो मौजूदा वेरिएशनल ऑटोरेग्रेसिव नेटवर्क की तुलना में 100 गुना तक अधिक गति प्राप्त करता है, जिससे एक एकल GPU पर बड़े पैमाने के फ्रस्ट्रेटेड स्पिन-ग्लास सिस्टम के लिए बोल्ट्ज़मैन वितरण के कुशल सैंपलिंग और ऊष्मप्रवैगिकी गुणों के सटीक समाधान को सक्षम बनाया जा सके।

Lu Zhong, Wenli Duan, Jing Liu, Pan Zhang, Ying Tang2026-06-23