📊 statistics

Latent Process Generator Matching

यह शोध पत्र लेटेंट प्रोसेस जनरेटर मैचिंग (Latent Process Generator Matching) प्रस्तुत करता है, जो एक सामान्य ढांचा है जो प्रेक्षित जनरेटिव अवस्थाओं को सुलभ मार्कोव प्रक्रियाओं के नियतात्मक प्रक्षेपों (deterministic projections) के रूप में मॉडल करता है, जिससे जनरेटर मैचिंग को स्थिर लेटेंट वेरिएबल्स से समय-निर्भर लेटेंट कंडिशनल प्रक्रियाओं तक विस्तारित किया जाता है और यह सुनिश्चित किया जाता है कि सीखा गया जनरेटर लक्षित मार्जिनल वितरणों से मेल खाता है।

Lukas Billera, Hedwig Nora Nordlinder, Ben Murrell2026-05-21
📊 statistics

Spectral bandits for smooth graph functions with applications in recommender systems

यह शोध पत्र स्मूथ ग्राफ फंक्शन्स के लिए स्पेक्ट्रल बैंडिट्स की अवधारणा प्रस्तुत करता है, जिसमें दो कुशल एल्गोरिदम का प्रस्ताव दिया गया है जो संचयी रिग्रेट (cumulative regret) को कम करने के लिए एक छोटे प्रभावी आयाम (effective dimension) का लाभ उठाते हैं, जैसे कि कंटेंट-आधारित अनुशंसा (content-based recommendation) जैसी ऑनलाइन लर्निंग समस्याएं, जहाँ वस्तुओं की रेटिंग ग्राफ पर उनके पड़ोसियों के समान होती है।

Tomáš Kocák, Michal Valko, Rémi Munos, Branislav Kveton, Shipra Agrawal2026-05-21
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

यह शोध पत्र बड़े भाषा मॉडलों के लिए एक नवीन पोस्ट-ट्रेनिंग पद्धति प्रस्तुत करता है जो एक फ्रोजन SFT संदर्भ नीति और एक प्रशिक्षण योग्य नीति के लॉजिट्स (logits) का औसत निकालकर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) को बेहतर बनाती है, जिससे KL रेगुलराइजेशन या क्रिटिक की आवश्यकता समाप्त हो जाती है और प्रभावी रूप से RL की तर्क क्षमताओं को SFT की फॉर्मेटिंग स्थिरता के साथ जोड़ा जाता है।

Xingwei Gan, Ying Zhu2026-05-21
📊 statistics

Group-Aware Matrix Estimation and Latent Subspace Recovery

यह शोध पत्र ग्रुप-अवेयर मैट्रिक्स एस्टिमेशन (GAME) प्रस्तुत करता है, जो एक उत्तल (convex) एस्टिमेटर है जो विषम मैट्रिक्स पूर्णता समस्याओं में उपसमूह-विशिष्ट लेटेंट संरचनाओं को पुनः प्राप्त करने के लिए ओवरलैपिंग न्यूक्लियर-नॉर्म दंडों का उपयोग करता है, जो विशेष रूप से संरचित मिसिंगनेस और विशिष्ट लो-रैंक ग्रुप वेरिएशन्स वाले परिदृश्यों में मानक विधियों की तुलना में बेहतर पुनर्निर्माण सटीकता और सबस्पेस फिडेलिटी प्रदर्शित करता है।

Hamza Golubovic, Matthew Shen, Genevera I. Allen, Tarek M. Zikry2026-05-21
💬 NLP

Multi-agent Collaboration with State Management

यह शोधपत्र STORM को प्रस्तुत करता है, जो एक स्टेट-ओरिएंटेड (state-oriented) प्रबंधन ढांचा है जो कोडिंग बेंचमार्क पर पारंपरिक वर्कस्पेस आइसोलेशन बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हुए और साझा कोडबेस के सुसंगत दृश्यों को सुनिश्चित करते हुए, राइट टाइम (write time) पर कोड संघर्षों का पता लगाने और उन्हें हल करने के लिए मल्टी-एजेंट इंटरैक्शन को मध्यस्थता प्रदान करता है।

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong2026-05-21
💻 computer science

Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX

यह शोध पत्र Mahjax को प्रस्तुत करता है, जो JAX में निर्मित एक पूर्णतः वेक्टरकृत (fully vectorized), GPU-त्वरितित (GPU-accelerated) रीची माजों (Riichi Mahjong) वातावरण है जो प्रति सेकंड 2 मिलियन स्टेप्स तक के थ्रूपुट के साथ बड़े पैमाने पर सुदृढीकरण शिक्षण (reinforcement learning) को सक्षम बनाता है, जिससे मानव खेल लॉग्स पर निर्भरता के बिना एजेंटों को शून्य से प्रशिक्षित करना सुलभ होता है।

Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama2026-05-21
🤖 machine learning

Deep Learning Surrogates for Emulating Stochastic Climate Tipping Dynamics

यह शोध पत्र एक डायनेमिक्स-इन्फॉर्म्ड टेम्पोरल फ्यूजन ट्रांसफार्मर सरोगेट प्रस्तुत करता है जो पारंपरिक अर्थ सिस्टम सिमुलेशन की तुलना में 465x कम्प्यूटेशनल स्पीडअप प्राप्त करता है और साथ ही अटलांटिक और प्रशांत महासागर परिवहन टिपिंग घटनाओं के समय और स्टोकेस्टिक अनिश्चितता का सटीक पूर्वानुमान लगाता है।

Adeline Hillier, Jennifer Sleeman, Jay Brett, Caroline Tang, Jenelle Millison, Anand Gnanadesikan2026-05-21
🔬 materials science

TriForces: Augmenting Atomistic GNNs for Transferable Representations

TriForces एक मॉडल-अज्ञेय (model-agnostic), तीन-धाराओं वाला ढांचा है जो मशीन लर्निंग इंटरएटोमिक पोटेंशियल के लिए एटोमिस्टिक ग्राफ न्यूरल नेटवर्क की स्थानांतरणीयता (transferability) और डेटा दक्षता को महत्वपूर्ण रूप से बढ़ाने के लिए पृथक संरचना और संरचनात्मक निरूपणों के साथ स्व-पर्यवेक्षित शिक्षण (self-supervised learning) को जोड़ता है।

Ali Ramlaoui, Alexandre Duval, Hannah Bull, Victor Schmidt, Hugues Talbot, Fragkiskos D. Malliaros, Joseph Musielewicz2026-05-21
🤖 machine learning

Unsupervised clustering and classification of upper limb EMG signals during functional movements: a data-driven

यह अध्ययन एक व्यापक, डेटा-संचालित पाइपलाइन प्रस्तुत करता है जो कार्यात्मक ऊपरी-अंग की गतिविधियों के दौरान मायोइलेक्ट्रिक प्रोस्थेसिस के वास्तविक समय के नियंत्रण के लिए इष्टतम सिग्नल प्रोसेसिंग मापदंडों और मजबूत क्लासिफायर (विशेष रूप से आर्टिफिशियल न्यूरल नेटवर्क और एक्स्ट्रा ट्रीज़) की पहचान करने हेतु NINAPRO DB4 डेटासेट पर पदानुक्रमित क्लस्टरिंग (hierarchical clustering) और फीचर सिलेक्शन का उपयोग करता है।

L. F. Salazar Álvarez, D. Escobar-Saltarén, M. B. Salazar Sánchez, S. C. Henao-Aguirre2026-05-21
💬 NLP

Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies

यह शोध पत्र इस धारणा को चुनौती देता है कि स्व-प्रशिक्षण (self-training) केवल भाषा को सपाट बनाता है, बल्कि यह प्रदर्शित करता है कि इसके बजाय यह एक विषम पतन (asymmetric collapse) के माध्यम से इसे पुनर्गठित करता है जहाँ गहरे वाक्य संरचनात्मक लक्षण क्षय होते हैं जबकि सतही संकेतक प्रवर्धित होते हैं, एक ऐसी घटना जिसे संरचनात्मक गहराई परिकल्पना (Structural Depth Hypothesis) के रूप में औपचारिक रूप दिया गया है।

Ming Liu2026-05-21