🤖 machine learning

Alignment-Aware Decoding

यह शोध पत्र एलाइनमेंट-अवेयर डिकोडिंग (AAD) प्रस्तुत करता है, जो एक इन्फरेंस-टाइम विधि है जो बिना किसी विशेष प्रशिक्षण की आवश्यकता के निहित रिवॉर्ड ऑप्टिमाइज़ेशन के माध्यम से लार्ज लैंग्वेज मॉडल एलाइनमेंट को बढ़ाता है, साथ ही डेटा-सीमित सेटिंग्स में एलाइनमेंट सुधारने के लिए उच्च-गुणवत्ता वाले सिंथेटिक डेटा के निर्माण को भी सक्षम बनाता है।

Frédéric Berdoz, Luca A. Lanzendörfer, René Caky, Roger Wattenhofer2026-06-03
⚡ electrical engineering

DeMuon: A Decentralized Muon for Matrix Optimization over Graphs

यह शोधपत्र DeMuon को प्रस्तुत करता है, जो Muon ऑप्टिमाइज़र का पहला विकेंद्रीकृत विस्तार है जो संचार ग्राफ़ (communication graphs) पर मैट्रिक्स अनुकूलन के लिए न्यूटन-शुल्ज़ ऑर्थोगोनालाइज़ेशन (Newton-Schulz orthogonalization) को ग्रेडिएंट ट्रैकिंग के साथ जोड़ता है ताकि भारी-पूंछ वाले शोर (heavy-tailed noise) की स्थितियों में भी प्रमाणित अभिसरण (provable convergence) और उत्कृष्ट प्रदर्शन प्राप्त किया जा सके।

Chuan He, Shuyi Ren, Jingwei Mao, Erik G. Larsson2026-06-03
🤖 AI

Fusing Multi- and Hyperspectral Satellite Data for Harmful Algal Bloom Monitoring with Self-Supervised and Hierarchical Deep Learning

यह शोधपत्र SIT-FUSE को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) डीप लर्निंग फ्रेमवर्क है जो हानिकारक शैवाल प्रस्फुटन (algal blooms) की गंभीरता और प्रजाति के निर्धारण के लिए मल्टी- और हाइपरस्पेक्ट्रल उपग्रह डेटा को संलयित (fuse) करता है, जिसके लिए प्रति-उपकरण लेबल वाले डेटासेट की आवश्यकता नहीं है, जो इन-सीटू (in-situ) मापों के साथ मजबूत सहमति प्रदर्शित करता है और स्केलेबल वैश्विक निगरानी को सक्षम बनाता है।

Nicholas LaHaye, Kelly M. Luis, Michelle M. Gierach2026-06-03
🤖 AI

The View From Space: Navigating Instrumentation Differences with EOFMs

यह शोध पत्र प्रदर्शित करता है कि अर्थ ऑब्जर्वेशन फाउंडेशन मॉडल्स (EOFMs) विविध सेंसर आर्किटेक्चर के प्रति अत्यधिक संवेदनशील हैं, जो यह प्रकट करता है कि इन अंतरों को ध्यान में रखे बिना विभिन्न मोडैलिटीज़ के बीच बैंड्स को मिलाने की वर्तमान प्रथाएं रिप्रजेंटेशन लर्निंग में महत्वपूर्ण खामियों की ओर ले जाती हैं और अधिक सुदृढ़, सेंसर-जागरूक मॉडल डिजाइन की आवश्यकता को रेखांकित करती हैं।

Ryan P. Demilt, Nicholas LaHaye, Karis Tenneson2026-06-03
💬 NLP

Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL

यह शोध पत्र स्व-पुरस्कृत सुदृढीकरण शिक्षण (self-rewarding reinforcement learning) में एक व्यवस्थित स्व-पुष्टि पूर्वाग्रह (self-confirming bias) की पहचान करता है जहाँ मॉडल उच्च-विश्वास वाली गलतियों को अत्यधिक पुरस्कृत करते हैं, और विविध मॉडल एकत्रीकरण के माध्यम से इस अस्थिरता को कम करने के लिए 'एन्सेम्बल्ड रिवार्ड्स के साथ सुदृढीकरण शिक्षण' (RLER) का प्रस्ताव करता है, जो अनलेबल डेटा पर प्रभावी ढंग से स्केल करते हुए पर्यवेक्षित विधियों (supervised methods) के करीब प्रदर्शन प्राप्त करता है।

Chuyi Tan, Peiwen Yuan, Xinglin Wang, Yiwei Li, Shaoxiong Feng, Yueqi Zhang, Jiayi Shi, Ji Zhang, Boyuan Pan, Yao Hu, Ka (…)2026-06-03
🤖 AI

Harnessing Self-Supervised Deep Learning and Geostationary Remote Sensing for Advancing Wildfire and Associated Air Quality Monitoring: Improved Smoke and Fire Front Masking using GOES and TEMPO Radiance Data

यह अध्ययन प्रदर्शित करता है कि प्रति घंटा GOES-18 और TEMPO उपग्रह डेटा का लाभ उठाने वाली एक स्व-पर्यवेक्षित (self-supervised) डीप लर्निंग प्रणाली, जंगल की आग के मोर्चों और धुएं के गुबारों के निकट वास्तविक समय (near real-time) मानचित्रण में महत्वपूर्ण सुधार करती है, जो प्रभावी रूप से धुएं को बादलों से अलग करती है और पश्चिमी संयुक्त राज्य अमेरिका में जंगल की आग और वायु गुणवत्ता प्रबंधन के लिए परिचालन उत्पादों (operational products) से बेहतर प्रदर्शन करती है।

Nicholas LaHaye, Thilanka Munashinge, Hugo Lee, Xiaohua Pan, Gonzalo Gonzalez Abad, Hazem Mahmoud, Jennifer Wei2026-06-03
💬 NLP

Automata-Conditioned Cooperative Multi-Agent Reinforcement Learning

यह शोध पत्र ऑटोमेटा-कंडीशन्ड कोऑपरेटिव मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (ACC-MARL) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टी-एजेंट टीमों के लिए जटिल टेम्पोरल उद्देश्यों को बिना पुन: प्रशिक्षण के संभालने हेतु कार्य-आधारित विकेंद्रीकृत नीतियों के कुशल, सैंपल-इष्टतम शिक्षण को सक्षम बनाता है, साथ ही परीक्षण के समय इष्टतम कार्य असाइनमेंट की सुविधा भी प्रदान करता है।

Beyazit Yalcinkaya, Marcell Vazquez-Chanlatte, Ameesh Shah, Hanna Krasowski, Sanjit A. Seshia2026-06-03
🧬 biology

Scalable Single-Cell Gene Expression Generation with Latent Diffusion Models

यह शोध पत्र scLDM को प्रस्तुत करता है, जो एक स्केलेबल लेटेंट डिफ्यूजन मॉडल है जो डेटा के मौलिक विनिमयशीलता (exchangeability) गुण का सम्मान करते हुए, यथार्थवादी, उच्च-गुणवत्ता वाले सिंगल-सेल जीन एक्सप्रेशन प्रोफाइल उत्पन्न करने के लिए एक परम्यूटेशन-इनवेरिएंट मल्टी-हेड क्रॉस-अटेंशन ब्लॉक और डिफ्यूजन ट्रांसफॉर्मर्स का लाभ उठाता है।

Giovanni Palla, Sudarshan Babu, Payam Dibaeinia, James D. Pearce, Donghui Li, Aly A. Khan, Theofanis Karaletsos, Jakub M (…)2026-06-03
📊 statistics

Estimating Bidirectional Causal Effects with Large Scale Online Kernel Learning

यह शोध पत्र एक स्केलेबल ऑनलाइन कर्नेल लर्निंग फ्रेमवर्क प्रस्तावित करता है जो बड़े पैमाने पर, स्ट्रीमिंग और उच्च-आयामी डेटा में द्विदिश (bidirectional) कारण प्रभावों का सटीक और कुशल अनुमान लगाने के लिए रैंडम फूरियर फीचर्स और एडेप्टिव ग्रेडिएंट डिसेंट के साथ हेटेरोस्केडास्टिसिटी-आधारित पहचान को जोड़ता है।

Masahiro Tanaka2026-06-03
🤖 machine learning

Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits

यह शोध पत्र MTPC प्रस्तुत करता है, जो मल्टी-टोकन प्रेडिक्शन के लिए एक प्रोबेबिलिस्टिक सर्किट-आधारित फ्रेमवर्क है जो भविष्य के टोकन पर संयुक्त वितरण (joint distributions) को एनकोड करके अभिव्यक्ति (expressiveness) और लेटेंसी के बीच के संतुलन को अनुकूलित करता है, जिससे मूल मॉडल के प्रदर्शन को सुरक्षित रखते हुए बाइट-लेवल और सबवर्ड LLM जनरेशन को महत्वपूर्ण रूप से त्वरित किया जाता है।

Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo P (…)2026-06-03