💬 NLP

Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL

यह शोध पत्र स्व-पुरस्कृत सुदृढीकरण शिक्षण (self-rewarding reinforcement learning) में एक व्यवस्थित स्व-पुष्टि पूर्वाग्रह (self-confirming bias) की पहचान करता है जहाँ मॉडल उच्च-विश्वास वाली गलतियों को अत्यधिक पुरस्कृत करते हैं, और विविध मॉडल एकत्रीकरण के माध्यम से इस अस्थिरता को कम करने के लिए 'एन्सेम्बल्ड रिवार्ड्स के साथ सुदृढीकरण शिक्षण' (RLER) का प्रस्ताव करता है, जो अनलेबल डेटा पर प्रभावी ढंग से स्केल करते हुए पर्यवेक्षित विधियों (supervised methods) के करीब प्रदर्शन प्राप्त करता है।

Chuyi Tan, Peiwen Yuan, Xinglin Wang, Yiwei Li, Shaoxiong Feng, Yueqi Zhang, Jiayi Shi, Ji Zhang, Boyuan Pan, Yao Hu, Ka (…)2026-06-03
🤖 AI

Harnessing Self-Supervised Deep Learning and Geostationary Remote Sensing for Advancing Wildfire and Associated Air Quality Monitoring: Improved Smoke and Fire Front Masking using GOES and TEMPO Radiance Data

यह अध्ययन प्रदर्शित करता है कि प्रति घंटा GOES-18 और TEMPO उपग्रह डेटा का लाभ उठाने वाली एक स्व-पर्यवेक्षित (self-supervised) डीप लर्निंग प्रणाली, जंगल की आग के मोर्चों और धुएं के गुबारों के निकट वास्तविक समय (near real-time) मानचित्रण में महत्वपूर्ण सुधार करती है, जो प्रभावी रूप से धुएं को बादलों से अलग करती है और पश्चिमी संयुक्त राज्य अमेरिका में जंगल की आग और वायु गुणवत्ता प्रबंधन के लिए परिचालन उत्पादों (operational products) से बेहतर प्रदर्शन करती है।

Nicholas LaHaye, Thilanka Munashinge, Hugo Lee, Xiaohua Pan, Gonzalo Gonzalez Abad, Hazem Mahmoud, Jennifer Wei2026-06-03
💬 NLP

Automata-Conditioned Cooperative Multi-Agent Reinforcement Learning

यह शोध पत्र ऑटोमेटा-कंडीशन्ड कोऑपरेटिव मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (ACC-MARL) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टी-एजेंट टीमों के लिए जटिल टेम्पोरल उद्देश्यों को बिना पुन: प्रशिक्षण के संभालने हेतु कार्य-आधारित विकेंद्रीकृत नीतियों के कुशल, सैंपल-इष्टतम शिक्षण को सक्षम बनाता है, साथ ही परीक्षण के समय इष्टतम कार्य असाइनमेंट की सुविधा भी प्रदान करता है।

Beyazit Yalcinkaya, Marcell Vazquez-Chanlatte, Ameesh Shah, Hanna Krasowski, Sanjit A. Seshia2026-06-03
🧬 biology

Scalable Single-Cell Gene Expression Generation with Latent Diffusion Models

यह शोध पत्र scLDM को प्रस्तुत करता है, जो एक स्केलेबल लेटेंट डिफ्यूजन मॉडल है जो डेटा के मौलिक विनिमयशीलता (exchangeability) गुण का सम्मान करते हुए, यथार्थवादी, उच्च-गुणवत्ता वाले सिंगल-सेल जीन एक्सप्रेशन प्रोफाइल उत्पन्न करने के लिए एक परम्यूटेशन-इनवेरिएंट मल्टी-हेड क्रॉस-अटेंशन ब्लॉक और डिफ्यूजन ट्रांसफॉर्मर्स का लाभ उठाता है।

Giovanni Palla, Sudarshan Babu, Payam Dibaeinia, James D. Pearce, Donghui Li, Aly A. Khan, Theofanis Karaletsos, Jakub M (…)2026-06-03
📊 statistics

Estimating Bidirectional Causal Effects with Large Scale Online Kernel Learning

यह शोध पत्र एक स्केलेबल ऑनलाइन कर्नेल लर्निंग फ्रेमवर्क प्रस्तावित करता है जो बड़े पैमाने पर, स्ट्रीमिंग और उच्च-आयामी डेटा में द्विदिश (bidirectional) कारण प्रभावों का सटीक और कुशल अनुमान लगाने के लिए रैंडम फूरियर फीचर्स और एडेप्टिव ग्रेडिएंट डिसेंट के साथ हेटेरोस्केडास्टिसिटी-आधारित पहचान को जोड़ता है।

Masahiro Tanaka2026-06-03
🤖 machine learning

Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits

यह शोध पत्र MTPC प्रस्तुत करता है, जो मल्टी-टोकन प्रेडिक्शन के लिए एक प्रोबेबिलिस्टिक सर्किट-आधारित फ्रेमवर्क है जो भविष्य के टोकन पर संयुक्त वितरण (joint distributions) को एनकोड करके अभिव्यक्ति (expressiveness) और लेटेंसी के बीच के संतुलन को अनुकूलित करता है, जिससे मूल मॉडल के प्रदर्शन को सुरक्षित रखते हुए बाइट-लेवल और सबवर्ड LLM जनरेशन को महत्वपूर्ण रूप से त्वरित किया जाता है।

Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo P (…)2026-06-03
🤖 AI

A Robust and Explainable Transformer-Based Framework for Phishing Email Detection

यह शोध पत्र एक सुदृढ़ और व्याख्या योग्य फ़िशिंग ईमेल डिटेक्शन फ्रेमवर्क का प्रस्ताव करता है जो सटीक, लचीले और पारदर्शी, साक्ष्य-आधारित स्पष्टीकरण उत्पन्न करने के लिए एक Flan-T5 जनरेटर के साथ एकीकृत XAI विधियों और एक DistilBERT मॉडल पर एडवरसेरियल ट्रेनिंग को जोड़ता है।

Sajad U P2026-06-03
🤖 machine learning

ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models

ParaBlock एक नवीन फेडरेटेड लर्निंग फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स के लिए समानांतर संचार और गणना थ्रेड्स का उपयोग करता है ताकि मानक ब्लॉक कोऑर्डिनेट डिसेंट विधियों की अभिसरण दर (convergence rate) और प्रदर्शन को बनाए रखते हुए विलंबता (latency) को महत्वपूर्ण रूप से कम किया जा सके।

Yujia Wang, Yuanpu Cao, Jinghui Chen2026-06-03
🔬 condensed matter

Statistics of Min-max Normalized Eigenvalues in Random Matrices

यह अध्ययन संचयी वितरण स्केलिंग नियमों का मूल्यांकन करने के लिए एक प्रभावी वितरण को लागू करके और मैट्रिक्स गुणनखंडन में अवशिष्ट त्रुटि को व्युत्पन्न करके रैंडम मैट्रिसेस (random matrices) में मिन-मैक्स सामान्यीकृत आइजनमानों (eigenvalues) के सांख्यिकीय गुणों की जांच करता है, जिसके सैद्धांतिक अनुमानों को संख्यात्मक प्रयोगों के माध्यम से सत्यापित किया गया है।

Hyakka Nakada, Shu Tanaka2026-06-03
🔢 mathematics

A Single-Loop Bilevel Deep Learning Method for Optimal Control of Obstacle Problems

यह शोध पत्र उच्च-आयामी और जटिल डोमेन में बाधा समस्याओं (obstacle problems) के इष्टतम नियंत्रण को कुशलतापूर्वक हल करने के लिए कंस्ट्रेंट-एम्बेडिंग न्यूरल नेटवर्क और एक नवीन S2-FOBA एल्गोरिदम का उपयोग करते हुए, एक मेश-मुक्त, सिंगल-लूप बाइलेवल डीप लर्निंग पद्धति प्रस्तावित करता है, जो शास्त्रीय संख्यात्मक दृष्टिकोणों की तुलना में कम्प्यूटेशनल लागत को कम करते हुए संतोषजनक सटीकता प्राप्त करता है।

Yongcun Song, Shangzhi Zeng, Jin Zhang, Lvgang Zhang2026-06-03