🤖 AI

A Multi-Agent system for Multi-Objective constrained optimization

यह शोध पत्र MAMO को प्रस्तुत करता है, जो एक मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) ढांचा है जो गतिशील वातावरणों में प्राथमिक उद्देश्यों और बाधा उल्लंघनों के बीच संतुलन बनाने के लिए इष्टतम रिवॉर्ड वेट्स (reward weights) को स्वायत्त रूप से सीखता है, जिससे पारंपरिक लैग्रेंजियन-आधारित दृष्टिकोणों में मैन्युअल वेट चयन की सीमाओं को दूर किया जा सके।

Federica Filippini2026-06-19
🤖 machine learning

Integrating national forest inventory, airborne lidar, and satellite imagery for wall-to-wall mapping of forest structure with computer vision

यह शोध पत्र वाइब्रेंटफॉरेस्ट्स (VibrantForests) फ्रेमवर्क प्रस्तुत करता है, जो कंप्यूटर विज़न का उपयोग करके राष्ट्रीय वन सूची, हवाई लिडार (airborne lidar) और उपग्रह इमेजरी को एकीकृत करता है ताकि पूरे महाद्वीपीय संयुक्त राज्य अमेरिका में प्रमुख वन संरचना गुणों के सुसंगत, वार्षिक, 10-मीटर रिज़ॉल्यूशन वाले वॉल-टू-वॉल मानचित्र उत्पन्न किए जा सकें, जो बड़े पैमाने पर वन प्रबंधन और वनाग्नि नियोजन में सिग्नल संतृप्ति (signal saturation) और रिग्रेशन-टू-मीन (regression-to-mean) पूर्वाग्रहों जैसी सामान्य सीमाओं को प्रभावी ढंग से दूर करता है।

Luke J. Zachmann, David D. Diaz, Vincent A. Landau, Chelsey Walden-Schreiner, Tony Chang, Nathan E. Rutenbeck, Katharyn (…)2026-06-19
📊 statistics

Statistical Properties of Training & Generalization

यह शोध पत्र भौतिकी-प्रेरित परिप्रेक्ष्य से डीप लर्निंग की प्रमुख विशेषताओं और आश्चर्यजनक सांख्यिकीय गुणों की जांच करता है, जिसमें न्यूरल स्केलिंग लॉज़ और भौतिकी की समस्याओं के लिए प्रासंगिक इंडक्टिव बायस के बीच उनके अंतर्संबंधों पर विशेष ध्यान दिया गया है।

Itay Lavie, Noam Levi, Yonatan Kahn2026-06-19
🔬 condensed matter

Critical Percolation as a Synthetic Data Model for Interpretability

यह शोध पत्र क्रिटिकल मीन-फील्ड परकोलेशन क्लस्टर्स (critical mean-field percolation clusters) पर आधारित एक नवीन, विश्लेषणात्मक रूप से सुलभ सिंथेटिक डेटा मॉडल प्रस्तुत करता है जो पदानुक्रमित, बहु-स्तरीय संरचनाओं और पावर-लॉ सांख्यिकी को समाहित करता है ताकि न्यूरल नेटवर्क व्याख्यात्मकता विधियों के मूल्यांकन के लिए एक सिद्धांतगत परीक्षण स्थल के रूप में कार्य किया जा सके।

Aryeh Brill, Tom Ingebretsen Carlson2026-06-19
🤖 machine learning

On the Variance of Temporal Difference Learning and its Reduction Using Control Variates

यह शोध पत्र एक टेबुलर सेटिंग में टेम्पोरल डिफरेंस लर्निंग के वेरिएंस का विश्लेषण करता है, यह प्रदर्शित करते हुए कि इसकी वेरिएंस रिडक्शन स्वतंत्र प्रक्षेपवक्रों (ट्रैजेक्टरीज) को एकत्रित करने से उत्पन्न होती है, यह स्थापित करते हुए कि टीडी (TD) वेरिएंस मोंटे कार्लो अनुमानकों द्वारा एसिम्प्टोटिक रूप से सीमित है और छोटे हॉरिज़न्स के साथ घटता है, जबकि यह भी दिखाता है कि डायरेक्ट एडवांटेज एस्टीमेशन एक रिग्रेशन-एडजस्टेड कंट्रोल वेरिएट दृष्टिकोण के माध्यम से और भी कड़े वेरिएंस बाउंड्स प्राप्त करता है।

Hsiao-Ru Pan, Bernhard Schölkopf2026-06-19
🤖 machine learning

Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act

यह शोध पत्र एक चार-आर्म मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि रिट्रीवल के साथ फाइन-ट्यून्ड Qwen2.5-7B मॉडल (SFT+RAG) का संयोजन, विशेषीकृत रिट्रीवल मॉडलों या बड़े डेटासेट की आवश्यकता के बिना, स्टैंडअलोन फाइन-ट्यूनिंग और केवल रिट्रीवल दृष्टिकोण दोनों से बेहतर प्रदर्शन करते हुए, ओंटारियो रेजिडेंशियल टेनेंसीज़ एक्ट को उद्धृत करने में उच्चतम सटीकता प्राप्त करता है और मतिभ्रम (hallucinations) को समाप्त करता है।

Ali Asaria, Tony Salomone, Deep Gandhi2026-06-19
🤖 machine learning

Judging to Improve: A De-biased VLM-as-3D-Judge Protocol for Single-Image 3D Generation

यह शोध पत्र एक डी-बायस्ड (de-biased), ऑप्टिमाइज़ेशन-ग्रेड VLM-as-3D-जज प्रोटोकॉल पेश करता है जो यह परीक्षण करने के लिए विफलता मोड (failure modes) के विरुद्ध मूल्यांकन को कड़ाई से सुदृढ़ करता है कि क्या हल्का पैरामीटर-कुशल अनुकूलन (parameter-efficient adaptation) एक मजबूत ओपन-सोर्स 3D जनरेटर को बेहतर बना सकता है, और अंततः यह पाता है कि हालांकि प्रोटोकॉल पुन: प्रयोज्य और सूचनात्मक है, सार्वजनिक डेटा पर वर्तमान सस्ते अनुकूलन तरीके बेस मॉडल से अधिक होने के बजाय केवल उसके बराबर ही परिणाम प्राप्त करते हैं।

Ali Asaria, Tony Salomone, Deep Gandhi2026-06-19
🤖 machine learning

CRAX: Fast Safe Reinforcement Learning Benchmarking

CRAX एक तेज़ और सुरक्षित सुदृढीकरण शिक्षण (reinforcement learning) बेंचमार्क है जो MuJoCo XLA भौतिक इंजन पर निर्मित है और जो हार्डवेयर त्वरण का लाभ उठाकर मौजूदा CPU-आधारित सुरक्षा बेंचमार्क की तुलना में 100x तक की गति प्राप्त करता है, जिससे विविध वातावरणों में सुरक्षित RL विधियों के बड़े पैमाने पर मूल्यांकन को सक्षम बनाया जा सके और प्रदर्शन-सुरक्षा व्यापार-समझौतों (performance-safety trade-offs) तथा पाठ्यक्रम सीखने (curriculum learning) के लाभों के बारे में प्रमुख अंतर्दृष्टि को उजागर किया जा सके।

Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão2026-06-19
🤖 machine learning

The Significance of Style Diversity in Annotation-Free Synthetic Data Generation

यह शोध पत्र एक एनोटेशन-मुक्त सिंथेटिक डेटा जनरेशन फ्रेमवर्क का प्रस्ताव करता है जो मानव-एनोटेटेड प्रदर्शन का 93.3% तक प्राप्त करने के लिए इरादे की परिभाषाओं (intent definitions), विविध विषय और शैली गुणों (topic and style attributes), और LLM-as-a-judge फ़िल्टरिंग का लाभ उठाता है, जो यह प्रदर्शित करता है कि शैली की विविधता, विषय की विविधता से अधिक महत्वपूर्ण है और जनरेशन के दौरान शैली गुणों को एकीकृत करना पोस्ट-हॉक अनुकूलन (post-hoc adaptation) से बेहतर प्रदर्शन करता है।

Zahra Abbasiantaeb, Zeno Belligoli, Omar Essam, Mohammad Aliannejadi2026-06-19
🤖 machine learning

Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning

यह शोध पत्र डायरेक्ट एडवांटेज एस्टिमेशन (DAE) को आंशिक रूप से अवलोकन योग्य (partially observable) वातावरणों तक विस्तारित करता है और डिस्क्रीट लेटेंट डायनेमिक्स मॉडल्स को पेश करके इसके कम्प्यूटेशनल ओवरहेड को कम करता है, जिससे स्केलेबल और सैंपल-एफिशिएंट डीप रिइन्फोर्समेंट लर्निंग सक्षम होती है।

Hsiao-Ru Pan, Bernhard Schölkopf2026-06-19