🤖 machine learning

Scalable Ride-Sourcing Vehicle Rebalancing with Service Accessibility Guarantee: A Constrained Mean-Field Reinforcement Learning Approach

यह शोध पत्र राइड-सोर्सिंग वाहन पुनर्संतुलन (रीबैलेंसिंग) के लिए एक स्केलेबल कंस्ट्रेंड मीन-फील्ड सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) दृष्टिकोण प्रस्तावित करता है जो भौगोलिक क्षेत्रों में समान सेवा सुलभता सुनिश्चित करते हुए बड़े बेड़े में आयामीता के अभिशाप (कर्स ऑफ डाइमेंशनैलिटी) को प्रभावी ढंग से संबोधित करता है।

Matej Jusup, Kenan Zhang, Zhiyuan Hu, Barna Pásztor, Andreas Krause, Francesco Corman2026-06-02
🤖 AI

MARFT: Multi-Agent Reinforcement Fine-Tuning

यह शोधपत्र मल्टी-एजेंट रिइन्फोर्समेंट फाइन-ट्यूनिंग (MARFT) प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें फ्लेक्स-एमजी (Flex-MG) नामक एक नया मार्कोव गेम फॉर्मूलेशन और एक सार्वभौमिक एल्गोरिद्मिक दृष्टिकोण शामिल है, जिसे लार्ज लैंग्वेज मॉडल-आधारित मल्टी-एजेंट सिस्टम पर रिइन्फोर्समेंट लर्निंग लागू करने की अनूठी चुनौतियों से निपटने के लिए डिज़ाइन किया गया है।

Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang2026-06-02
📊 statistics

Global Convergence of Adaptive Sensing for Principal Eigenvector Estimation

यह शोध पत्र यह स्थापित करता है कि ओजा (Oja) के एल्गोरिदम का एक अनुकूली संकुचित (adaptive compressed) संस्करण, जो प्रति नमूना केवल दो मापों का उपयोग करता है, मुख्य आइजनवेक्टर (principal eigenvector) अनुमान के लिए O(λ1λ2d2/(Δ2t))\mathcal{O}(\lambda_1\lambda_2 d^2 / (\Delta^2 t)) की अभिसरण दर प्राप्त करता है, जो सूचना-सैद्धांतिक रूप से इष्टतम सिद्ध हुआ है और आयाम dd की तीन अलग-अलग घातों (powers) में पूर्णतः-अवलोकित (fully-observed), अनुकूली-संकुचित (adaptive-compressed) और गैर-अनुकूली-संकुचित (non-adaptive-compressed) PCA के प्रदर्शन को अलग करके गैर-अनुकूली योजनाओं से काफी बेहतर प्रदर्शन करता है।

Alex Saad-Falcon, Brighton Ancelin, Justin Romberg2026-06-02
🤖 AI

EMoE: Training-Free Expert Disagreement for Uncertainty-Aware Text-to-Image Diffusion

यह शोध पत्र EMoE को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) विधि है जो पूर्ण छवि निर्माण से पहले एपिस्टेमिक अनिश्चितता (epistemic uncertainty) का अनुमान लगाने और प्रॉम्प्ट की गुणवत्ता को विश्वसनीय रूप से रैंक करने के लिए प्री-ट्रेंड मिश्रण-ऑफ-एक्सपर्ट्स (mixture-of-experts) डिफ्यूजन मॉडल्स के भीतर विशेषज्ञ असहमति का लाभ उठाता है, जो बेसलाइनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है और भाषा-निर्भर पूर्वाग्रहों को प्रकट करता है।

Lucas Berry, Axel Brando, Wei-Di Chang, Juan Camilo Gamboa Higuera, David Meger2026-06-02
🤖 machine learning

Byte Pair Encoding for Efficient Time Series Forecasting

यह शोध पत्र बाइट पेयर एनकोडिंग (Byte Pair Encoding) से प्रेरित एक नवीन पैटर्न-केंद्रित टोकनाइजेशन योजना प्रस्तुत करता है जो कंप्यूटेशनल ओवरहेड को महत्वपूर्ण रूप से कम करने और पूर्वानुमान सटीकता में सुधार करने के लिए समय श्रृंखला नमूनों (time series samples) को मोटिफ-आधारित टोकन में अनुकूल रूप से मर्ज करता है, जिसे एक हल्के वजन वाले कंडीशनल डिकोडिंग अनुकूलन द्वारा और अधिक बढ़ाया गया है।

Leon Götz, Marcel Kollovieh, Stephan Günnemann, Leo Schwinn2026-06-02
🧬 biology

HR-VILAGE-3K3M: A Human Respiratory Viral Immunization Longitudinal Gene Expression Dataset for Systems Immunity

यह शोध पत्र HR-VILAGE-3K3M को प्रस्तुत करता है, जो एक व्यापक और AI-तैयार रिपॉजिटरी है जो श्वसन संबंधी वायरल संक्रमणों के लिए प्रतिरक्षा तंत्र और बायोमार्कर की खोज को सुगम बनाने हेतु 66 अध्ययनों के 3,178 विषयों के अनुदैर्ध्य ट्रांसक्रिप्टोमिक डेटा को सामंजस्यपूर्ण बनाता है।

Xuejun Sun, Yiran Song, Xiaochen Zhou, Ruilie Cai, Yu Zhang, Xinyi Li, Rui Peng, Jialiu Xie, Yuanyuan Yan, Muyao Tang, P (…)2026-06-02
📊 statistics

Human in the Loop Adaptive Optimization for Improved Time Series Forecasting

यह शोध पत्र एक नवीन, मॉडल-अज्ञेय (model-agnostic) पोस्ट-ट्रेनिंग फ्रेमवर्क प्रस्तुत करता है जो सुदृढीकरण शिक्षण (reinforcement learning) और जेनेटिक एल्गोरिदम के माध्यम से स्वचालित रूप से अभिव्यंजक रूपांतरण लागू करके समय श्रृंखला पूर्वानुमान (time series forecasting) की सटीकता को बढ़ाता है, जबकि वैकल्पिक रूप से बिना पुनरप्रशिक्षण के व्यवस्थित त्रुटियों को सुधारने के लिए प्राकृतिक भाषा के माध्यम से मानव विशेषज्ञ मार्गदर्शन को शामिल करता है।

Malik Tiomoko, Hamza Cherkaoui, Giuseppe Paolo, Zhang Yili, Yu Meng, Zhang Keli, Hafiz Tiomoko Ali2026-06-02
💬 NLP

Correcting Gradient-Based Circuit Localization via Interaction-Aware Backpropagation

यह शोध पत्र ग्रेडिएंट इंटरेक्शन मॉडिफिकेशंस (GIM) को प्रस्तुत करता है, जो एक नवीन तकनीक है जो अटेंशन सेल्फ-रिपेयर जैसे घटक इंटरैक्शनों की अनदेखी करने के कारण सर्किट लोकलाइजेशन में होने वाले व्यवस्थित गलत अनुमानों को सुधारती है, जिससे बड़े भाषा मॉडलों में विशिष्ट व्यवहारों के लिए जिम्मेदार मॉडल घटकों की पहचान करने में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Joakim Edin, Casper L. Christensen, Róbert Csordás, Tuukka Ruotsalo, Zhengxuan Wu, Maria Maistro, Jing Huang, Lars Maalø (…)2026-06-02
💬 NLP

CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting

CapBencher एक नवीन बेंचमार्किंग फ्रेमवर्क है जो ग्राउंड-ट्रूथ लेबल्स को अस्पष्ट करने के लिए कई तार्किक रूप से सही उत्तर प्रकाशित करके टेस्ट-सेट ओवरफिटिंग को कम करता है और मूल्यांकन गेमिंग का पता लगाता है, जिससे एक सैद्धांतिक सटीकता सीमा स्थापित होती है जिसे कोई भी मॉडल पार करने पर डेटा लीकेज का संकेत देता है।

Takashi Ishida, Thanawat Lodkaew, Ikko Yamane2026-06-02
🤖 machine learning

Beyond Discreteness: Sample Complexity Analysis of Straight-Through Estimator for 1-bit Quantization

यह शोध पत्र 1-बिट क्वांटाइजेशन के लिए स्ट्रेट-थ्रू एस्टिमेटर (STE) का पहला सैंपल कॉम्प्लेक्सिटी विश्लेषण प्रस्तुत करता है, जो दो-परत वाले न्यूरल नेटवर्क में अभिसरण (convergence) के लिए सैद्धांतिक सीमाएँ व्युत्पन्न करता है और यह प्रदर्शित करता है कि STE की प्रभावशीलता महत्वपूर्ण रूप से पर्याप्त सैंपल आकार और डेटा नॉर्मलाइजेशन पर निर्भर करती है।

Halyun Jeong, Jack Xin, Penghang Yin2026-06-02