🤖 AI

Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization

यह शोध पत्र प्रेफरेंस-बेस्ड सेल्फ-डिस्टिलेशन (PBSD) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो शिक्षक और छात्र नमूनों के बीच प्रेफरेंस गैप्स को अनुकूलित करने के लिए पारंपरिक KL मैचिंग के स्थान पर एक रिवॉर्ड-रेगुलराइज्ड ऑब्जेक्टिव का उपयोग करता है, जिससे मौजूदा सेल्फ-डिस्टिलेशन विधियों की तुलना में अधिक स्थिर प्रशिक्षण और बेहतर रीजनिंग प्रदर्शन प्राप्त होता है।

Xin Yu, Liuchen Liao, Yiwen Zhang, Yingchen Yu, Lingzhou Xue, Qinzhen Guo2026-05-07
🤖 AI

Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism

पाइपर (Piper) एक ऐसा फ्रेमवर्क है जो बड़े पैमाने पर मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रशिक्षण में मेमोरी, संचार और वर्कलोड असंतुलन की चुनौतियों को दूर करने के लिए रिसोर्स मॉडलिंग और अनुकूलित पाइपलाइन पैरेललिज्म का उपयोग करता है, जिससे यह अत्याधुनिक प्रणालियों की तुलना में काफी उच्च GPU उपयोगिता और बैंडविड्थ प्राप्त करता है।

Sajal Dash, Feiyi Wang2026-05-07
🤖 AI

Direct Product Flow Matching: Decoupling Radial and Angular Dynamics for Few-Shot Adaptation

यह शोध पत्र डायरेक्ट प्रोडक्ट फ्लो मैचिंग (DP-FM) का प्रस्ताव करता है, जो एक नया ढांचा है जो मौजूदा फ्लो मैचिंग विधियों में ज्यामितीय बाधाओं को दूर करने के लिए एक बेलनाकार मैनिफोल्ड (cylindrical manifold) पर रेडियल और एंगुलर डायनेमिक्स को अलग करता है, जिससे 11 बेंचमार्क में विजन-लैंग्वेज मॉडल्स के लिए अत्याधुनिक फ्यू-शॉट एडेप्टेशन प्राप्त होता है।

Hongxu Chen, Yanghao Wang, Bowei Zhu, Hongxiang Li, Zhen Wang, Ziqi Jiang, Lin Li, Rui Liu, Long Chen2026-05-07
⚡ electrical engineering

Adaptive Learning Strategies for AoA-Based Outdoor Localization: A Comprehensive Framework

यह शोध पत्र 5G/6G नेटवर्क में AoA-आधारित आउटडोर लोकलाइजेशन के लिए एक अनुकूली ढांचे का प्रस्ताव करता है जो बड़े डेटासेट के लिए एक पदानुक्रमित ऑफलाइन दृष्टिकोण और छोटे डेटासेट के लिए एक ऑनलाइन इंक्रीमेंटल लर्निंग रणनीति का उपयोग करता है, जो व्यापक डेटा संग्रह अभियानों की आवश्यकता को कम करते हुए वास्तविक mMIMO-OFDM चैनल डेटा पर उच्च सटीकता और मजबूती प्रदर्शित करता है।

Bac Trinh-Nguyen, Sara Berri, Sin G. Teo, Tram Truong-Huu, Arsenia Chorti2026-05-07
💬 NLP

Automatically Finding and Validating Unexpected Side-Effects of Interventions on Language Models

यह शोध पत्र एक स्वचालित, कंट्रास्टिव (तुलनात्मक) मूल्यांकन पाइपलाइन प्रस्तुत करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) पर हस्तक्षेपों के इच्छित और अप्रत्याशित दोनों प्रकार के प्रभावों की पहचान करने के लिए सांख्यिकीय रूप से मान्य और मानव-पठनीय परिकल्पनाएं उत्पन्न करता है, जो सिंथेटिक और वास्तविक दुनिया के परिदृश्यों में वास्तविक व्यवहारिक परिवर्तनों को मतिभ्रम (हैलुसिनेशन) से अलग करने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Quintin Pope, Ajay Hayagreeve Balaji, Jacques Thibodeau, Xiaoli Fern2026-05-07
🧬 biology

Think-Aloud Reshapes Automated Cognitive Model Discovery Beyond Behavior

यह शोध पत्र यह प्रदर्शित करता है कि स्वचालित संज्ञानात्मक मॉडल खोज (automated cognitive model discovery) में 'थिंक-अलाउड' (Think-Aloud) निशानों को शामिल करने से भविष्य कहनेवाला प्रदर्शन (predictive performance) में महत्वपूर्ण सुधार होता है और पहचाने गए मॉडल संरचनाओं को अधिक एकीकृत उपयोगिता तंत्रों (integrated utility mechanisms) की ओर स्थानांतरित करता है, जिससे उन संज्ञानात्मक प्रक्रियाओं का अनावरण होता जिन्हें केवल व्यवहार संबंधी डेटा अकेले पुनः प्राप्त नहीं कर सकता है।

Hanbo Xie, Akshay K. Jagadish, Lan Pan, Robert C. Wilson2026-05-07✓ Author reviewed
💬 NLP

Continual Knowledge Updating in LLM Systems: Learning Through Multi-Timescale Memory Dynamics

यह शोध पत्र मेमिनी (Memini) को प्रस्तुत करता है, जो एक ऐसी प्रणाली है जो बाहरी स्मृति को युग्मित तीव्र और मंद आंतरिक चरों वाले एक साहचर्य निर्देशित ग्राफ (associative directed graph) के रूप में मॉडल करके एलएलएम (LLMs) में ज्ञान के निरंतर अद्यतन में सुधार करती है, जिससे जैविक रूप से प्रेरित बहु-पैमाने की गतिशीलता के माध्यम से एपिसोडिक संवेदनशीलता, क्रमिक सुदृढ़ीकरण और चयनात्मक विस्मरण सक्षम होता है।

Andreas Pattichis, Constantine Dovrolis2026-05-07
💬 NLP

Text Corpora as Concept Fields: Black-Box Hallucination and Novelty Measurement

यह शोध पत्र "कॉन्सेप्ट फील्ड्स" (Concept Fields) को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स, कॉर्पस-अट्रीयूटेबल फ्रेमवर्क है जो टेक्स्ट को एम्बेडिंग स्पेस में लोकल ड्रिफ्ट फील्ड्स के रूप में मॉडल करता है ताकि मॉडल के आंतरिक विवरणों पर निर्भर किए बिना भ्रम (hallucinations) का पता लगाने और नवीनता (novelty) को मापने के लिए व्याख्या योग्य, संभाव्य स्कोर प्रदान किया जा सके।

Nicholas S. Kersting, Vittorio Castelli, Chieh Ting Yeh, Xinzhu Wang, Saad Taame2026-05-07
📊 statistics

On the Wasserstein Gradient Flow Interpretation of Drifting Models

यह शोध पत्र डेंग एट अल. (2026) द्वारा प्रस्तुत जेनेरेटिव मॉडलिंग वाया ड्रिफ्टिंग (GMD) फ्रेमवर्क का वॉसरस्टीन ग्रेडिएंट फ्लो के दृष्टिकोण से विश्लेषण करता है, यह प्रदर्शित करते हुए कि प्रस्तावित एल्गोरिदम एक KL-डाइवर्जेंस फ्लो के फिक्स्ड पॉइंट को लक्षित करता है जबकि वास्तविक कार्यान्वयन सीमाओं सहित एक सिंकहॉर्न डाइवर्जेंस फ्लो के समान है, और आगे इस परिप्रेक्ष्य को MMD और स्लाइसड वॉसरस्टीन दूरी जैसे अन्य डाइवर्जेंस तक विस्तारित करता है।

Arthur Gretton, Li Kevin Wenliang, Alexandre Galashov, James Thornton, Valentin De Bortoli, Arnaud Doucet2026-05-07
🤖 machine learning

Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning

यह शोध पत्र ऑफलाइन-टू-ऑनलाइन सुदृढीकरण शिक्षण (Reinforcement Learning) के लिए एक नवीन अनुकूली दृष्टिकोण प्रस्तावित करता है जो ऑफ-पॉलिसी मूल्यांकन की अविश्वसनीयता और व्यापक ऑनलाइन परीक्षण की अव्यावहारिकता से पार पाने के लिए ऑफलाइन प्रदर्शन अनुमानों को अपर-कॉन्फिडेंस-बाउंड रणनीति के साथ जोड़कर सीमित इंटरेक्शन बजट के तहत उम्मीदवार नीतियों का कुशलतापूर्वक चयन और फाइन-ट्यून करता है।

Alper Kamil Bozkurt, Xiaoan Xu, Shangtong Zhang, Miroslav Pajic, Yuichi Motai2026-05-07