🤖 AI

Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism

पाइपर (Piper) एक ऐसा फ्रेमवर्क है जो बड़े पैमाने पर मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रशिक्षण में मेमोरी, संचार और वर्कलोड असंतुलन की चुनौतियों को दूर करने के लिए रिसोर्स मॉडलिंग और अनुकूलित पाइपलाइन पैरेललिज्म का उपयोग करता है, जिससे यह अत्याधुनिक प्रणालियों की तुलना में काफी उच्च GPU उपयोगिता और बैंडविड्थ प्राप्त करता है।

Sajal Dash, Feiyi Wang2026-05-07
⚡ electrical engineering

Kinematic Discriminants of Deceleration Behavior Modes in Car-Following: Evidence from NGSIM Trajectory Data

NGSIM डेटासेट से एक मिलियन से अधिक कार-फॉलोइंग अवलोकनों का विश्लेषण करते हुए, यह अध्ययन प्रकट करता है कि मंदी की तीव्रता (deceleration intensity) यह निर्धारित करती है कि ड्राइवर ब्रेकिंग निर्णयों के लिए गैप-क्लोजिंग रेट को प्राथमिकता देते हैं या विजुअल लूमिंग (visual looming) को, जबकि पारंपरिक स्पेसिंग हेडवे को नगण्य बना देती है, जिससे पारंपरिक ड्राइवर व्यवहार मॉडल को चुनौती मिलती है और स्वायत्त वाहन नियंत्रण के लिए महत्वपूर्ण अंतर्दृष्टि प्राप्त होती है।

Eni Solomon Laughter2026-05-07✓ Author reviewed ⓘ
🤖 AI

Direct Product Flow Matching: Decoupling Radial and Angular Dynamics for Few-Shot Adaptation

यह शोध पत्र डायरेक्ट प्रोडक्ट फ्लो मैचिंग (DP-FM) का प्रस्ताव करता है, जो एक नया ढांचा है जो मौजूदा फ्लो मैचिंग विधियों में ज्यामितीय बाधाओं को दूर करने के लिए एक बेलनाकार मैनिफोल्ड (cylindrical manifold) पर रेडियल और एंगुलर डायनेमिक्स को अलग करता है, जिससे 11 बेंचमार्क में विजन-लैंग्वेज मॉडल्स के लिए अत्याधुनिक फ्यू-शॉट एडेप्टेशन प्राप्त होता है।

Hongxu Chen, Yanghao Wang, Bowei Zhu, Hongxiang Li, Zhen Wang, Ziqi Jiang, Lin Li, Rui Liu, Long Chen2026-05-07
⚡ electrical engineering

Adaptive Learning Strategies for AoA-Based Outdoor Localization: A Comprehensive Framework

यह शोध पत्र 5G/6G नेटवर्क में AoA-आधारित आउटडोर लोकलाइजेशन के लिए एक अनुकूली ढांचे का प्रस्ताव करता है जो बड़े डेटासेट के लिए एक पदानुक्रमित ऑफलाइन दृष्टिकोण और छोटे डेटासेट के लिए एक ऑनलाइन इंक्रीमेंटल लर्निंग रणनीति का उपयोग करता है, जो व्यापक डेटा संग्रह अभियानों की आवश्यकता को कम करते हुए वास्तविक mMIMO-OFDM चैनल डेटा पर उच्च सटीकता और मजबूती प्रदर्शित करता है।

Bac Trinh-Nguyen, Sara Berri, Sin G. Teo, Tram Truong-Huu, Arsenia Chorti2026-05-07
📊 statistics

Proximal Projection for Doubly Sparse Regularized Models

यह शोध पत्र एक नवीन प्रॉक्सिमल प्रोजेक्शन विधि प्रस्तावित करता है जो डबली स्पार्स रेगुलराइज्ड मॉडल्स के लिए गौसियन ग्राफिकल मॉडल संरचनाओं का लाभ उठाते हुए गुणांकों को लेटेंट नोड योगदान में विघटित करती है, जिससे उच्च-आयामी प्रतिगमन सेटिंग्स में कुशल अनुकूलन और स्थिर प्रदर्शन सक्षम होता है।

Jia Wei He, R. Ayesha Ali, Gerarda Darlington2026-05-07
📊 statistics

A Bayesian Approach for Task-Specific Next-Best-View Selection with Uncertain Geometry

यह शोध पत्र 3D पुनर्निर्माण में कार्य-विशिष्ट 'नेक्स्ट-बेस्ट-व्यू' चयन के लिए एक बेयसियन फ्रेमवर्क प्रस्तुत करता है जो वर्गीकरण, विभाजन और भौतिक सिमुलेशन जैसे डाउनस्ट्रीम कार्यों के लिए महत्वपूर्ण क्षेत्रों में अनिश्चितता को रणनीतिक रूप से कम करने हेतु इंप्लिसिट सतहों पर पोस्टीरियर वितरणों का लाभ उठाता है, जिससे समान अनिश्चितता-न्यूनीकरण दृष्टिकोणों की तुलना में कम दृश्यों के साथ बेहतर प्रदर्शन प्राप्त होता है।

Jingsen Zhu, Silvia Sellán, Alexander Terenin2026-05-07
💬 NLP

Continual Knowledge Updating in LLM Systems: Learning Through Multi-Timescale Memory Dynamics

यह शोध पत्र मेमिनी (Memini) को प्रस्तुत करता है, जो एक ऐसी प्रणाली है जो बाहरी स्मृति को युग्मित तीव्र और मंद आंतरिक चरों वाले एक साहचर्य निर्देशित ग्राफ (associative directed graph) के रूप में मॉडल करके एलएलएम (LLMs) में ज्ञान के निरंतर अद्यतन में सुधार करती है, जिससे जैविक रूप से प्रेरित बहु-पैमाने की गतिशीलता के माध्यम से एपिसोडिक संवेदनशीलता, क्रमिक सुदृढ़ीकरण और चयनात्मक विस्मरण सक्षम होता है।

Andreas Pattichis, Constantine Dovrolis2026-05-07
🤖 machine learning

Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime

यह शोध पत्र प्रिफिक्स सैंपलिंग (Prefix Sampling) का प्रस्ताव करता है, जो बाइनरी-रिवॉर्ड एजेंटिक आरएल (binary-reward agentic RL) को एक इष्टतम 50% पास रेट की ओर निर्देशित करने के लिए ट्रेजेक्टरी प्रिफिक्स को पुनर्गठित करता है, जिससे रिवॉर्ड एंट्रॉपी और कंट्रास्टिव सिग्नल को अधिकतम किया जा सके ताकि SWE-bench और AIME जैसे बेंचमार्क पर महत्वपूर्ण वॉल-क्लॉक स्पीडअप और बेहतर प्रदर्शन प्राप्त किया जा सके।

Tianshu Zhu, Wenyu Zhang, Xiaoying Zuo, Lun Tian, Haotian Zhao, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu, Dawe (…)2026-05-07
🤖 machine learning

How Long Does Infinite Width Last? Signal Propagation in Long-Range Linear Recurrences

यह शोध पत्र रैखिक पुनरावर्ती मॉडलों (linear recurrent models) में सिग्नल प्रसार के लिए सटीक परिमित-चौड़ाई (finite-width) सूत्र व्युत्पन्न करता है ताकि तीन विशिष्ट गहराई-चौड़ाई स्केलिंग व्यवस्थाओं (depth-width scaling regimes) की पहचान की जा सके, जिससे यह प्रकट होता है कि फीडफॉरवर्ड नेटवर्क की तुलना में पुनरावर्ती मॉडलों में परिमित-चौड़ाई प्रभाव गहराई के साथ अधिक तेजी से संचित होते हैं और अनंत-चौड़ाई सन्निकटन (infinite-width approximation) तब विफल हो जाता है जब पुनरावर्ती गहराई n\sqrt{n} के क्रम से अधिक हो जाती है।

Mariia Seleznova2026-05-07
📊 statistics

On the Wasserstein Gradient Flow Interpretation of Drifting Models

यह शोध पत्र डेंग एट अल. (2026) द्वारा प्रस्तुत जेनेरेटिव मॉडलिंग वाया ड्रिफ्टिंग (GMD) फ्रेमवर्क का वॉसरस्टीन ग्रेडिएंट फ्लो के दृष्टिकोण से विश्लेषण करता है, यह प्रदर्शित करते हुए कि प्रस्तावित एल्गोरिदम एक KL-डाइवर्जेंस फ्लो के फिक्स्ड पॉइंट को लक्षित करता है जबकि वास्तविक कार्यान्वयन सीमाओं सहित एक सिंकहॉर्न डाइवर्जेंस फ्लो के समान है, और आगे इस परिप्रेक्ष्य को MMD और स्लाइसड वॉसरस्टीन दूरी जैसे अन्य डाइवर्जेंस तक विस्तारित करता है।

Arthur Gretton, Li Kevin Wenliang, Alexandre Galashov, James Thornton, Valentin De Bortoli, Arnaud Doucet2026-05-07