💻 computer science

Video-Rate Streaming Stylization on a Vision-Aware MLLM-Conditioned Edit Diffusion: Asymmetric Batched Inference on a Distilled UNet + MLLM Text Encoder

यह शोध पत्र एक वीडियो-रेट स्ट्रीमिंग स्टाइलिज़ेशन पाइपलाइन प्रस्तुत करता है जो एक डिस्टिल्ड 0.39B U-Net को 2.13B Qwen3-VL एनकोडर के साथ संयोजित करके MLLM-कंडीशन्ड एडिट डिफ्यूजन में टेक्स्ट-एनकोडर बॉटलनेक को दूर करता है, जो उपभोक्ता GPU पर 74.1 fps तक प्राप्त करने के लिए एसिमेट्रिक बैचड इन्फरेंस और फ्यूज्ड ग्राफ ऑप्टिमाइज़ेशन का उपयोग करता है।

Yoshiyuki Ootani2026-06-05
💻 computer science

Diffusion Models for Adaptive Sequential Data Generation

यह शोध पत्र एक नवीन अनुक्रमिक फॉरवर्ड-बैकवर्ड डिफ्यूजन फ्रेमवर्क प्रस्तावित करता है जो ऐतिहासिक डेटा पर आधारित होकर अनुकूलनशीलता सुनिश्चित करता है, जो कठोर सांख्यिकीय गारंटी प्रदान करता है और पोर्टफोलियो अनुकूलन जैसे अनुप्रयोगों के लिए यथार्थवादी अनुक्रमिक डेटा उत्पन्न करने में प्रभावशीलता प्रदर्शित करता है।

Haoyang Cao, Minshuo Chen, Yinbin Han, Renyuan Xu2026-06-05
💻 computer science

Adaptive Oscillatory-State Alignment for Time Series Forecasting

यह शोधपत्र AOSNET को प्रस्तुत करता है, जो एक नवीन पूर्वानुमान ढांचा (forecasting framework) है जो कठोर फिक्स्ड-टेम्पलेट आवधिक मॉडलिंग को एक लचीले, हिल्बर्ट-निर्देशित अनुकूली दोलन-अवस्था संरेखण तंत्र (Hilbert-guided adaptive oscillatory-state alignment mechanism) से प्रतिस्थापित करता है ताकि आयाम मॉड्यूलेशन (amplitude modulation) और चरण विचलन (phase drift) जैसी गैर-स्थिर अस्थायी गतिकी को प्रभावी ढंग से प्रबंधित किया जा सके, जिससे कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Zhangyao Song, Ziqiong Li, Xiangfei Qiu, Chao Zha, Yinfei Xu, Tao Guo2026-06-05
💻 computer science

Catastrophic Forgetting as Accessibility Collapse: A Three-Level Framework for Knowledge Persistence in Continual Learning

यह शोध पत्र ज्ञान भंडारण (storage), प्रतिनिधित्व (representation) और सुलभता (accessibility) के बीच अंतर करने वाले एक तीन-स्तरीय ढांचे का प्रस्ताव करता है ताकि यह प्रदर्शित किया जा सके कि निरंतर शिक्षण (continual learning) में विनाशकारी विस्मृति (catastrophic forgetting) मुख्य रूप से एक सुलभता की विफलता है न कि पूर्ण प्रतिनिधित्व संबंधी विलोपन, जैसा कि तंत्रिका प्रतिनिधित्वों (neural representations) में कार्य की जानकारी की निरंतरता से सिद्ध होता है जिसे सरल क्लासिफायर पुनरप्रशिक्षण के माध्यम से पुनः प्राप्त किया जा सकता है।

Ayushman Trivedi, Bhavika Melwani2026-06-05✓ Author reviewed
🤖 AI

When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

यह शोध पत्र क्वांटाइज्ड गेटेड डेल्टानेट (Gated DeltaNet) मॉडल्स में चंक-वाइज लीनियर अटेंशन को त्वरित करने के लिए स्ट्रक्चरल मास्किंग और पैरेलल रेसिडुअल करेक्शन के साथ एक ट्रंकेटेड न्यूमैन एक्सपेंशन का उपयोग करते हुए, एक हार्डवेयर-फ्रेंडली, केवल गुणन-आधारित मैट्रिक्स इन्वर्जन सन्निकटन प्रस्तावित करता है, जो सटीकता बनाए रखते हुए 5 गुना तक की गति वृद्धि और 20% कम डिकोड-लेयर ओवरहेड प्राप्त करता है।

Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Wil (…)2026-06-05
💻 computer science

Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification

यह शोध पत्र सामान्य फंक्शन एप्रोक्सिमेशन और मॉडल मिसस्पेसिफिकेशन के तहत कॉन्टेक्स्टुअल बैंडिट्स और एपिसोडिक रिइन्फोर्समेंट लर्निंग के लिए KL-रेगुलराइज्ड फॉर्मुलेशन पेश करता है, जो उन रिग्रेशन-आधारित एल्गोरिदम के लिए उच्च-संभाव्यता वाले रिग्रेट गारंटी स्थापित करता है जो स्पष्ट रूप से एप्रोक्सिमेशन त्रुटियों को ध्यान में रखते हैं।

Haoyang Hong, Zichen Wang, Quanquan Gu, Huazheng Wang2026-06-05
💬 NLP

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

यह शोध पत्र MDP-GRPO को प्रस्तुत करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) का एक स्थिर संस्करण है, जो डिस्क्रीट (discrete), लो-डिस्पर्शन रिवॉर्ड सेटिंग्स में अस्थिरता को दूर करने के लिए मल्टी-टेम्परेचर सैंपलिंग, ड्यूल-एंकर एडवांटेज, प्रॉस्पेक्ट-थ्योरेटिक शेपिंग और एसिमेट्रिक KL रेगुलराइजेशन का उपयोग करता है, जिससे मल्टी-कन्स्ट्रेंट इंस्ट्रक्शन फॉलोइंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti2026-06-05
💻 computer science

3D Underwater Path Planning via Generative Flow Field Surrogates

यह शोध पत्र स्वायत्त अंतर्जलीय वाहनों (AUVs) के लिए एक वास्तविक समय के पथ नियोजन ढांचे को प्रस्तुत करता है जो जटिल प्रोपेलर वेक फील्ड्स (wake fields) की सटीक भविष्यवाणी करने के लिए गणनात्मक रूप से महंगी सीएफडी (CFD) सिमुलेशन को अल्ट्रा-फास्ट कंडीशनल जेनेरेटिव एडवरसैरियल नेटवर्क (cGAN) सरोगेट्स से बदल देता है, जिससे समान धारा मॉडल (uniform current models) की तुलना में ऊर्जा की खपत और उच्च-वेग वाले वेक मुठभेड़ों में उल्लेखनीय कमी आती है।

Zachary Cooper-Baldock, Paulo E. Santos, Russell S. A. Brinkworth, Karl Sammut2026-06-05
💬 NLP

On Advantage Estimates for Max@K Policy Gradients

यह शोध पत्र MaxPO प्रस्तुत करता है, जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) में max@K उद्देश्यों को अनुकूलित करने के लिए एक नई पॉलिसी-ग्रेडिएंट विधि है, जो केंद्रित लाभ (centered advantages) सुनिश्चित करने, ग्रेडिएंट वेरिएंस को कम करने और अधिक प्रभावी LLM पोस्ट-ट्रेनिंग के लिए मौजूदा एस्टिमेटर्स को एकीकृत करने के लिए एक नवीन 'लीव-टू-आउट' (Leave-Two-Out) बेसलाइन का उपयोग करता है।

Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takes (…)2026-06-05
💬 NLP

OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation

OrderGrad अनबायस्ड ग्रेडिएंट एस्टिमेटर्स (unbiased gradient estimators) का एक एकीकृत, प्लग-एंड-प्ले परिवार पेश करता है जो रैंक वेट्स (rank weights) के आधार पर रिवॉर्ड्स को रूपांतरित करके ऑर्डर-सांख्यिकी उद्देश्यों (जैसे VaR, CVaR, और best-of-K) को अनुकूलित करता है, जिससे पॉलिसी-ग्रेडिएंट विधियों को साधारण माध्य अनुकूलन (mean optimization) से परे टेल रिस्क (tail risk) और आउटलियर रोबस्टनेस (outlier robustness) जैसी वितरण संबंधी विशेषताओं को प्रभावी ढंग से संबोधित करने में सक्षम बनाया जा सके।

Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Shota Takashiro, Soichiro Nishimori, Takeshi Kojima, Yusuke Iwasawa, Yutaka (…)2026-06-05