⚡ electrical engineering

Families of Control-Cost-Parametrized Inverse-Optimal Universal Stabilizers

यह शोध पत्र एक "हाफ-डायरेक्ट-ऑप्टिमल" ढांचे को प्रस्तुत करता है जो उपयोगकर्ताओं को एक नियंत्रण लागत फलन (कंट्रोल कॉस्ट फंक्शन) चुनने की अनुमति देकर सार्वभौमिक स्टेबलाइजर्स के एक परिवार को उत्पन्न करता है, जिसे फिर एक सिद्ध लिप्सचिट्ज़ ऑपरेटर के माध्यम से एक गैर-रेखीय फीडबैक नियम में परिवर्तित किया जाता है जो सार्थक अवस्था लागतों (स्टेट कॉस्ट्स) के साथ एक इनवर्स-ऑप्टिमल कंट्रोल समस्या को हल करता है, जिससे ऑफलाइन विश्लेषण और ऑनलाइन अनुकूलन दोनों के लिए समान न्यूरल ऑपरेटर सन्निकटन सक्षम होता है।

Miroslav Krstic, Luke Bhan2026-06-09
📊 statistics

Data augmented bootstrap: Unifying confidence interval construction by approximate invariance

यह शोध पत्र डेटा ऑगमेंटेड बूटस्ट्रैप (DAB) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो परिमित-नमूना (finite-sample) और अनंत-नमूना (asymptotic) गारंटियों के बीच सेतु बनाने के लिए अनुमानित डेटा अपरिवर्तनीयताओं (data invariances) का लाभ उठाकर विश्वास अंतराल (confidence intervals) का निर्माण करता है, जिससे मशीन लर्निंग डेटा ऑग्मेंटेशन तकनीकों को कॉन्फॉर्मल प्रेडिक्शन और क्लासिकल बूटस्ट्रैप जैसे स्थापित सांख्यिकीय तरीकों के साथ एकीकृत किया जाता है।

Kevin Han Huang2026-06-09
📊 statistics

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

INFUSER एक इटरेटिव को-ट्रेनिंग फ्रेमवर्क है जो एक जनरेटर और सॉल्वर का उपयोग करके अनस्ट्रक्चर्ड दस्तावेज़ों से तर्क क्षमताओं को विकसित करने के लिए एक इन्फ्लुएंस-गाइडेड रिवॉर्ड सिग्नल और एक नवीन DuGRPO एल्गोरिदम का उपयोग करता है, जो एक एडेप्टिव करिकुलम को क्यूरेट करता है और चुनौतीपूर्ण बेंचमार्क पर मौजूदा सेल्फ-इवोल्यूशन बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Z (…)2026-06-09
🤖 machine learning

MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation

MilliVid एक पदानुक्रमित ऑटोएनकोडर (hierarchical autoencoder) का उपयोग करके फ्रेमों को मल्टी-स्केल टोकन में संकुचित करता है और एक वीडियो डिफ्यूजन मॉडल के भीतर एक मोटे-से-सूक्ष्म (coarse-to-fine) रोलआउट रणनीति का उपयोग करता है, जिससे वैश्विक ज्यामिति और वस्तु स्थायित्व (object permanence) को संरक्षित करते हुए कम्प्यूटेशनल लागत को कम किया जाता है, और इस प्रकार वीडियो जनरेशन में लंबी दूरी की निरंतरता (long-range consistency) की चुनौती का समाधान करता है।

Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincen (…)2026-06-09
🤖 machine learning

Stage-1 Controls the Entropy Regime, Not the Outcome

यह अध्ययन प्रदर्शित करता है कि जबकि स्टेज-1 वॉर्म-स्टार्ट विधियाँ (SFT बनाम OPD) विज़न-लैंग्वेज मॉडल्स के प्रारंभिक एंट्रॉपी रिजीम और उत्तर विविधता को महत्वपूर्ण रूप से प्रभावित करती हैं, वे स्टेज-2 सुदृढीकरण लर्निंग (reinforcement learning) के बाद अंतिम इन-डोमेन प्रदर्शन को पर्याप्त रूप से नहीं बदलती हैं या कोई स्पष्ट डाउनस्ट्रीम लाभ प्रदान नहीं करती हैं।

Jianxiong Shen2026-06-09
🤖 machine learning

OnlyDense: Reduced-Order Modeling for Lagrangian simulation

यह शोध पत्र "OnlyDense" का प्रस्ताव करता है, जो एक ऐसा लर्निंग फ्रेमवर्क है जो विशाल लैग्रेंजियन पार्टिकल सिस्टम को सीखे गए न्यूरल बेसिस फंक्शन्स के एक लीनियर सबस्पेस का उपयोग करके हिल्बर्ट स्पेस में विकसित होने वाले फलनों के रूप में मॉडल करता है, जिससे शास्त्रीय रिड्यूस्ड-ऑर्डर मॉडलिंग और डीप लर्निंग को एकीकृत करके न्यूनतम लेटेंट डायमेंशन के साथ जटिल गतिशील घटनाओं का स्केलेबल और उच्च-सटीक सिमुलेशन और भविष्यवाणी प्राप्त की जा सके।

Tu Do, Shannon Ryan, Santu Rana2026-06-09
🤖 machine learning

A Unifying Lens on Reward Uncertainty in RLHF

यह शोध पत्र RLHF में रिवॉर्ड हैकिंग को संबोधित करने के लिए एक डिस्ट्रीब्यूशनल रिवॉर्ड मॉडल का उपयोग करने का प्रस्ताव देता है, जो यह प्रदर्शित करता है कि एक KL-रेगुलराइज्ड ऑब्जेक्टिव एक क्लोज्ड-फॉर्म प्रभावी रिवॉर्ड प्रदान करता है जो विभिन्न निराशावादी ह्यूरिस्टिक्स (जैसे माध्य, वर्स्ट-केस, और अनसर्टेन्टी-वेटेड एग्रीगेशन) को एक एकल सैद्धांतिक ढांचे के तहत एकीकृत करता है।

Ely Hahami, Yoel Zimmermann, Ray Zhou, Jack Benarroch Jedlicki2026-06-09
🤖 machine learning

The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning

यह शोध पत्र डेटा असंतुलन के कारण प्रोसेस रिवॉर्ड मॉडल्स (PRMs) में एक छिपे हुए पूर्वाग्रह की पहचान करता है जो गलत चरणों को अत्यधिक श्रेय देने की ओर ले जाता है, और PRISM प्रस्तावित करता है, जो एक कंट्रास्टिव ट्रेनिंग फ्रेमवर्क है जो पॉइंटवाइज लेबल फिटिंग के बजाय विश्वसनीय सापेक्ष तुलनाओं को प्राथमिकता देकर फॉल्स पॉजिटिव्स को काफी कम करता है और डाउनस्ट्रीम कार्यों में रीजनिंग सटीकता में सुधार करता है।

Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian, Nihal Sharma, Rizal Fathony, Nam H Nguyen, C. Bayan Bruss, Amrit (…)2026-06-09
🤖 machine learning

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

यह शोध पत्र FlashMemory-DeepSeek-V4 प्रस्तुत करता है, जो एक बैकबोन-मुक्त प्रशिक्षित Lookahead Sparse Attention तंत्र का उपयोग करने वाला एक नवीन इन्फरेंस प्रतिमान (paradigm) है, जो केवल महत्वपूर्ण KV कैश चंक्स (chunks) का सक्रिय रूप से पूर्वानुमान लगाने और उन्हें बनाए रखने के लिए डिज़ाइन किया गया है, जिससे अल्ट्रा-लॉन्ग कॉन्टेक्स्ट में डाउनस्ट्रीम सटीकता को बनाए रखते हुए या थोड़ा सुधारते हुए भौतिक मेमोरी ओवरहेड को 85% से अधिक कम किया जा सकता है।

Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Jia Li, Yujiu (…)2026-06-09
🤖 machine learning

From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning

यह शोध पत्र एक नैदानिक ढांचे (diagnostic framework) को पेश करके 'थ्योरी ऑफ माइंड' (ToM) डेटासेट में "शॉर्टकट" लर्निंग की व्यापकता को संबोधित करता है और यह प्रदर्शित करता है कि स्पष्ट तर्क श्रृंखलाओं (explicit reasoning chains) के साथ सुदृढीकरण फाइन-ट्यूनिंग (Reinforcement Fine-Tuning/Thinking-RFT), मानक सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में मजबूती, सामान्यीकरण और जटिल तर्क क्षमताओं में काफी बेहतर प्रदर्शन करती है।

Jike Zhong, Yuxiang Lai, Ming Li, Yuheng Li, Wuao Liu, Behzad Dariush, Konstantinos Psounis, Shao-Yuan Lo2026-06-09