🤖 machine learning

Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms

यह शोध पत्र फिशर इंफॉर्मेशन मैट्रिक्स (Fisher Information Matrix) के स्पेक्ट्रल नॉर्म (spectral norm) पर आधारित एक सिद्धांतपूर्ण, हमला-अज्ञेय (attack-agnostic) मजबूती मीट्रिक प्रस्तुत करता है, जो विभिन्न आर्किटेक्चर के लिए सैद्धांतिक स्पेक्ट्रल सीमाएं और कुशल एल्गोरिदम प्रदान करता है जो कई डेटासेट्स में प्रतिकूल भेद्यता (adversarial vulnerability) के साथ एक मजबूत सहसंबंध प्रदर्शित करते हैं।

Chong Zhang, Xiang Li, Jia Wang, Qiufeng Wang, Xiaobo Jin2026-06-04
⚡ electrical engineering

Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control

यह शोध पत्र LA-LQR पेश करता है, जो एक रिड्यूस्ड-ऑर्डर ऑप्टिमल कंट्रोल फ्रेमवर्क है जो विजुअल क्वालिटी और प्रॉम्प्ट फिडेलिटी को बनाए रखते हुए हानिकारक कंटेंट को प्रभावी ढंग से दबाने के लिए एक लो-डायमेंशनल लेटेंट स्पेस में क्लोज्ड-लूप फीडबैक इंटरवेंशन की गणना करके टेक्स्ट-टू-वीडियो जनरेशन मॉडल्स को निर्देशित करता है।

Jihoon Hong, Alice Chan, Qiyue Dai, Julian Skifstad, Glen Chou2026-06-04
🤖 machine learning

The Right Measure for Physics-Constrained Generation: A Co-Area Correction for Posterior-Consistent PDE Inverse Problems

यह शोध पत्र प्रदर्शित करता है कि PDE व्युत्क्रम समस्याओं (inverse problems) के लिए व्यापक रूप से उपयोग किए जाने वाले भौतिकी-प्रतिबंधित जनरेटिव मॉडल बोरेल-कोलमोगोरोव विरोधाभास (Borel–Kolmogorov paradox) से उत्पन्न एक छूटे हुए को-एरिया जैकोबियन कारक (co-area Jacobian factor) के कारण सही बेयसियन पोस्टीरियर (Bayesian posterior) को सैंपल करने में विफल रहते हैं, और CoCoS को पेश करता है, जो एक मेजर-अवेयर सैंपलर (measure-aware sampler) है जो अनिश्चितता-कैलिब्रेटेड अनुमान प्राप्त करने के लिए इस पूर्वाग्रह को ठीक करता है।

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao2026-06-04
🤖 AI

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

यह शोधपत्र BiasGRPO प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो सैम्पल्ड कंप्लीशन्स (sampled completions) के बीच रिवार्ड्स को नॉर्मलाइज़ करके लार्ज लैंग्वेज मॉडल्स में सोशल बायस मिटिगेशन को स्थिर करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन का लाभ उठाता है, जिससे यह DPO की एक्सप्लोरेशन सीमाओं और PPO की ट्रेनिंग अस्थिरता पर विजय प्राप्त करते हुए कई बेंचमार्क्स पर दोनों से बेहतर प्रदर्शन करता है।

Saket Reddy, Ke Yang, ChengXiang Zhai2026-06-04
🤖 machine learning

Scenario Generation for Risk-Aware Reinforcement Learning with Probably Approximately Safe Guarantees

यह शोध पत्र एक जोखिम-सचेत सुदृढीकरण शिक्षण (रिइन्फोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो स्टेट स्पेस के भीतर गैर-मजबूत क्षेत्रों पर ध्यान केंद्रित करके सुरक्षा गारंटी को पुनरावृत्ति रूप से कड़ा करने में सक्षम बनाने के लिए, दोहरे ऊपरी और निचले-सीमा बाधा प्रमाण पत्रों (बैरियर सर्टिफिकेट्स) के निर्माण हेतु वेरिएशनल ऑटोएनकोडर्स का उपयोग करता है।

Mohit Prashant, Arvind Easwaran2026-06-04
🤖 machine learning

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

यह शोध पत्र LifeSkill का प्रस्ताव करता है, जो एक दो-चरणीय सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ऑनलाइन आजीवन सीखने वाले एजेंटों को सत्यापनकर्ता-निर्देशित कौशल निष्कर्षण (verifier-guided skill extraction) और ऑनलाइन कौशल आंतरिककरण (online skill internalization) के माध्यम से परीक्षण-समय फीडबैक को निरंतर अपने मापदंडों में आत्मसात करने में सक्षम बनाता है, जिससे स्थिर पुनर्प्राप्ति-आधारित दृष्टिकोणों की सीमाओं को दूर किया जा सके और दीर्घ-क्षित कार्यों (long-horizon tasks) पर प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He2026-06-04
🤖 machine learning

Reconciling Causality and Non-Equilibrium Thermodynamics with Hamiltonian Causal Models

यह शोध पत्र हैमिल्टोनियन कॉज़ल मॉडल्स (HCMs) को प्रस्तुत करता है, जो एक प्रक्षेपवक्र-स्तरीय ढांचा है जो हस्तक्षेप-नियंत्रित हैमिल्टोनियन तंत्रों के माध्यम से कारण प्रभावों को परिभाषित करके और गैर-स्थिर भौतिक प्रणालियों में अपरिवर्तनीयता एवं कारण प्रभाव को मापने के लिए एंट्रॉपी उत्पादन का उपयोग करके सांख्यिकीय कारण मॉडलिंग को गैर-संतुलन ऊष्मागतिकी के साथ सामंजस्य स्थापित करता है।

Dario Rancati, Max Welling, Francesco Locatello2026-06-04
📊 statistics

Bayesian learning for the stochastic shortest path problem

यह शोध पत्र स्टोकेस्टिक शॉर्टेस्ट पाथ समस्या के लिए एक बेयसियन फ्रेमवर्क प्रस्तावित करता है जो बेलमैन के ऑप्टिमलिटी समीकरणों के माध्यम से इष्टतम एक्शन-वैल्यू फंक्शन के लिए पोस्टीरियर बिलीफ्स को सीधे निर्मित करता है, जो लाइक्लीहुड रिलैक्सेशन और अनआइडेंटिफिएबिलिटी से संबंधित चुनौतियों का समाधान करते हुए मौजूदा टेम्पोरल-डिफरेंस-आधारित विधियों की तुलना में अधिक डेटा-कुशल और अनिश्चितता-जागरूक विकल्प प्रदान करता है।

Chon Wai Ho, Sumeetpal S. Singh, Jiaqi Guo2026-06-04
🤖 machine learning

Uncertainty-Aware End-to-End Co-Design of Neural Network Processors: From Training and Mapping to Fabrication

यह शोध पत्र एक एकीकृत, अनिश्चितता-जागरूक सह-डिज़ाइन ढांचे को प्रस्तुत करता है जो न्यूरल नेटवर्क प्रशिक्षण, हार्डवेयर मैपिंग और फैब्रिकेशन को इंटरऑपरेबल ब्लॉक्स में एकीकृत करता है, जिसमें "कॉन्फिडेंस" (विश्वास) को एक स्पष्ट अनुकूलन योग्य संसाधन के रूप में पेश किया गया है ताकि मॉड्यूलर सुधारों को सक्षम किया जा सके और संपूर्ण डिज़ाइन पाइपलाइन में स्वचालित रूप से वैश्विक पारेटो-इष्टतम समाधानों को प्रसारित किया जा सके।

Yuyang Du, Yujun Huang, Gioele Zardini2026-06-04
🤖 machine learning

Rethinking Incompleteness: Formalizing Protocol Divergence and Train-Once Learning for Robust IMVC

यह शोध पत्र मानक इनकम्प्लीट मल्टी-व्यू क्लस्टरिंग (IMVC) मूल्यांकन में एक गंभीर दोष की पहचान करता है जहाँ समान मिसिंग रेट्स (missing rates) अत्यधिक भिन्न डेटा संरचनाओं को छिपा सकते हैं, और CRAFT का प्रस्ताव करता है, जो एक नवीन आर्किटेक्चर है जो मिसिंग डेटा को संभालने के बोझ को लॉस फंक्शन से हटाकर मॉडल डिज़ाइन पर स्थानांतरित करके एक सुदृढ़, 'ट्रेन-वन्स' (train-once) लर्निंग प्राप्त करता है।

Haolu Liu, Xiyue Wang, Xuanting Xie, Liangjian Wen, Zhao Kang2026-06-04