💬 NLP

Detection vs. Execution: Single-Bucket Probes Miss Half the Mamba-2 State Sink

यह शोध पत्र प्रदर्शित करता है कि Mamba-2 में, सिंगल-बकेट प्रोब्स द्वारा पहचाने गए रिप्रजेंटेशनल सिग्नेचर अक्सर स्टेट सिंक घटना के लिए विशिष्ट डिटेक्शन और एक्जीक्यूशन सर्किट्स को मिला देते हैं, जो यह प्रकट करता है कि केवल हीड्स का एक विशिष्ट उपसमूह (BOS-स्पेशलिस्ट्स) ही महत्वपूर्ण लॉन्ग-कॉन्टेक्स्ट रिट्रीवल प्रदर्शन को कारणवत रूप से संचालित करता है, जबकि अन्य समान रिप्रजेंटेशन वाले हीड्स ऐसा नहीं करते हैं।

Yuhang Jiang2026-06-02
🤖 machine learning

PRISM: Gauge-Invariant Tangent-Space Differentially Private LoRA

यह शोध पत्र PRISM को प्रस्तुत करता है, जो लो-रैंक एडेप्टेशन (LoRA) के लिए एक गेज-इनवेरिएंट डिफरेंशियल प्राइवेट मैकेनिज्म है, जो अपडेट मैट्रिक्स के इंट्रिन्सिक टेंजेंट स्पेस पर सीधे कार्य करके नॉन-आइडेंटिफिएबल पैरामीटर फैक्टराइजेशन के कारण होने वाले अनबाउंड नॉइज़ एम्प्लीफिकेशन को हल करता है।

Shihao Wang, Xueru Zhang2026-06-02
🤖 machine learning

Silent Failures in Federated Personalization of Foundation Models

यह शोध पत्र "साइलेंट फेलियर्स" (Silent Failures) की अवधारणा प्रस्तुत करता है—जो फेडरेटेड लर्निंग और फाउंडेशन मॉडल पर्सनलाइजेशन के अभिसरण से उत्पन्न होने वाली प्रवर्धित पूर्वाग्रह (amplified bias) और संरेखण क्षरण (alignment erosion) जैसी एक विशिष्ट अदृश्य विश्वसनीयता संबंधी समस्याओं का एक वर्ग है—और गोपनीयता संबंधी बाधाओं के तहत मॉडल व्यवहार का मूल्यांकन करने में वर्तमान अक्षमता को संबोधित करने के लिए एक नई वर्गीकरण पद्धति (taxonomy) और अनुसंधान एजेंडा प्रस्तावित करता है।

YongKyung Oh, Alex Bui2026-06-02
🤖 machine learning

Explainable deep reinforcement learning reveals energy-efficient control strategies for turbulent drag reduction

यह शोध पत्र एक व्याख्यात्मक मल्टी-एजेंट डीप रिइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो टर्बुलेंट ड्रैग रिडक्शन के लिए अत्यधिक ऊर्जा-कुशल नियंत्रण रणनीति खोजने हेतु SHAP-गाइडेड रिवार्ड्स का लाभ उठाता है, जो निकट-दीवार (near-wall) टर्बुलेंट संरचनाओं के साथ तालमेल बिठाकर प्रेशर-गेटेड कंट्रोल्स को सक्रिय करके 34.44% ड्रैग रिडक्शन और न्यूनतम एक्चुएशन लागत के साथ 34.01% शुद्ध ऊर्जा बचत प्राप्त करता है।

Federica Tonti, Ricardo Vinuesa2026-06-02
🤖 machine learning

Optimal-Point Variance Reduction For Bayesian Optimization With Regret Guarantee

यह शोध पत्र ऑप्टिमल-पॉइंट वेरिएंस रिडक्शन (OVR) को प्रस्तुत करता है, जो एक गणनात्मक रूप से कुशल वन-स्टेप लुकअहेड बेयसियन ऑप्टिमाइज़ेशन विधि है जो पोस्टीरियर सैंपलिंग और मोंटे कार्लो सन्निकटन (approximations) पर निर्भर करती है और साथ ही वैनिशिंग बेयसियन एक्सपेक्टेड सिंपल रिग्रेट का सैद्धांतिक आश्वासन प्रदान करती है।

Shion Takeno2026-06-02
📈 economics

Prospect-Theory Behavior from Bellman Optimality in MDPs with Catastrophic States

यह शोधपत्र यह प्रदर्शित करता है कि अवशोषक विनाशकारी अवस्थाओं (absorbing catastrophic states) वाले मार्कोव निर्णय प्रक्रियाओं में मानक बेलमैन इष्टतमता (Bellman optimality), बिना किसी स्पष्ट संभाव्यता भारण (probability weighting), उपयोगिता वक्रता (utility curvature), या फ्रेमिंग पूर्वाग्रहों (framing biases) की आवश्यकता के, स्वाभाविक रूप से प्रमुख प्रॉस्पेक्ट थ्योरी हस्ताक्षरों—जैसे कि S-आकार के मूल्य फलन (S-shaped value functions), अंतर्जात हानि विमुखता (endogenous loss aversion), और परावर्तन-प्रभाव नीति उत्क्रमण (reflection-effect policy reversals)—को उत्पन्न करती है।

Yujiao Chen2026-06-02
📊 statistics

Practical and Optimal Algorithm for Linear Contextual Bandits with Rare Parameter Updates

यह शोधपत्र लीनियर कॉन्टेक्स्टुअल बैंडिट्स के लिए दो व्यावहारिक और गणनात्मक रूप से कुशल एल्गोरिदम, BLCE-G और BLCE का प्रस्ताव करता है, जो केवल O(loglogT)O(\log\log T) पैरामीटर अपडेट के साथ मिनिमैक्स-ऑप्टिमल रिग्रेट प्राप्त करते हैं और अपडेट अंतराल के भीतर ऑनलाइन कॉन्टेक्स्ट एडेप्टिविटी की अनुमति देते हैं।

Sanghoon Yu, Min-hwan Oh2026-06-02
🤖 machine learning

Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher

यह शोध पत्र "ट्रस्ट फंक्शन्स" (trust functions) का परिचय देता है, जो एक डेटा चयन तंत्र है जो सुपरविजन को फ़िल्टर करने के लिए कमजोर लेबल (weak labels) को स्केलर ट्रस्ट स्कोर असाइन करता है, जिससे विविध डोमेन में लगभग लॉसलेस (near-lossless) वीक-टू-स्ट्रॉन्ग जनरलाइजेशन और पुनरावृत्ति प्रदर्शन लाभ सक्षम होता है।

Arda Uzunoglu, Alvin Zhang, Daniel Khashabi2026-06-02
🤖 machine learning

Beyond Task-Agnostic: Task-Aware Grouping for Communication-Efficient Multi-Task MoE Inference

यह शोध पत्र टास्क-अवेयर कोएक्टिवेशन ग्रुपिंग (TACG) और जेनेरिक एक्सपर्ट शेयर्ड रेप्लिकेशन (GESR) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो विशेषज्ञों को वैश्विक औसत के बजाय कार्य-विशिष्ट सह-सक्रियता पैटर्न के आधार पर समूहित करके मल्टी-टास्क MoE इन्फरेंस को अनुकूलित करता है, जिससे संचार लागत में काफी कमी आती है और विविध वर्कलोड्स के बीच लोड संतुलन बना रहता है।

Zhiyao Xu, Aoxue Liu, Zhanjie Ding, Dan Zhao, Yong Jiang, Qing Li2026-06-02
🤖 machine learning

OPD+: Rethinking the Advantage Design for On-Policy Distillation

यह शोध पत्र OPD+ प्रस्तुत करता है, जो एक सुधारात्मक ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो एडवांटेज एस्टीमेशन में मानक स्टॉप-ग्रेडिएंट ऑपरेशन्स के कारण होने वाले बायस को गणितीय रूप से सिद्ध करता है और एक जेनेरिक f-डाइवर्जेंस-आधारित अनुकूलन विधि प्रस्तावित करता है जो रीजनिंग और टूल-यूज़ बेंचमार्क पर प्रदर्शन में सुधार करती है।

Hanyang Zhao, Haoxian Chen, Han Lin, Genta Indra Winata, David Yao, Wenpin Tang2026-06-02