🔢 mathematics

Time-Dependent PDE-Constrained Optimization via Weak-Form Latent Dynamics

यह शोध पत्र एक वीक-फॉर्म लेटेंट-स्पेस रिड्यूस्ड-ऑर्डर मॉडलिंग फ्रेमवर्क (WLaSDI) प्रस्तुत करता है जो समाधान प्रक्षेप पथों (solution trajectories) को मजबूत, शोर-प्रतिरोधी लेटेंट डायनेमिक्स में संकुचित करके उच्च-आयामी, समय-निर्भर PDE-प्रतिबंधित समस्याओं के ग्रेडिएंट-आधारित अनुकूलन को त्वरित करता है, जिससे विविध बेंचमार्क अनुप्रयोगों में सटीकता बनाए रखते हुए पांच आदेशों (orders of magnitude) तक की गति वृद्धि प्राप्त होती है।

April Tran, Terry Haut, David Bortz, Youngsoo Choi2026-05-21
🤖 machine learning

Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs

यह शोध पत्र प्रकट करता है कि इन्फरेंस कंपाइलेशन (inference compilation), जो लार्ज लैंग्वेज मॉडल्स को तैनात करने के लिए एक मानक अनुकूलन तकनीक है, ऐसे संख्यात्मक दुष्प्रभाव (numerical side effects) उत्पन्न करता जिनका दुर्भावनापूर्ण रूप से गुप्त बैकडोर्स (backdoors) लगाने के लिए शोषण किया जा सकता है जो अन-कंपाइल्ड निष्पादन के दौरान सुप्त रहते हैं लेकिन मॉडल के कंपाइल होने पर मॉडल की भविष्यवाणियों को सफलतापूर्वक हाईजैक कर लेते हैं, जिससे पारंपरिक सुरक्षा मूल्यांकनों को बायपास किया जा सकता है।

Yifei Wang, Tianlin Li, Xiaohan Zhang, Yida Yang, Xiaoyu Zhang, Li Pan2026-05-21
🤖 machine learning

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

यह शोध पत्र रिफ्लेक्टर (Reflector) को पेश करता है, जो एक दो-चरणीय ढांचा है जो शिक्षक-निर्देशित सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से एलएलएम (LLM) जनरेशन प्रक्रिया में आत्म-चिंतन को आंतरिक रूप से समाहित करता है, जिससे मॉडल की उपयोगिता और सामान्यीकरण को बढ़ाते हुए जटिल अप्रत्यक्ष जेलब्रेक (indirect jailbreaks) के विरुद्ध 90% से अधिक रक्षा सफलता प्राप्त होती है।

Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang2026-05-21
🤖 machine learning

Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

यह शोध पत्र CoMET को प्रस्तुत करता है, जो एक ज़ीरो-शॉट मल्टीमॉडल वर्गीकरण ढांचा (framework) है जो PCA संपीड़न और एक हल्के टोकन पूलिंग तंत्र के माध्यम से फ्रोजन प्री-ट्रेंड मोडैलिटी एनकोडर को एक टैबुलर फाउंडेशन मॉडल के साथ संयोजित करके अत्याधुनिक परिणाम प्राप्त करता है, जिससे फाइन-ट्यूनिंग की आवश्यकता समाप्त हो जाती है।

Herman Bergström, Aditya Mehrotra, Rahul G. Krishnan2026-05-21
🤖 machine learning

Dynamic TMoE: A Drift-Aware Dynamic Mixture of Experts Framework for Non-Stationary Time Series Forecasting

यह शोध पत्र डायनेमिक TMoE (Dynamic TMoE) का प्रस्ताव करता है, जो गैर-स्थिर (non-stationary) समय श्रृंखला पूर्वानुमान के लिए एक नवीन ढांचा है, जो विषम विशेषज्ञ पूलों (heterogeneous expert pools) को गतिशील रूप से प्रबंधित करता है और वितरण परिवर्तनों (distribution shifts) को अनुकूल रूप से संभालने के लिए एक टेम्पोरल मेमोरी राउटर (temporal memory router) का उपयोग करता है, जिससे नौ बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jiawen Zhu, Shuhan Liu, Di Weng, Yingcai Wu2026-05-21
🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

यह शोध पत्र LlamaWeb प्रस्तुत करता है, जो llama.cpp के लिए एक WebGPU बैकएंड है जो स्टैटिक मेमोरी प्लानिंग, एक ट्यूनेबल कर्नेल लाइब्रेरी और टेम्पलेटेड GPU कर्नेल का उपयोग करके ब्राउज़रों में मेमोरी-कुशल, प्रदर्शन-पोर्टेबल और मल्टी-प्रिसिजन LLM इन्फरेंस प्राप्त करता है, जिसके परिणामस्वरूप विविध हार्डवेयर पर मौजूदा फ्रेमवर्क की तुलना में मेमोरी के उपयोग में उल्लेखनीय कमी और डिकोड थ्रूपुट में वृद्धि होती है।

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen2026-05-21
🤖 machine learning

SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction

यह शोध पत्र SAVER का प्रस्ताव करता है, जो एक चयनात्मक मल्टीमॉडल सूचना निष्कर्षण ढांचा (selective multimodal information extraction framework) है, जो यह निर्णय लेने के लिए कि कब और छवियों के किस उपसमुच्चय (subset) से परामर्श करना है, एक कॉन्फॉर्मल ग्राउंडेबिलिटी गेट (Conformal Groundability Gate) का उपयोग करता है, जिससे हमेशा चालू रहने वाले फ्यूजन तरीकों की तुलना में निष्कर्षण सटीकता में सुधार होता है और कंप्यूटिंग लागत एवं विलंबता (latency) में काफी कमी आती है।

Miaobo Hu, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao2026-05-21
🤖 machine learning

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

यह शोध पत्र एडेप्टिव ग्रुप पॉलिसी ऑप्टिमाइज़ेशन (AGPO) का प्रस्ताव करता है, जो एक क्रिटिक-मुक्त सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मानक PPO और GRPO विधियों की तुलना में गणित और STEM बेंचमार्क पर LLM तर्क प्रदर्शन को बेहतर बनाने के लिए समूह-स्तरीय सांख्यिकी का उपयोग करके क्लिपिंग बाउंड्स और डिकोडिंग तापमान को गतिशील रूप से समायोजित करता है।

Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao2026-05-21
📊 statistics

Everywhere Valid Bounds on False Discovery Proportions in Conformal Inference

यह शोध पत्र एक परिमित-नमूना (finite-sample), वितरण-मुक्त (distribution-free) ढांचे को प्रस्तुत करता है जो कॉन्फॉर्मल इन्फरेंस में सभी संभावित रिजेक्शन थ्रेशोल्ड के लिए फॉल्स डिस्कवरी प्रोपोर्शन (false discovery proportion) पर एक साथ, उच्च-संभाव्यता वाले ऊपरी बाउंड (upper bounds) स्थापित करता है, जिससे लचीले पोस्ट हॉक चयन को सक्षम बनाया जा सके और मौजूदा विधियों की तुलना में अधिक कड़े गारंटियाँ प्रदान की जा सकें।

Ziang Song, Ying Jin, Emmanuel J. Candès2026-05-21
🤖 machine learning

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

यह शोध पत्र डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड (Distribution-Aware Reward) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) उद्देश्य है जो निरंतर रैंक की संभाव्यता स्कोर (Continuous Ranked Probability Score) के साथ कई डिकोड किए गए नमूनों का मूल्यांकन करके, बड़े भाषा मॉडलों को प्रतिगमन कार्यों (regression tasks) के लिए कैलिब्रेटेड प्रेडिक्टिव वितरण उत्पन्न करने हेतु अनुकूलित करता है, जिससे पारंपरिक पॉइंट-एस्टीमेट प्रशिक्षण विधियों की तुलना में अनिश्चितता अनुमान, रैंकिंग प्रदर्शन और मजबूती में सुधार होता है।

Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter2026-05-21