🤖 machine learning

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

यह शोध पत्र एक सुदृढीकरण अधिगम (Reinforcement Learning) ढांचे का प्रस्ताव करता है जो अनुभव के पुनरावृत्ति आसवन (iterative distillation) के माध्यम से एक हल्के प्रॉमप्टर मॉडल को अनुकूलित करता है ताकि फ्रोजन ब्लैक-बॉक्स एलएलएम (LLMs) की बहु-चरणीय तर्क और टूल-उपयोग क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे अत्याधुनिक विकासवादी बेसलाइनों की तुलना में बेहतर प्रदर्शन और नमूना दक्षता प्राप्त होती है।

Krishna Sayana, Ketan Todi, Ambarish Jash2026-05-15
🤖 machine learning

LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

यह शोध पत्र LiSA को प्रस्तुत करता है, जो एक रूढ़िवादी नीति प्रेरण (policy induction) ढांचा है जो संरचित मेमोरी के माध्यम से विरल और शोर युक्त परिनियोजन विफलताओं को पुन: प्रयोज्य नीति अमूर्तता (policy abstractions) में परिवर्तित करके स्थिर AI गार्डरेल्स को बढ़ाता है, जिससे एजेंटों को बार-बार फाइन-ट्यूनिंग की आवश्यकता के बिना प्रासंगिक सुरक्षा जोखिमों के अनुकूल होने में सक्षम बनाया जा सके।

Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, T (…)2026-05-15
🤖 machine learning

Focused PU learning from imbalanced data

यह शोध पत्र पॉजिटिव-अनलेबल (PU) लर्निंग के लिए एक नया फोकस्ड एम्पिरिकल रिस्क एस्टीमेटर प्रस्तावित करता है जो पॉजिटिव और अनलेबल उदाहरणों दोनों का उपयोग करके बाइनरी क्लासिफायर को प्रभावी ढंग से प्रशिक्षित करके अत्यधिक असंतुलित डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जिसे नियंत्रित परिदृश्यों और वास्तविक दुनिया के वित्तीय गलत विवरण का पता लगाने में भी सफलतापूर्वक प्रमाणित किया गया है।

Elias Zavitsanos, Georgios Paliouras2026-05-15
🤖 machine learning

ArcGate: Adaptive Arctangent Gated Activation

यह शोध पत्र ArcGate को प्रस्तुत करता है, जो एक अनुकूलन योग्य आर्कटैन्जेंट गेटेड एक्टिवेशन फंक्शन (arctangent gated activation function) है जिसमें सीखने योग्य पैरामीटर हैं जो गैर-रैखिकता (non-linearity) को गतिशील रूप से अनुकूलित करते हैं, और यह ResNet-50 और ViT आर्किटेक्चर का उपयोग करके रिमोट सेंसिंग कार्यों में मानक बेसलाइन की तुलना में बेहतर सटीकता और शोर प्रतिरोध (noise resilience) प्रदर्शित करता है।

Avik Bhattacharya, Siddhant Dnyanesh Gole, Subhasis Chaudhuri, Alejandro C. Frery, Biplab Banerjee2026-05-15
🤖 machine learning

Enjoy Your Layer Normalization with the Computational Efficiency of RMSNorm

यह शोधपत्र किसी भी गहरे न्यूरल नेटवर्क में लेयर नॉर्मलाइजेशन (LN) परतों को अधिक कुशल RMSNorm में पहचानने और परिवर्तित करने के लिए एक फ्रेमवर्क प्रस्तावित करता है, जो सेंटरिंग ऑपरेशन को अपस्ट्रीम लीनियर परतों में गणितीय रूप से फोल्ड करके किया जाता है, जिससे मॉडल के प्रदर्शन से समझौता किए बिना 2% से 12% तक सटीक या लगभग सटीक इन्फरेंस त्वरण प्राप्त होता है।

Yuxin Guo, Yihao Yue, Yunhao Ni, Yizhou Ruan, Jie Luo, Wenjun Wu, Lei Huang2026-05-15
📊 statistics

Large Dimensional Kernel Ridge Regression: Extending to Product Kernels

यह शोध पत्र उत्पाद कर्नेल (product kernels) के एक नए परिवार को पेश करके बड़े-आयामी कर्नेल रिज रिग्रेशन (large-dimensional kernel ridge regression) की समझ का विस्तार करता है, यह प्रदर्शित करते हुए कि वे उन प्रमुख घटनाओं को प्रदर्शित करते हैं जो पहले केवल प्रतिबंधात्मक सेटिंग्स में देखी गई थीं, जिनमें मिनिमैक्स इष्टतमता (minimax optimality), सैचुरेशन प्रभाव (saturation effects), और मल्टीपल-डिसेंट व्यवहार (multiple-descent behavior) शामिल हैं।

Yang Zhou, Yicheng Li, Yuqian Cheng, Qian Lin2026-05-15
🤖 machine learning

Exploring Geographic Relative Space in Large Language Models through Activation Patching

यह शोध पत्र यह जांच करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) सापेक्ष भौगोलिक स्थान को कैसे संसाधित करते हैं, जिसमें भौगोलिक अनुप्रयोगों में इन मॉडल्स की आंतरिक कार्यप्रणाली की सीमित समझ से उत्पन्न होने वाली सुरक्षा संबंधी चिंताओं को संबोधित करने के लिए एक्टिवेशन पैचिंग (activation patching), एक मैकेनिस्टिक इंटरप्रिटेबिलिटी तकनीक, का उपयोग किया गया है।

Stef De Sabbata, Rahul Baiju, Stefano Mizzaro, Kevin Roitero2026-05-15
🤖 machine learning

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

यह शोध पत्र RxEval प्रस्तुत करता है, जो एक चुनौतीपूर्ण प्रिस्क्रिप्शन-स्तरीय बेंचमार्क है जिसमें 1,547 बहुविकल्पीय प्रश्न शामिल हैं जो विस्तृत रोगी प्रक्षेपवक्रों (patient trajectories) के आधार पर विशिष्ट दवा-खुराक-मार्ग ट्रिपल्स की सिफारिश करने की LLMs की क्षमता का मूल्यांकन करते हैं, जो वर्तमान मॉडलों की नैदानिक तर्क और रोगी की जानकारी के पालन में महत्वपूर्ण अंतराल को प्रकट करता है।

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok2026-05-15
🤖 machine learning

Discovering Physical Directions in Weight Space: Composing Neural PDE Experts

यह शोध पत्र यह प्रदर्शित करता है कि एक साझा न्यूरल ऑपरेटर को विभिन्न भौतिक व्यवस्थाओं (physical regimes) के लिए फाइन-ट्यून करना वेट स्पेस (weight space) में एक पुन: प्रयोज्य और कैलिब्रेट करने योग्य दिशा को प्रकट करता है, जो प्रस्तावित कैलिब्रेशन-कंडीशन्ड मर्ज (CCM) पद्धति को विशेषज्ञों को संयोजित करने और बिना किसी अतिरिक्त प्रशिक्षण के इस भौतिक पैरामीटर के साथ गतिशील रूप से इंटरपोलेट करके आउट-ऑफ-डिस्ट्रीब्यूशन त्रुटियों को महत्वपूर्ण रूप से कम करने में सक्षम बनाता है।

Pengkai Wang, Pengwei Liu, Yuanyi Wang, Guanyu Chen, Xingyu Ren, Xiaolong Li, Zhongkai Hao, Yuting Kong, Qixin Zhang, Do (…)2026-05-15
🤖 machine learning

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

यह शोध पत्र प्रॉम्प्ट चयन को एक बहु-उद्देश्यीय शुद्ध-अन्वेषण बैंडिट समस्या (multi-objective pure-exploration bandit problem) के रूप में रूपरेखाबद्ध करके प्रॉम्प्ट प्रदर्शन की बहुआयामी प्रकृति को संबोधित करता है, और पारेटो सेट रिकवरी (Pareto set recovery) तथा सर्वश्रेष्ठ व्यवहार्य प्रॉम्प्ट पहचान के लिए नवीन एल्गोरिदम प्रस्तावित करता है जो सैद्धांतिक रूप से गारंटीकृत हैं और कई लार्ज लैंग्वेज मॉडल्स में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करने के लिए अनुभवजन्य रूप से मान्य हैं।

Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang2026-05-15