💬 NLP

ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind

यह शोध पत्र ToMAP को प्रस्तुत करता है, जो एक नवीन 3B-पैरामीटर फ्रेमवर्क है जो प्रतिद्वंद्वी की मानसिक अवस्थाओं को गतिशील रूप से मॉडल करने के लिए 'थ्योरी ऑफ माइंड' मॉड्यूल को एकीकृत करके LLM प्रेरकों (persuaders) को उन्नत करता है, जिससे मॉडल को अधिक विविध, तार्किक और प्रतिद्वंद्वी-जागरूक तर्कों के माध्यम से GPT-4o जैसे काफी बड़े बेसलाइन से बेहतर प्रदर्शन करने में सक्षम बनाता है।

Peixuan Han, Zijia Liu, Jiaxuan You2026-06-02
⚡ electrical engineering

React to Surprises: Stable-by-Design Neural Feedback Control and the Youla-REN

यह शोध पत्र एक नॉनलीनर यूला-कुसेरा पैरामीट्राइजेशन को रिकरेंट इक्विलिब्रियम नेटवर्क्स (REN) के साथ संयोजित करके एक 'स्टेबल-बाय-डिजाइन' न्यूरल फीडबैक कंट्रोल फ्रेमवर्क प्रस्तुत करता है, ताकि आंशिक अवलोकनों और विक्षोभों वाले नॉनलीनर सिस्टम के लिए उन स्थिर करने वाली नीतियों के अनकन्स्ट्रेंड ऑप्टिमाइजेशन को सक्षम बनाया जा सके जो इंक्रीमेंटल क्लोज्ड-लूप स्टेबिलिटी (या पूर्ण जटिलता के तहत d-ट्यूब कॉन्ट्रैक्शन) की गारंटी देते हैं।

Nicholas H. Barbara, Ruigang Wang, Alexandre Megretski, Ian R. Manchester2026-06-02
📊 statistics

Exploiting Similarities in A/B Testing with Off-Policy Estimation

यह शोध पत्र ऑफ-पॉलिसी ए/बी टेस्टिंग अनुमानकों (estimators) के एक परिवार का प्रस्ताव करता है जो पारंपरिक 'डिफरेंस-इन-मीन्स' अनुमानकों की तुलना में सांख्यिकीय रूप से बेहतर सटीकता और एकाग्रता प्राप्त करने के लिए नए और बेसलाइन सिस्टम के बीच संरचनात्मक समानताओं और निर्णय प्रवृत्तियों (decision propensities) का लाभ उठाते हैं, जबकि मिसस्पेसिफिकेशन के प्रति सुदृढ़ रहते हैं और समानताओं के अभाव में मानक विधियों पर वापस लौट आते हैं।

Otmane Sakhi, Alexandre Gilotte, David Rohde2026-06-02
🔢 mathematics

Non-Asymptotic Stability and Consistency Guarantees for Physics-Informed Neural Networks via Coercive Operator Analysis

यह शोध पत्र फिजिक्स-इन्फॉर्म्ड न्यूरल नेटवर्क्स (PINNs) के लिए एक एकीकृत सैद्धांतिक ढांचा स्थापित करता है जो ऑपरेटर कोएर्सिविटी (operator coercivity) और गैर-एसिम्प्टोटिक परटर्बेशन थ्योरी का लाभ उठाकर कठोर स्थिरता और निरंतरता गारंटी प्राप्त करने के लिए अवशेष न्यूनीकरण (residual minimization) को ऊर्जा और यूनिफॉर्म नॉर्म्स में अभिसरण से जोड़ता है, साथ ही विविध PDE व्यवस्थाओं में संभाव्य सैंपल कॉम्प्लेक्सिटी बाउंड्स और अनुभवजन्य सत्यापन प्रदान करता है।

Ronald Katende2026-06-02
🤖 machine learning

Value-Free Policy Optimization via Reward Partitioning

यह शोध पत्र रिवॉर्ड पार्टीशन ऑप्टिमाइज़ेशन (RPO) को प्रस्तुत करता है, जो एक सरल और स्केलेबल सिंगल-ट्रैजेक्टरी प्रेफरेंस लर्निंग विधि है जो प्रॉम्प्ट-लेवल डिस्ट्रीब्यूशन के माध्यम से रिवॉर्ड्स को नॉर्मलाइज़ करके वैल्यू फंक्शन एस्टीमेशन की आवश्यकता को समाप्त करती है, जिससे यह DRO और KTO जैसे मौजूदा बेसलाइन्स की तुलना में बेहतर एलाइनमेंट, डाइवर्सिटी और स्टेबिलिटी प्राप्त करती है।

Bilal Faye, Hanane Azzag, Mustapha Lebbah2026-06-02
🤖 machine learning

Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में मशीन अनलर्निंग (machine unlearning) मॉडल के आउटपुट और आंतरिक एक्टिवेशन्स दोनों में स्थायी, पता लगाने योग्य "फिंगरप्रिंट्स" छोड़ देती है, जिससे क्लासिफायर यह पहचानने में सक्षम होते हैं कि क्या किसी मॉडल में अनलर्निंग की प्रक्रिया हुई है, और यह सटीकता अप्रासंगिक इनपुट्स के साथ भी 90% से अधिक रहती है।

Yiwei Chen, Soumyadeep Pal, Yimeng Zhang, Qing Qu, Sijia Liu2026-06-02
🤖 AI

On the Theoretical Limitations of Embedding-based Link Prediction

यह शोध पत्र प्रदर्शित करता है कि नॉलेज ग्राफ एम्बेडिंग मॉडल्स में लीनियर आउटपुट लेयर्स रैंक बॉटलनैक्स (rank bottlenecks) उत्पन्न करती हैं जो ग्राफ के आकार और कनेक्टिविटी बढ़ने के साथ अभिव्यंजना (expressivity) को सीमित करती हैं, और एक पैरामीटर-कुशल नॉन-लीनियर मिक्सचर-आधारित आउटपुट लेयर का प्रस्ताव करता है जो बड़े, घने डेटासेट्स पर प्रदर्शन में सुधार करने के लिए सैद्धांतिक और अनुभवजन्य रूप से इन सीमाओं को दूर करता है।

Samy Badreddine, Emile van Krieken, Luciano Serafini2026-06-02
🤖 machine learning

Model Parallelism With Subnetwork Data Parallelism

यह शोध पत्र सबनेटवर्क डेटा पैरेललिज्म (SDP) को प्रस्तुत करता है, जो एक वितरित प्रशिक्षण ढांचा है जो मॉडलों को संरचित सबनेटवर्कों में विभाजित करता है जिन्हें एक्टिवेशन्स (activations) को साझा किए बिना वर्कर्स के बीच प्रशिक्षित किया जाता है, जिससे विभिन्न आर्किटेक्चर और स्केल्स पर प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए महत्वपूर्ण मेमोरी कमी (28%-60%) प्राप्त होती है।

Vaibhav Singh, Zafir Khalid, Pietro Cagnasso, Edouard Oyallon, Eugene Belilovsky2026-06-02
🤖 machine learning

Toward accurate RUL and SoH estimation using reinforced graph-based physics-informed neural networks enhanced with dynamic weights

यह शोध पत्र RGPD का प्रस्ताव करता है, जो एक सुदृढ़ ग्राफ-आधारित भौतिकी-सूचित तंत्रिका नेटवर्क ढांचा है जो विविध औद्योगिक क्षरण प्रणालियों में शेष उपयोगी जीवन (Remaining Useful Life) और स्वास्थ्य की स्थिति (State of Health) का अनुमान लगाने में श्रेष्ठ सटीकता और सामान्यीकरण प्राप्त करने के लिए गतिशील भारण (dynamic weighting) और सॉफ्ट एक्टर-क्रिटिक सुदृढीकरण शिक्षण का उपयोग करता है।

Mohamadreza Akbari Pour, Ali Ghasemzadeh, Mohamad Ali Bijarchi, Mohammad Behshad Shafii2026-06-02
🤖 machine learning

Beyond Model Base Retrieval: Weaving Knowledge to Master Fine-grained Neural Network Design

यह शोध पत्र M-DESIGN को प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड फ्रेमवर्क है जो एक बड़े नॉलेज बेस से ऐतिहासिक एडिट-इफेक्ट साक्ष्यों को गतिशील रूप से बुनकर कुशलतापूर्वक निकट-इष्टतम सूक्ष्म-स्तरीय न्यूरल नेटवर्क संशोधनों की खोज करता है, जो खोज दक्षता और प्रदर्शन के बीच संतुलन बनाने में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Jialiang Wang, Hanmo Liu, Shimin Di, Zhili Wang, Jiachuan Wang, Lei Chen, Xiaofang Zhou2026-06-02