🤖 machine learning

LOKI: Memory-Free Null-Space Constrained Lifelong Knowledge Editing

LOKI एक मेमोरी-मुक्त आजीवन ज्ञान संपादन (knowledge editing) विधि है जो हिल्बर्ट-श्मिट स्वतंत्रता मानदंड (Hilbert-Schmidt Independence Criterion) का उपयोग करके परतों को गतिशील रूप से चुनती है और नए ज्ञान को कुशलतापूर्वक शामिल करने के लिए मॉडल भार के नल-स्पेस (null-space) पर ग्रेडिएंट अपडेट को प्रोजेक्ट करती है, जिससे पिछले डेटा तक पहुँच की आवश्यकता के बिना विनाशकारी विस्मृति (catastrophic forgetting) को रोका जा सकता है।

Masih Eskandar, Miquel Sirera Perelló, Stratis Ioannidis, Jennifer Dy2026-06-19
🤖 machine learning

Efficiently Representing Algorithms With Chain-of-Thought Transformers

यह शोध पत्र प्रदर्शित करता है कि चेन-ऑफ-थॉट ट्रांसफॉर्मर केवल पॉली-लॉगैरिद्मिक ओवरहेड के साथ वर्ड रैम एल्गोरिदम का कुशलतापूर्वक अनुकरण कर सकते हैं, जो ट्यूरिंग मशीन सिमुलेशन के लिए आवश्यक द्विघात (क्वाड्रेटिक) ओवरहेड से काफी बेहतर प्रदर्शन करता है।

Yanhong Li, Anej Svete, Ashish Sabharwal, William Merrill2026-06-19
🤖 AI

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

यह शोध पत्र तर्क देता है कि वर्तमान समुच्चय-स्कोर (aggregate-score) लीडरबोर्ड विविध परिनियोजन आयामों (deployment dimensions) को पकड़ने में अपनी असमर्थता के कारण वास्तविक दुनिया के एलएलएम (LLM) एजेंट प्रदर्शन की भविष्यवाणी करने में विफल रहते हैं, और इसके बजाय एक नए बारह-स्तरीय मापन उपकरण के माध्यम से आउट-ऑफ-डिस्ट्रीब्यूशन (out-of-distribution) सेटिंग्स में रैंक स्थिरता को प्राथमिकता देने वाले एक प्रेडिक्टिव-वैलिडिटी फ्रेमवर्क का प्रस्ताव देता है।

Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin (…)2026-06-19
🤖 machine learning

OnDeFog: Online Decision Transformer under Frame Dropping

यह शोध पत्र OnDeFog का प्रस्ताव करता है, जो एक ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो फ्रेम ड्रॉपिंग को संभालने के लिए डिसीजन ट्रांसफॉर्मर तंत्र को प्रत्यक्ष पर्यावरणीय संपर्क के साथ एकीकृत करता है ताकि उच्च फ्रेम हानि दर और कम-पुरस्कार वाले डेटा वाले वातावरण में मौजूदा ऑफलाइन और ऑनलाइन दृष्टिकोणों से बेहतर प्रदर्शन किया जा सके।

Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu, Kento Uchida, Shinichi Shirakawa2026-06-19
🤖 AI

Bidirectional Tutoring for Developmental Motor Learning in Robots: Co-Developed Interaction Dynamics Support Stable Learning

यह शोध पत्र यह प्रदर्शित करता है कि द्विदिश ट्यूटरिंग (bidirectional tutoring), जहाँ रोबोट और ट्यूटर एक-दूसरे के अनुकूल गतिशील रूप से ढलते हैं, मुक्त-ऊर्जा-सिद्धांत (free-energy-principle) पर आधारित विकासात्मक ढांचे के भीतर पिछले अनुभवों को पूर्व बाधाओं (prior constraints) के रूप में उपयोग करके, पारंपरिक एकदिशीय दृष्टिकोणों की तुलना में ह्यूमनाइड रोबोटों में अधिक प्रभावी ढंग से स्थिर और सामान्यीकरण योग्य मोटर लर्निंग को बढ़ावा देती है।

Rui Fukushima, Jun Tani2026-06-19
🤖 AI

GLARE: A Natural Language Interface for Querying Global Explanations

यह शोध पत्र GLARE प्रस्तुत करता है, जो एक LLM-मध्यस्थ प्राकृतिक भाषा इंटरफ़ेस है जो उपयोगकर्ता के प्रश्नों को स्थानीय स्पष्टीकरण डेटा (local explanation data) पर संरचित SQL में अनुवादित करता है ताकि ब्लैक-बॉक्स इमेज क्लासिफायर के लिए लचीले, सांख्यिकी-संवर्धित वैश्विक स्पष्टीकरण प्रदान किए जा सकें, जिससे मानव-केंद्रित XAI की सुलभता और उपयोगिता में वृद्धि होती है।

Bhavan Vasu, Rajesh Mangannavar2026-06-19
💬 NLP

Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

यह शोध पत्र प्रदर्शित करता है कि क्रमिक डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) पहले से सीखे गए प्रेफरेंस को समान रूप से खराब नहीं करता है, बल्कि उद्देश्यों, सिग्नल की शक्ति और प्रशिक्षण क्रम के बीच संबंध के आधार पर स्थिरता से लेकर सकारात्मक हस्तांतरण तक के विविध परिणाम उत्पन्न करता है, जबकि यह भी प्रकट करता है कि ग्रेडिएंट विरोध इन प्रभावों का प्राथमिक चालक नहीं है।

Pranav Bhandari, Nicolas Fay, Amitava Datta, Usman Naseem, Mehwish Nasim2026-06-19
🤖 AI

Benchmarking Agentic Review Systems

यह शोध पत्र मानव गुणवत्ता निर्णयों और इंजेक्ट की गई त्रुटियों के विरुद्ध कई एजेंटिक समीक्षा प्रणालियों का बेंचमार्किंग करता है, जो यह प्रदर्शित करता है कि हालांकि उन्हें अभी भी सुधार की आवश्यकता है, फिर भी OpenAIReview (GPT-5.5 के साथ) जैसे शीर्ष कॉन्फ़िगरेशन प्रभावी रूप से पेपर की गुणवत्ता को ट्रैक करते हैं, अधिकांश त्रुटियों का पता लगाते हैं, और वास्तविक उपयोगकर्ताओं से सकारात्मक प्रतिक्रिया प्राप्त करते हैं।

Dang Nguyen, Wanqing Hao, Yanai Elazar, Chenhao Tan2026-06-19
🤖 machine learning

Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models

यह शोध पत्र बेयसियन मैनिफोल्ड करिकुलम (BMC) प्रस्तुत करता है, जो एक संरचना-जागरूक ढांचा है जो कार्यों के बीच निहित ज्यामितीय संबंधों का लाभ उठाकर, केवल कठिनाई-आधारित चयन पर निर्भर रहने के बजाय, सीखने की उत्पादकता, कार्य विविधता और मूल्यांकन उपयोगिता के बीच संतुलन को अनुकूलित करने के लिए LLM सुदृढीकरण शिक्षण (reinforcement learning) में समस्या नमूनाकरण (problem sampling) को एक मैनिफोल्ड-संरचित बैंडिट समस्या के रूप में पुनर्गठित करता है।

Darrien McKenzie, Nicklas Hansen, Xiaolong Wang2026-06-19
🤖 AI

SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling

SafeSpec एक सुरक्षा-जागरूक स्पेक्युलेटिव इन्फरेंस फ्रेमवर्क है जो डायनेमिक रोलबैक और रिफ्लेक्टिव मल्टी-सैंपलिंग को सक्षम करने के लिए सत्यापन प्रक्रिया में एक लाइटवेट लेटेंट सेफ्टी हेड को एकीकृत करता है, जिससे गति से समझौता किए बिना एडवरसेरियल डिफेंस और इन्फरेंस एक्सेलेरेशन को संयुक्त रूप से अनुकूलित करके एक बेहतर सुरक्षा-दक्षता ट्रेड-ऑफ प्राप्त किया जाता है।

Haotian Xu, Zeyang Zhang, Linbao Li, Huadi Zheng, Yu Li, Cheng Zhuo2026-06-19