🤖 AI

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में अनुनय-प्रेरित तथ्यात्मक त्रुटियाँ एक संक्षिप्त, निगरानी योग्य सर्किट के कारण होती हैं जहाँ उथले अटेंशन हेड्स (shallow attention heads) प्रेरक कीवर्ड्स का पता लगाकर एक विशिष्ट एविडेंस-रूटिंग फीचर को पुनर्निर्देशित करते हैं, जिससे निर्णय लेने वाले हेड्स (decision heads) को एक निम्न-आयामी लेटेंट स्पेस में सही उत्तर से हटकर अनुनय-लक्ष्य वर्टेक्स (persuasion-target vertex) की ओर जाने के लिए मजबूर किया जाता है।

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang2026-05-12
🤖 AI

Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation

यह शोधपत्र स्व-विकसित (self-evolving) LLM एजेंटों में "क्षमता क्षरण" (capability erosion) की घटना की पहचान करता है, जहाँ नए कार्यों के अनुकूल होने से वर्कफ़्लो, कौशल, मॉडल और मेमोरी आयामों में पहले से सीखे गए कौशल का ह्रास होता है, और इस विनाशकारी विचलन (destructive drift) को स्पष्ट रूप से रोकने के लिए दीर्घकालिक अनुकूलन को स्थिर करने हेतु एक "क्षमता-संरक्षण विकास" (Capability-Preserving Evolution - CPE) ढांचे का प्रस्ताव करता है।

Ye Yu, Xiaopeng Yuan, Haibo Jin, Heming Liu, Yaoning Yu, Haohan Wang2026-05-12
🤖 AI

SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making

यह शोध पत्र SKG-VLA प्रस्तुत करता है, जो एक मल्टीमॉडल निर्णय लेने वाला ढांचा है जो विषम शिकायत साक्ष्य और नीति ज्ञान को संरचित करने के लिए सीन नॉलेज ग्राफ्स (Scene Knowledge Graphs) का लाभ उठाता है, जिससे एक विशिष्ट तीन-चरणीय प्रशिक्षण रणनीति के माध्यम से बड़े पैमाने पर शिकायत प्रबंधन प्रणालियों में तर्क की सटीकता, सामान्यीकरण और मजबूती को बढ़ाया जा सकता है।

Zeyu Li, Lei Li2026-05-12
🤖 AI

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

यह शोधपत्र HOME-KGQA प्रस्तुत करता है, जो घरेलू दैनिक गतिविधियों पर केंद्रित नॉलेज ग्राफ क्वेश्चन अनswering के लिए एक नवीन मल्टीमॉडल बेंचमार्क डेटासेट है, जो वास्तविक दुनिया के एम्बोडीड एआई (Embodied AI) अनुप्रयोगों के लिए आवश्यक जटिल स्पैटियोटेम्पोरल रीजनिंग और मल्टीमॉडल ग्राउंडिंग को संभालने में वर्तमान एलएलएम-आधारित (LLM-based) विधियों के प्रदर्शन में महत्वपूर्ण अंतराल को प्रकट करता है।

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamur (…)2026-05-12
🤖 AI

The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?

यह शोध पत्र दिशात्मक अभिसरण विश्लेषण (directional convergence analysis) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि स्वतंत्र रूप से प्रशिक्षित मल्टीमॉडल न्यूरल नेटवर्क निरंतर भाषा की सघन, विविक्त (discrete) निरूपण संरचना की ओर संरेखित होते हैं न कि इसके विपरीत, जो "विट्गेन्स्टाइनियन प्रतिनिधित्व परिकल्पना" (Wittgensteinian Representation Hypothesis) की ओर ले जाता है कि सूचना संपीड़न द्वारा संचालित मल्टीमॉडल अभिसरण के लिए भाषा एक स्पर्शोन्मुख आकर्षक (asymptotic attractor) के रूप में कार्य करती है।

Zhaoyang Zhang, Run Shao, Dongyue Wu, Jiajie Teng, Chao Tao, Jingdong Chen, Haifeng Li2026-05-12
🤖 machine learning

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1 एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक द्वि-स्तरीय उद्देश्य द्वारा प्रशिक्षित एक हल्के जनरेटर के माध्यम से पुन: प्रयोज्य प्राकृतिक भाषा कौशल को अनुकूलित करता है, जिससे अंतर्निहित फ्रोजन मॉडल को अपडेट किए बिना जटिल कार्यों पर एजेंटिक LLMs के लागत प्रभावी, मॉडल-अज्ञेय सुधार को सक्षम बनाया जा सके।

Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang (…)2026-05-12
🤖 AI

Position: Avoid Overstretching LLMs for every Enterprise Task

यह शोध पत्र तर्क देता है कि उद्यमों को सभी कार्यों के लिए बड़े भाषा मॉडलों (LLMs) पर अत्यधिक निर्भर करने से बचना चाहिए, और इसके बजाय मॉड्यूलर आर्किटेक्चर का समर्थन करना चाहिए जहाँ LLM केवल संरचित निष्कर्षण (structured extraction) के लिए इंटरफेस के रूप में कार्य करें, जबकि विश्वसनीयता, मापनीयता और पारदर्शिता सुनिश्चित करने के लिए समर्पित ज्ञान आधार (knowledge bases) और प्रतीकात्मक प्रक्रियाएं (symbolic procedures) गणना और भंडारण को संभालें।

Kuldeep Singh, Anson Bastos, Isaiah Onando Mulang'2026-05-12
🤖 AI

Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Agent Collaboration

यह शोध पत्र NIAgent को प्रस्तुत करता है, जो एक मल्टी-एजेंट सिस्टम है जो पदानुक्रमित सत्यापन (hierarchical verification) के साथ निष्पादन योग्य कोड को सहयोगात्मक रूप से संश्लेषित और गतिशील रूप से अनुकूलित करके, पूर्वानुमानित प्रदर्शन और अनुकूलन क्षमता में स्थिर वर्कफ़्लो से बेहतर प्रदर्शन करते हुए, स्वायत्त रूप से एंड-टू-एंड न्यूरोइमेजिंग विश्लेषण करता है।

Keqi Han, Songlin Zhao, Yao Su, Lifang He, Carl Yang2026-05-12
🧬 biology

LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering

यह शोध पत्र LiteMedCoT-VL को प्रस्तुत करता है, जो एक पैरामीटर-कुशल ढांचा है जो LoRA फाइन-ट्यूनिंग के माध्यम से 235B शिक्षक मॉडल से चेन-ऑफ-थॉट रीजनिंग को 2B छात्र मॉडल में आसत (distill) करता है, जिससे कॉम्पैक्ट मेडिकल VLMs को इमेज कैप्शन पर निर्भर किए बिना PMC-VQA बेंचमार्क पर अत्याधुनिक प्रदर्शन करने में सक्षम बनाया जा सके।

Runze Ma, Shunbo Jia, Haonan Lyu, Guo Liu, Caizhi Liao2026-05-12
⚡ electrical engineering

Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech

यह शोध पत्र GibbsTTS प्रस्तुत करता है, जो एक ज़ीरो-शॉट टेक्स्ट-टू-स्पीच सिस्टम है जो मौजूदा बेसलाइन की तुलना में बेहतर स्वाभाविकता और वक्ता समानता प्राप्त करने के लिए एक ट्रेनिंग-मुक्त काइनेटिक-ऑप्टिमल शेड्यूलर को परिमित-चरण मोमेंट सुधार (finite-step moment correction) के साथ जोड़कर मेट्रिक-इंड्यूस्ड डिस्क्रीट फ्लो मैचिंग को उन्नत करता है।

Dong Yang, Yiyi Cai, Haoyu Zhang, Yuki Saito, Hiroshi Saruwatari2026-05-12