💬 NLP

Tracing the complexity profiles of different linguistic phenomena through the intrinsic dimension of LLM representations

यह शोध पत्र प्रदर्शित करता है कि एलएलएम (LLM) निरूपणों की अंतर्निहित विमा (intrinsic dimension - ID), भाषाई जटिलता के एक सुसंगत संकेतक के रूप में कार्य करती है, जो यह दर्शाता है कि विभिन्न प्रकार की वाक्य संरचनात्मक घटनाएँ मॉडल परतों में विशिष्ट और पूर्वानुमेय ID प्रोफाइल उत्पन्न करती हैं।

Marco Baroni, Emily Cheng, Iria de-Dios-Flores, Francesca Franzon2026-04-27
💬 NLP

LLMs as Assessors: Right for the Right Reason?

यह शोध पत्र सूचना पुनर्प्राप्ति (इन्फॉर्मेशन रिट्रीवल) में प्रासंगिकता निर्धारकों के रूप में लार्ज लैंग्वेज मॉडल्स (एलएलएम) के उपयोग की प्रभावशीलता का मूल्यांकन करता है, जिसमें विशिष्ट प्रासंगिक अंशों को उजागर करने की उनकी क्षमता की मानव बेंचमार्क के विरुद्ध तुलना की गई है, और अंततः यह निष्कर्ष निकाला गया है कि हालांकि एलएलएम मानवीय कार्यभार को कम करने के लिए आशाजनक उपकरण हैं, वे अभी तक मानव निर्धारकों को पूरी तरह से प्रतिस्थापित नहीं कर सकते।

Sourav Saha, Mandar Mitra, Aditya Dutta2026-04-27
💬 NLP

From Interpretability to Performance: Optimizing Retrieval Heads for Long-Context Language Models

यह शोध पत्र **RetMask** को प्रस्तुत करता है, जो एक ऐसी विधि है जो मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) का लाभ उठाते हुए मॉडलों को सामान्य आउटपुट की तुलना मास्क किए गए रिट्रीवल हेड्स (masked retrieval heads) से प्राप्त आउटपुट से करने के लिए प्रशिक्षित करती है, जिससे प्रभावी रूप से रिट्रीवल तंत्रों की पहचान को लॉन्ग-कॉन्टेक्स्ट कार्यों के लिए प्रदर्शन संवर्धन में बदल दिया जाता है।

Youmi Ma, Naoaki Okazaki2026-04-27
💬 NLP

System-Mediated Attention Imbalances Make Vision-Language Models Say Yes

यह शोध पत्र पहचानता है कि विज़न-लैंग्वेज मॉडल के मतिभ्रम (hallucinations), विशेष रूप से "हाँ-पूर्वाग्रह" (yes-bias), केवल छवि या पाठ के बजाय रेडंडेंट सिस्टम वेट्स (redundant system weights) की ओर असंतुलित अटेंशन आवंटन द्वारा संचालित होते हैं, और यह प्रदर्शित करता है कि इस अटेंशन को वापस इनपुट मोडैलिटीज़ की ओर कारणवत (causally) पुनर्वितरित करना प्रभावी रूप से इस पूर्वाग्रह को कम करता है।

Tsan Tsai Chan, Varsha Suresh, Anisha Saha, Michael Hahn, Vera Demberg2026-04-27
💬 NLP

The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check

अपनी गति की क्षमता के बावजूद, वर्तमान डिफ्यूजन-आधारित लार्ज लैंग्वेज मॉडल्स (dLLMs) खराब लॉन्ग-होराइजन प्लानिंग और प्रतीकात्मक सटीकता की कमी के कारण विश्वसनीय एजेंटिक बैकबोन के रूप में विफल रहते हैं, हालांकि वे सारांश (summarization) जैसी गैर-कारण भूमिकाओं में प्रभावी बने रहते हैं।

Qingyu Lu, Liang Ding, Kanjian Zhang, Jinxia Zhang, Dacheng Tao2026-04-27
💬 NLP

DimABSA: Building Multilingual and Multidomain Datasets for Dimensional Aspect-Based Sentiment Analysis

यह शोध पत्र DimABSA को प्रस्तुत करता है, जो आयामी पक्ष-आधारित भावना विश्लेषण (dimensional Aspect-Based Sentiment Analysis) के लिए पहला बहुभाषी और बहु-डोमेन डेटासेट है, जो अधिक सूक्ष्म भावना विश्लेषण सक्षम करने के लिए पारंपरिक श्रेणीगत लेबल के साथ निरंतर वैलेंस-अराउज़ल (valence-arousal) स्कोर का उपयोग करता है।

Lung-Hao Lee, Liang-Chih Yu, Natalia Loukashevich, Ilseyar Alimova, Alexander Panchenko, Tzu-Mi Lin, Zhe-Yu Xu, Jian-Yu (…)2026-04-27
💬 NLP

Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety

यह शोध पत्र यह प्रदर्शित करता है कि एक प्रोप्रायटरी अंग्रेजी-केंद्रित शिक्षक मॉडल से ओपन-सोर्स बहुभाषी छात्र मॉडलों में रिस्पॉन्स-आधारित नॉलेज डिस्टिलेशन लागू करने से अनजाने में सुरक्षा से समझौता हो सकता है, जिससे विशेष रूप से गैर-अंग्रेजी संदर्भों में जेलब्रेक सफलता दर बढ़ जाती है, क्योंकि इससे सूक्ष्म सीमा संबंधी निषेध (nuanced boundary refusals) का नुकसान होता है।

Max Zhang, Derek Liu, Kai Zhang, Joshua Franco, Haihao Liu2026-04-27
💬 NLP

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

यह शोध पत्र AdaptEvolve प्रस्तुत करता है, जो एक ऐसा ढांचा है जो आंतरिक पीढ़ी विश्वास (intrinsic generation confidence) के आधार पर प्रत्येक परिशोधन चरण के लिए सबसे उपयुक्त लार्ज लैंग्वेज मॉडल को गतिशील रूप से चुनकर विकासवादी एआई एजेंटों की दक्षता में सुधार करता है, जिससे उच्च सटीकता बनाए रखते हुए अनुमान लागत (inference costs) में लगभग 38% की कमी आती है।

Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum2026-04-27
💬 NLP

LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs

यह शोध पत्र LATMiX प्रस्तुत करता है, जो माइक्रो-स्केल क्वांटाइजेशन (MX) के लिए एक्टिवेशन डिस्ट्रीब्यूशन को अनुकूलित करने हेतु लर्नबल इनवर्टिबल अफ़ाइन ट्रांसफॉर्मेशन का उपयोग करने वाली एक विधि है, जिससे मौजूदा रोटेशन- या हेडामार्ड-आधारित दृष्टिकोणों की तुलना में लो-बिट लार्ज लैंग्वेज मॉडल्स की सटीकता में उल्लेखनीय सुधार होता है।

Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi2026-04-27
💬 NLP

Shared Lexical Task Representations Explain Behavioral Variability In LLMs

यह शोध पत्र यह प्रदर्शित करता है कि LLM प्रॉम्प्ट संवेदनशीलता को "लेक्सिकल टास्क हेड्स" (lexical task heads) के सक्रियण स्तरों द्वारा समझाया जा सकता है—जो साझा आंतरिक तंत्र हैं जो इस बात पर निर्भर किए बिना कार्य का प्रतिनिधित्व करते हैं कि प्रॉम्प्ट निर्देशों का उपयोग करता है या उदाहरणों का—और प्रदर्शन की परिवर्तनशीलता इस बात से उत्पन्न होती है कि ये हेड्स प्रतिस्पर्धी प्रस्तुतियों (representations) द्वारा कितनी मजबूती से ट्रिगर या विरल (diluted) होते हैं।

Zhuonan Yang, Jacob Xiaochen Li, Francisco Piedrahita Velez, Eric Todd, David Bau, Michael L. Littman, Stephen H. Bach (…)2026-04-27