💬 NLP

Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals

यह शोध पत्र अटेंशन मैट्रिसेस (attention matrices) में कुलबैक-लीब्लर डाइवर्जेंस (Kullback-Leibler divergence) का उपयोग करके LLM मतिभ्रम (hallucinations) का पता लगाने के लिए एक हल्का, सिंगल-पास विधि प्रस्तावित करता है, जो अनिश्चितता के एक भविष्य कहने योग्य, व्याख्या योग्य संकेत के रूप में कार्य करता है, और जो बार-बार सैंपलिंग या बाहरी मॉडलों की आवश्यकता के बिना मौजूदा विधियों के साथ प्रतिस्पर्धी प्रदर्शन करता है।

Gijs van Dijk2026-05-07
💬 NLP

The Pinocchio Dimension: Phenomenality of Experience as the Primary Axis of LLM Psychometric Differences

यह शोध पत्र "पिनोकियो एक्सिस" (Pinocchio Axis) को बड़े भाषा मॉडलों (large language models) के बीच मनोमितीय भिन्नता (psychometric variation) के प्राथमिक आयाम के रूप में पहचानता है, जो यह प्रकट करता है कि उनके उत्तरों में अंतर व्यक्तित्व लक्षणों के कारण नहीं, बल्कि इस संबंध में एक प्रशिक्षण-निर्मित आत्म-प्रतिनिधित्व संबंधी दृष्टिकोण (self-representational stance) द्वारा संचालित होता है कि क्या वे स्वयं को घटनात्मक अनुभव (phenomenal experience) के केंद्र के रूप में प्रस्तुत करते हैं या केवल उद्दीपन-चालित व्यवहार प्रणालियों (stimulus-driven behavioral systems) के रूप में।

Hubert Plisiecki, Sabina Siudaj, Kacper Dudzic, Anna Sterna, Maciej Gorski, Karolina Drozdz, Marcin Moskalewicz2026-05-07
💬 NLP

Automatically Finding and Validating Unexpected Side-Effects of Interventions on Language Models

यह शोध पत्र एक स्वचालित, कंट्रास्टिव (तुलनात्मक) मूल्यांकन पाइपलाइन प्रस्तुत करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) पर हस्तक्षेपों के इच्छित और अप्रत्याशित दोनों प्रकार के प्रभावों की पहचान करने के लिए सांख्यिकीय रूप से मान्य और मानव-पठनीय परिकल्पनाएं उत्पन्न करता है, जो सिंथेटिक और वास्तविक दुनिया के परिदृश्यों में वास्तविक व्यवहारिक परिवर्तनों को मतिभ्रम (हैलुसिनेशन) से अलग करने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Quintin Pope, Ajay Hayagreeve Balaji, Jacques Thibodeau, Xiaoli Fern2026-05-07
💬 NLP

Continual Knowledge Updating in LLM Systems: Learning Through Multi-Timescale Memory Dynamics

यह शोध पत्र मेमिनी (Memini) को प्रस्तुत करता है, जो एक ऐसी प्रणाली है जो बाहरी स्मृति को युग्मित तीव्र और मंद आंतरिक चरों वाले एक साहचर्य निर्देशित ग्राफ (associative directed graph) के रूप में मॉडल करके एलएलएम (LLMs) में ज्ञान के निरंतर अद्यतन में सुधार करती है, जिससे जैविक रूप से प्रेरित बहु-पैमाने की गतिशीलता के माध्यम से एपिसोडिक संवेदनशीलता, क्रमिक सुदृढ़ीकरण और चयनात्मक विस्मरण सक्षम होता है।

Andreas Pattichis, Constantine Dovrolis2026-05-07
💬 NLP

Text Corpora as Concept Fields: Black-Box Hallucination and Novelty Measurement

यह शोध पत्र "कॉन्सेप्ट फील्ड्स" (Concept Fields) को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स, कॉर्पस-अट्रीयूटेबल फ्रेमवर्क है जो टेक्स्ट को एम्बेडिंग स्पेस में लोकल ड्रिफ्ट फील्ड्स के रूप में मॉडल करता है ताकि मॉडल के आंतरिक विवरणों पर निर्भर किए बिना भ्रम (hallucinations) का पता लगाने और नवीनता (novelty) को मापने के लिए व्याख्या योग्य, संभाव्य स्कोर प्रदान किया जा सके।

Nicholas S. Kersting, Vittorio Castelli, Chieh Ting Yeh, Xinzhu Wang, Saad Taame2026-05-07
💬 NLP

PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation

PSK टीम ने GPT-4o-mini द्वारा जनरेट किए गए सिंथेटिक डेटा और प्रति-भाषा थ्रेशोल्ड ट्यूनिंग के साथ LoRA-फाइन-ट्यून्ड Gemma 3 मॉडल्स के एक एनसेंबल का उपयोग करके, 0.811 के मीन मैक्रो-F1 के साथ SemEval-2026 टास्क 9 में समग्र रूप से दूसरा स्थान प्राप्त किया, जबकि उन आर्किटेक्चर की तुलना में सामान्यीकरण (जनरलाइजेशन) के महत्वपूर्ण महत्व को प्रदर्शित किया जो डेवलपमेंट सेट्स पर अच्छा प्रदर्शन करते थे लेकिन टेस्ट सेट पर विफल रहे।

Srikar Kashyap Pulipaka2026-05-07
⚡ electrical engineering

MRI-Eval: A Tiered Benchmark for Evaluating LLM Performance on MRI Physics and GE Scanner Operations Knowledge

यह शोध पत्र MRI-Eval प्रस्तुत करता है, जो एक स्तरीय बेंचमार्क है जो यह प्रकट करता है कि जहाँ शीर्ष LLMs, MRI भौतिकी और GE स्कैनर संचालन से संबंधित बहुविकल्पीय प्रश्नों पर उच्च सटीकता प्राप्त करते हैं, वहीं उनका प्रदर्शन मुक्त-पाठ स्मरण (free-text recall) और उपयोगकर्ता के गलत दावों को संभालने में, विशेष रूप से वेंडर-विशिष्ट परिचालन ज्ञान के लिए, काफी कम हो जाता है।

Perry E. Radau2026-05-07
💬 NLP

Implicit Representations of Grammaticality in Language Models

यह शोध पत्र प्रदर्शित करता है कि प्रीट्रेन्ड लैंग्वेज मॉडल्स (pretrained language models) अपनी हिडन लेयर्स (hidden layers) के भीतर एक विशिष्ट व्याकरणिक प्रतिनिधित्व (grammaticality representation) को अंतर्निहित रूप से आत्मसात करते हैं, जिसे लीनियर प्रोब्स (linear probes) के माध्यम से निकाला जा सकता है ताकि कई भाषाओं में व्याकरणिक और अव्याकरणिक वाक्यों के बीच अंतर करने में स्ट्रिंग प्रोबेबिलिटी-आधारित निर्णयों (string probability-based judgments) से बेहतर प्रदर्शन किया जा सके।

Yingshan Susan Wang, Linlu Qiu, Zhaofeng Wu, Roger P. Levy, Yoon Kim2026-05-07
💬 NLP

Code-switching in text and speech challenges information-theoretic speaker design

यह शोध पत्र चीनी-अंग्रेजी पाठ और भाषण दोनों में, कम पूर्वानुमेयता (low predictability) वाले बिंदुओं पर अंग्रेजी में स्विच करने के कारणों को यह प्रदर्शित करके 'इन्सर्शनल कोड-स्विचिंग' के विशुद्ध रूप से वक्ता-संचालित सिद्धांत को चुनौती देता है कि यह इसलिए नहीं होता क्योंकि अंग्रेजी का उत्पादन करना आसान है, बल्कि इसलिए होता है क्योंकि इसकी पूर्वानुमेयता वास्तव में इसके समकक्ष चीनी विकल्पों की तुलना में और भी कम है, जो यह सुझाव देता है कि वक्ता कोड-स्विचिंग का उपयोग उत्पादन की सुगमता से परे उद्देश्यों के लिए करते हैं, जैसे कि श्रोता के अधिक ध्यान की आवश्यकता को संकेतित करना।

Debasmita Bhattacharya, Marten van Schijndel2026-05-06
💬 NLP

How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLP

यह शोधपत्र बॉट-जनरेटेड कंटेंट और भाषाई संदूषण जैसी व्यवस्थित समस्याओं की पहचान करने के लिए कठोर डेटा फ़िल्टरिंग लागू करके गैर-अंग्रेजी विकिपीडिया संस्करणों की गुणवत्ता का ऑडिट करता है, और अंततः यह प्रदर्शित करता है कि परिणामी उच्च-गुणवत्ता वाले फ़िल्टर्ड डेटा पर प्रशिक्षित मॉडल कच्चे डेटा पर प्रशिक्षित मॉडलों के बराबर या उनसे बेहतर प्रदर्शन करते हैं, विशेष रूप से निम्न-गुणवत्ता वाले भाषा संस्करणों के लिए।

Kushal Tatariya, Artur Kulmizev, Wessel Poelman, Esther Ploeger, Marcel Bollmann, Johannes Bjerva, Jiaming Luo, Heather (…)2026-05-06