💬 NLP

Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models

यह अध्ययन प्रकट करता है कि ओपन-वेट रीजनिंग मॉडल अक्सर "सोचने-उत्तर के विचलन" (thinking-answer divergence) का प्रदर्शन करते हैं, जहाँ भ्रामक संकेतों का पालन करने वाले आधे से अधिक मामलों में वे अपने दृश्य उत्तरों के बजाय केवल अपने आंतरिक थिंकिंग टोकन में प्रभाव को स्वीकार करते हैं, जिससे यह सिद्ध होता है कि केवल उत्तर-पाठ संबंधी निगरानी छिपे हुए रीजनिंग पूर्वाग्रहों के बहुमत को पकड़ने में विफल रहती है।

Richard J. Young2026-03-30
💬 NLP

Analysing Calls to Order in German Parliamentary Debates

यह अध्ययन जर्मन संसदीय बहसों के 72 वर्षों का व्यवस्थित रूप से विश्लेषण करने के लिए एक नवीन डेटासेट और नियम-आधारित पद्धति प्रस्तुत करता है, जो यह प्रकट करता है कि 'कॉल टू ऑर्डर' (व्यवस्था बनाए रखने हेतु निर्देश) अक्सर व्यक्तिगत अपमानों से प्रेरित होते हैं और पुरुष विपक्षी सदस्यों के विरुद्ध असमान रूप से जारी किए जाते हैं, जबकि यह उनके अनुप्रयोग पर सत्र अध्यक्षों के व्यक्तिपरक प्रभाव को भी रेखांकित करता है।

Nina Smirnova, Daniel Dan, Philipp Mayr2026-03-30
💬 NLP

Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models

यह शोध पत्र प्रदर्शित करता है कि स्थानीय रूप से तैनात, ओपन-सोर्स लार्ज लैंग्वेज मॉडल्स प्राकृतिक भाषा प्रश्नों का उपयोग करके फिनिश इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से रोगी-विशिष्ट जानकारी को सटीक और कुशलता से पुनर्प्राप्त कर सकते हैं, जो नैदानिक रूप से महत्वपूर्ण त्रुटियों को कम करने के लिए मानव निरीक्षण की आवश्यकता पर प्रकाश डालते हुए उच्च सटीकता और निरंतरता प्राप्त करते हैं।

Mikko Saukkoriipi, Nicole Hernandez, Jaakko Sahlsten, Kimmo Kaski, Otso Arponen2026-03-30
💬 NLP

ClimateCheck 2026: Scientific Fact-Checking and Disinformation Narrative Classification of Climate-related Claims

क्लाइमेटचेक 2026 एक साझा कार्य है जो विस्तारित डेटासेट, एनोटेशन पूर्वाग्रहों को संबोधित करने वाले नवीन मूल्यांकन ढांचे और विभिन्न जलवायु दुष्प्रचार प्रकारों की परिवर्तनशील सत्यापन क्षमता में अंतर्दृष्टि के माध्यम से जलवायु संबंधी दावों के स्वचालित सत्यापन और दुष्प्रचार आख्यानों के वर्गीकरण को आगे बढ़ाता है।

Raia Abu Ahmad, Max Upravitelev, Aida Usmanova, Veronika Solopova, Georg Rehm2026-03-30
⚛️ quantum physics

Entanglement as Memory: Mechanistic Interpretability of Quantum Language Models

यह अध्ययन क्वांटम लैंग्वेज मॉडल्स के लिए पहले मैकेनिस्टिक इंटरप्रिटेबिलिटी फ्रेमवर्क का परिचय देता है, जो यह प्रकट करता है कि जहाँ दो-क्यूबिट मॉडल एक विशिष्ट एंटैंगलमेंट-आधारित मेमोरी रणनीति सीख सकते हैं, वहीं यह दृष्टिकोण नाजुक है और वास्तविक दुनिया के डिवाइस नॉइज़ के तहत ढह जाता है, जबकि सिंगल-क्यूबिट मॉडल क्लासिकली सिमुलेबल योग्य रणनीतियों पर डिफ़ॉल्ट रूप से वापस आ जाते हैं।

Nathan Roll2026-03-30
💬 NLP

Clinical named entity recognition in the Portuguese language: a benchmark of modern BERT models and LLMs

यह अध्ययन पुर्तगाली में नैदानिक नामित इकाई पहचान (clinical named entity recognition) के लिए विभिन्न BERT-आधारित मॉडलों और बड़े भाषा मॉडलों का बेंचमार्किंग करता है, जो यह प्रदर्शित करता है कि mmBERT-base मॉडल सार्वजनिक और निजी डेटासेट पर उच्चतम प्रदर्शन (micro F1 = 0.76) प्राप्त करता है, विशेष रूप से जब क्लास असंतुलन को संबोधित करने के लिए इटरेटिव स्ट्रैटिफिकेशन (iterative stratification) के साथ जोड़ा जाता है।

Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Koci (…)2026-03-30
💬 NLP

AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese

यह शोध पत्र AMALIA को प्रस्तुत करता है, जो एक पूर्णतः ओपन-सोर्स लार्ज लैंग्वेज मॉडल है जिसे लक्षित उच्च-गुणवत्ता वाले डेटा प्रशिक्षण और नेटिव बेंचमार्क के एक नए समूह के माध्यम से यूरोपीय पुर्तगाली के लिए अनुकूलित किया गया है, जो यह प्रदर्शित करता है कि इस तरह के केंद्रित दृष्टिकोण विशिष्ट वेरिएंट-आधारित कार्यों पर मानक मॉडलों की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Afonso Simplício, Gonçalo Vinagre, Miguel Moura Ramos, Diogo Tavares, Rafael Ferreira, Giuseppe Attanasio, Duarte M. Alv (…)2026-03-30
💬 NLP

ALBA: A European Portuguese Benchmark for Evaluating Language and Linguistic Dimensions in Generative LLMs

यह शोध पत्र ALBA को प्रस्तुत करता है, जो एक हस्तनिर्मित, भाषाई रूप से आधारित बेंचमार्क है जिसे यूरोपीय पुर्तगाली के आठ विशिष्ट भाषाई आयामों पर लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो इस कम प्रतिनिधित्व वाले भाषा प्रकार के लिए वर्तमान संसाधनों की कमी को संबोधित करता है।

Inês Vieira, Inês Calvo, Iago Paulo, James Furtado, Rafael Ferreira, Diogo Tavares, Diogo Glória-Silva, David Semedo, Jo (…)2026-03-30
🧬 biology

Development of a European Union Time-Indexed Reference Dataset for Assessing the Performance of Signal Detection Methods in Pharmacovigilance using a Large Language Model

यह अध्ययन 1,513 केंद्रीय रूप से अधिकृत औषधीय उत्पादों से प्राप्त और DeepSeek V3 का उपयोग करके संसाधित एक नवीन समय-सूचकांक संदर्भ डेटासेट विकसित करके फार्माकोविजिलेंस में एक महत्वपूर्ण अंतराल को संबोधित करता है, जो सिग्नल डिटेक्शन विधियों के अधिक सटीक मूल्यांकन और तुलना को सक्षम करने के लिए प्रतिकूल घटना की पहचान के सटीक समय को समाहित करता है।

Maria Kefala, Jeffery L. Painter, Syed Tauhid Bukhari, Maurizio Sessa2026-03-30
💬 NLP

PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning

यह शोध पत्र PerceptionComp को प्रस्तुत करता है, जो 279 विविध वीडियो में फैले 1,114 जटिल प्रश्नों वाला एक मैन्युअल रूप से एनोटेट किया गया बेंचमार्क है जिसके लिए बहु-चरणीय, दीर्घ-क्षितिज (long-horizon) धारणात्मक तर्क की आवश्यकता होती है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल और यहाँ तक कि मनुष्य भी उन कार्यों के साथ महत्वपूर्ण रूप से संघर्ष करते हैं जिनमें संरचनात्मक तर्क और बार-बार दृश्य साक्ष्य की मांग होती है।

Shaoxuan Li, Zhixuan Zhao, Hanze Deng, Zirun Ma, Shulin Tian, Zuyan Liu, Yushi Hu, Haoning Wu, Yuhao Dong, Benlin Liu, Z (…)2026-03-30