🤖 machine learning

How do LLMs Compute Verbal Confidence

यह शोध पत्र यह प्रदर्शित करता है कि जेम्मा 3 (Gemma 3) और क्वेन 2.5 (Qwen 2.5) जैसे बड़े भाषा मॉडल जनरेशन के दौरान आत्मविश्वास के जटिल, उत्तर-गुणवत्ता-आधारित निरूपणों की गणना करने के बजाय उन्हें स्वतः ही कंप्यूट और कैश करते हैं, जो यह प्रकट करता है कि मौखिक आत्मविश्वास टोकन संभावनाओं के सरल पश्चात-निर्माण (post-hoc reconstruction) के बजाय वास्तविक मेटाकॉग्निटिव आत्म-मूल्यांकन को दर्शाता है।

Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic2026-03-19
💬 NLP

DebugLM: Learning Traceable Training Data Provenance for LLMs

DebugLM एक ऐसा फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को डेटा प्रोवेनेंस (डेटा की उत्पत्ति संबंधी) क्षमताओं से सुसज्जित करता है ताकि विशिष्ट व्यवहारों को उनके प्रशिक्षण डेटा स्रोतों तक ट्रैक किया जा सके और बिना पुन: प्रशिक्षण के लक्षित, पैरामीटर-मुक्त सुधार सक्षम किया जा सके।

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Wenxuan Zhou, Zhe Zhao, Muhao Chen2026-03-19
💬 NLP

IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia

यह शोध पत्र IndicSafe को प्रस्तुत करता है, जो 12 भारतीय भाषाओं में LLM सुरक्षा का मूल्यांकन करने वाला पहला बेंचमार्क है, जो महत्वपूर्ण क्रॉस-लैंग्वेज सेफ्टी ड्रिफ्ट और जनरलाइजेशन अंतराल को उजागर करता है जो सांस्कृतिक रूप से विविध, कम-संसाधन वाले परिवेश के लिए भाषा-जागरूक संरेखण रणनीतियों को आवश्यक बनाता है।

Priyaranjan Pattnayak, Sanchari Chowdhuri2026-03-19
💬 NLP

Efficient Training-Free Multi-Token Prediction via Embedding-Space Probing

यह शोध पत्र एक प्रशिक्षण-मुक्त (training-free) मल्टी-टोकन प्रेडिक्शन विधि प्रस्तावित करता है जो समानांतर स्पेक्युलेटिव डिकोडिंग को सक्षम करने के लिए ऑन-द-फ्लाई एम्बेडिंग-स्पेस मास्क टोकन प्रोबिंग का लाभ उठाता है, जिससे मॉडल वेट्स में बदलाव किए बिना या सहायक ड्राफ्ट मॉडल्स की आवश्यकता के बिना विभिन्न LLMs में महत्वपूर्ण थ्रूपुट लाभ और बढ़ी हुई स्वीकृति लंबाई प्राप्त होती है।

Raghavv Goel, Mukul Gagrani, Mingu Lee, Chris Lott2026-03-19
💬 NLP

Gender Disambiguation in Machine Translation: Diagnostic Evaluation in Decoder-Only Architectures

यह शोध पत्र डिकोडर-ओनली मशीन ट्रांसलेशन मॉडल्स में जेंडर डिस्एम्बिगुएशन (लिंग अस्पष्टता निवारण) का मूल्यांकन करने के लिए एक "प्रायर बायस" (पूर्व पूर्वाग्रह) मीट्रिक प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि ये मॉडल्स स्वाभाविक रूप से एनकोडर-डिकोडर आर्किटेक्चर से बेहतर प्रदर्शन नहीं करते हैं, फिर भी इंस्ट्रक्शन ट्यूनिंग जैसी पोस्ट-ट्रेनिंग तकनीकें प्रभावी रूप से पुल्लिंग पूर्वाग्रह को कम करती हैं और प्रासंगिक जागरूकता को बढ़ाती हैं।

Chiara Manna, Hosein Mohebbi, Afra Alishahi, Frédéric Blain, Eva Vanmassenhove2026-03-19
💬 NLP

ConGA: Guidelines for Contextual Gender Annotation. A Framework for Annotating Gender in Machine Translation

यह शोध पत्र कॉन्टेक्स्टुअल जेंडर एनोटेशन (ConGA) फ्रेमवर्क प्रस्तुत करता है, जो शब्द-स्तरीय लिंग एनोटेशन के लिए एक भाषाई रूप से आधारित दिशानिर्देश है, जो अंग्रेजी से इतालवी में मशीन अनुवाद में लिंग पूर्वाग्रह को संबोधित करने के लिए एक गोल्ड-स्टैंडर्ड डेटासेट बनाकर वर्तमान एमटी (MT) प्रणालियों के प्रदर्शन का मूल्यांकन और सुधार करता है।

Argentina Anna Rescigno, Eva Vanmassenhove, Johanna Monti2026-03-19
💬 NLP

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

Loc3R-VLM एक नवीन फ्रेमवर्क है जो ग्लोबल लेआउट रिकंस्ट्रक्शन और एक्सप्लिसिट सिचुएशन मॉडलिंग के संयुक्त उद्देश्यों का लाभ उठाकर और लाइटवेट कैमरा पोज़ प्रायर्स द्वारा निर्देशित होकर, मोनोकुलर वीडियो से मजबूत 3D समझ की क्षमताओं के साथ 2D विजन-लैंग्वेज मॉडल्स को उन्नत करता है ताकि भाषा-आधारित लोकलाइजेशन और 3D रीजनिंग में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys2026-03-19
💬 NLP

Constraining constructions with WordNet: pros and cons for the semantic annotation of fillers in the Italian Constructicon

यह शोध पत्र इतालवी कंस्ट्रक्टिकॉन (Italian Constructicon) के भीतर स्कीमैटिक फिलर्स (schematic fillers) को अर्थपूर्ण रूप से वर्गीकृत और एनोटेट करने के लिए ओपन मल्टीलिंगुअल वर्डनेट (Open Multilingual WordNet) विषयों का उपयोग करने के लाभों और हानियों का परीक्षण करता है।

Flavio Pisciotta, Ludovica Pannitto, Lucia Busso, Beatrice Bernasconi, Francesca Masini2026-03-18
💬 NLP

BiomedSQL: Text-to-SQL for Scientific Reasoning on Biomedical Knowledge Bases

यह शोध पत्र BiomedSQL प्रस्तुत करता है, जो एक वास्तविक दुनिया के बायोमेडिकल नॉलेज बेस पर टेक्स्ट-टू-SQL जनरेशन में वैज्ञानिक तर्क (scientific reasoning) का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो जटिल डोमेन-विशिष्ट मानदंडों को संभालने में वर्तमान लार्ज लैंग्वेज मॉडल्स और विशेषज्ञ बेसलाइन्स के बीच प्रदर्शन के महत्वपूर्ण अंतर को प्रकट करता है।

Mathew J. Koretsky, Maya Willey, Owen Bianchi, Chelsea X. Alvarado, Tanay Nayak, Nicole Kuznetsov, Sungwon Kim, Mike A. (…)2026-03-18
💬 NLP

Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models

यह शोध पत्र एक अनिश्चितता-निर्देशित प्रोबिंग पद्धति प्रस्तावित करता है जो एलएलएम (LLM) के भ्रमों (confabulations) का पता लगाने में सुधार करने के लिए टोकन-स्तरीय हिडन स्टेट्स को एकत्रित करता है, यह प्रकट करते हुए कि जबकि भ्रामक संदर्भ आत्मविश्वासपूर्ण गलत प्रतिक्रियाओं को प्रेरित कर सकते हैं, एलेयटोरिक (aleatoric) और एपिस्टेमिक (epistemic) अनिश्चितता का लाभ उठाना ओपन-सोर्स मॉडल में विश्वसनीयता अनुमान को महत्वपूर्ण रूप से बढ़ाता है।

Tianyi Zhou, Johanne Medina, Sanjay Chawla2026-03-18