🤖 AI

UQLM: A Python Package for Uncertainty Quantification in Large Language Models

यह शोध पत्र UQLM का परिचय देता है, जो एक पायथन पैकेज है जो भ्रम (hallucinations) का पता लगाने और लार्ज लैंग्वेज मॉडल (LLM) के आउटपुट की विश्वसनीयता बढ़ाने के लिए कॉन्फिडेंस स्कोर उत्पन्न करने हेतु अत्याधुनिक अनिश्चितता परिमाणीकरण (uncertainty quantification) तकनीकों का लाभ उठाता है।

Dylan Bouchard, Mohit Singh Chauhan, David Skarbrevik, Ho-Kyeong Ra, Viren Bajaj, Zeya Ahmad2026-03-05
🤖 AI

From Ambiguity to Accuracy: The Transformative Effect of Coreference Resolution on Retrieval-Augmented Generation systems

यह अध्ययन प्रदर्शित करता है कि रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में कोरेफरेंस रेजोल्यूशन (coreference resolution) को एकीकृत करना, विशेष रूप से छोटे भाषा मॉडलों के लिए, उन एंटिटी अस्पष्टताओं को हल करके रिट्रीवल प्रासंगिकता और प्रश्न-उत्तर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है जो अन्यथा संदर्भ संबंधी समझ को बाधित करती हैं।

Youngjoon Jang, Seongtae Hong, Junyoung Son, Sungjin Park, Chanjun Park, Heuiseok Lim2026-03-05
🤖 AI

Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition

यह शोध पत्र 'ऑफ-बाय-वन' जोड़ (addition) कार्य पर व्याख्यात्मकता तकनीकों (interpretability techniques) का उपयोग यह प्रकट करने के लिए करता है कि बड़े भाषा मॉडल एक पुन: प्रयोज्य "फंक्शन इंडक्शन" तंत्र के माध्यम से कार्य-स्तरीय सामान्यीकरण प्राप्त करते हैं, जहाँ कई अटेंशन हेड्स (attention heads) अनदेखी समस्याओं को हल करने के लिए अमूर्त फलनों (abstract functions) को सीखने और संयोजित करने के लिए सहयोगात्मक रूप से कार्य करते हैं।

Qinyuan Ye, Robin Jia, Xiang Ren2026-03-05
🤖 AI

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

यह शोध पत्र Text2VLM को प्रस्तुत करता है, जो एक नवीन पाइपलाइन है जो केवल टेक्स्ट वाले डेटासेट को मल्टीमॉडल प्रॉम्प्ट में परिवर्तित करती है ताकि ओपन-सोर्स विजुअल लैंग्वेज मॉडल्स की टाइपोग्राफिक प्रॉम्प्ट इंजेक्शन हमलों के प्रति बढ़ी हुई संवेदनशीलता का मूल्यांकन और अनावरण किया जा सके, जिससे मल्टीमॉडल एआई के लिए सुदृढ़ सुरक्षा तंत्रों के विकास को आगे बढ़ाया जा सके।

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas2026-03-05
🤖 AI

WebDS: An End-to-End Benchmark for Web-based Data Science

यह शोध पत्र WebDS को प्रस्तुत करता है, जो विविध वेबसाइटों में 870 जटिल, बहु-चरणीय कार्यों वाला वेब-आधारित डेटा विज्ञान का पहला एंड-टू-एंड बेंचमार्क है, जो वास्तविक दुनिया के डेटा अधिग्रहण, विश्लेषण और अंतर्दृष्टि पीढ़ी में वर्तमान LLM एजेंटों और मानव क्षमताओं के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexa (…)2026-03-05
🤖 AI

ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering

यह शोध पत्र ObfusQAte और ObfusQA फ्रेमवर्क प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे बहु-स्तरीय अस्पष्टता (multi-tiered obfuscation) के अधीन तथ्यात्मक प्रश्नों पर लार्ज लैंग्वेज मॉडल्स की मजबूती का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि सूक्ष्म भाषाई विविधताओं का सामना करने पर मॉडल अक्सर विफल हो जाते हैं या मतिभ्रम (hallucinate) का शिकार हो जाते हैं।

Shubhra Ghosh, Abhilekh Borah, Aditya Kumar Guru, Kripabandhu Ghosh2026-03-05
💬 NLP

MultiWikiQA: A Reading Comprehension Benchmark in 300+ Languages

यह शोधपत्र MultiWikiQA को प्रस्तुत करता है, जो 306 भाषाओं को कवर करने वाला एक बड़े पैमाने का रीडिंग कॉम्प्रिहेन्शन (पठन बोध) बेंचमार्क है, जिसमें विकिपीडिया लेखों से उत्पन्न 1.2 मिलियन से अधिक नमूने शामिल हैं और जिसे मानव मूल्यांकन द्वारा सत्यापित किया गया है, जो भाषाओं और मॉडल आर्किटेक्चर के बीच महत्वपूर्ण प्रदर्शन असमानताओं को प्रदर्शित करता है।

Dan Saattrup Smart2026-03-05
🤖 AI

GraphMERT: Efficient and Scalable Distillation of Reliable Knowledge Graphs from Unstructured Data

यह शोध पत्र GraphMERT को प्रस्तुत करता है, जो एक संक्षिप्त, कुशल एनकोडर-ओनली मॉडल है जो असंरचित पाठ से उच्च गुणवत्ता वाले, तथ्यात्मक रूप से सटीक और ऑन्टोलॉजी-संगत ज्ञान ग्राफ़ को आसवन (distill) करके बड़े भाषा मॉडलों की स्केलेबिलिटी और विश्वसनीयता की सीमाओं को दूर करता है, जिससे एक स्केलेबल न्यूरोसिम्बोलिक फ्रेमवर्क स्थापित होता है जो सटीकता और प्रतीकात्मक वैधता दोनों में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Margarita Belova, Jiaxin Xiao, Shikhar Tuli, Niraj K. Jha2026-03-05
🤖 AI

The Geometry of Reasoning: Flowing Logics in Representation Space

यह शोध पत्र एक नवीन ज्यामितीय ढांचे का प्रस्ताव करता है जो एलएलएम (LLM) तर्क को प्रतिनिधित्व स्थान (representation space) में सुचारू प्रवाह के रूप में मॉडल करता है, जो अनुभवजन्य प्रयोगों के माध्यम से यह प्रदर्शित करता है कि अगला-टोकन पूर्वानुमान मॉडलों को तार्किक अपरिवर्तनीयताओं (logical invariants) को उच्च-क्रम ज्यामिति के रूप में आत्मसात करने में सक्षम बनाता है, जिससे "स्टोकेस्टिक पैरट" (stochastic parrot) परिकल्पना को चुनौती मिलती है और मशीन समझ के अंतर्निहित एक सार्वभौमिक प्रतिनिधित्व नियम का सुझाव मिलता है।

Yufa Zhou, Yixiao Wang, Xunjian Yin, Shuyan Zhou, Anru R. Zhang2026-03-05
💬 NLP

Annotation-Efficient Universal Honesty Alignment

यह शोध पत्र EliCal प्रस्तुत करता है, जो एक एनोटेशन-कुशल दो-चरणीय ढांचा है जो बड़े भाषा मॉडलों में सार्वभौमिक ईमानदारी संरेखण (honesty alignment) प्राप्त करने के लिए कम खर्चीली आत्म-संगति उद्दलन (self-consistency elicitation) को न्यूनतम शुद्धता लेबलिंग के साथ जोड़ता है, जिसे नए जारी किए गए HonestyBench बेंचमार्क द्वारा मान्य किया गया है।

Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng2026-03-05