💻 computer science

On Verbalized Confidence Scores for LLMs

यह शोध पत्र कॉन्फिडेंस स्कोर के माध्यम से अपनी अनिश्चितता को व्यक्त करने में लार्ज लैंग्वेज मॉडल्स की विश्वसनीयता की जांच करता है, यह प्रदर्शित करते हुए कि हालांकि प्रभावशीलता प्रॉम्प्टिंग रणनीति के अनुसार भिन्न होती है, विशिष्ट विधियाँ कम ओवरहेड के साथ अच्छी तरह से कैलिब्रेटेड, मॉडल-अज्ञेय अनिश्चितता परिमाणीकरण प्रदान कर सकती हैं।

Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada2026-05-06
💬 NLP

Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong

यह शोध पत्र प्रदर्शित करता है कि चेन-ऑफ-थॉट प्रॉम्प्टिंग बड़े भाषा मॉडलों के आत्मविश्वास को व्यवस्थित रूप से बढ़ा देती है, विशेष रूप से तब जब वे गलत होते हैं, जिससे अंशांकन (कैलिब्रेशन) खराब होता है और संभाव्यता-आधारित मूल्यांकन अविश्वसनीय हो जाता है।

Tairan Fu, Javier Conde, Gonzalo Martínez, María Grandury, Pedro Reviriego2026-05-06
🤖 machine learning

Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks

यह शोध पत्र "बायस इनहेरिटेंस" (पूर्वाग्रह विरासत) की पहली व्यवस्थित जांच प्रस्तुत करता है, जो यह प्रदर्शित करता है कि डेटा संवर्धन (डेटा ऑग्मेंटेशन) के लिए उपयोग किए जाने वाले लार्ज लैंग्वेज मॉडल्स (LLMs) कैसे डाउनस्ट्रीम कार्यों में प्रशिक्षण पूर्वाग्रहों को प्रसारित और प्रवर्धित कर सकते हैं, साथ ही प्रमुख मिसअलाइनमेंट कारकों की पहचान करता है और इस चुनौती से निपटने के लिए तीन विशिष्ट शमन रणनीतियों का प्रस्ताव करता है।

Miaomiao Li, Hao Chen, Yang Wang, Tingyuan Zhu, Weijia Zhang, Kaijie Zhu, Kam-Fai Wong, Jindong Wang2026-05-06
💬 NLP

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs

यह शोध पत्र TOHA को प्रस्तुत करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) प्रणालियों के लिए एक टोपोलॉजी-आधारित मतिभ्रम डिटेक्टर (hallucination detector) है, जो प्रॉम्प्ट और रिस्पॉन्स अटेंशन ग्राफ्स के बीच टोपोलॉजिकल डाइवर्जेंस को मापकर तथ्यात्मक रूप से गलत आउटपुट की पहचान करता है, और न्यूनतम डेटा एवं कंप्यूटेशनल संसाधनों के साथ अत्याधुनिक प्रदर्शन प्राप्त करता है।

Alexandra Bazarova, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Andrei Volodichev, Konstantin Polev, Julia Belikova (…)2026-05-06
💬 NLP

TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models

यह शोध पत्र TF1-EN-3M को प्रस्तुत करता है, जो एक संरचित छह-स्लॉट स्कैफोल्ड और एक पुनरुत्पादक मूल्यांकन पाइपलाइन का उपयोग करके छोटे, ओपन-वेट लैंग्वेज मॉडल्स द्वारा जनरेट किए गए तीन मिलियन सिंथेटिक अंग्रेजी नैतिक उपदेशों (मोरल फेबल्स) का एक नवीन ओपन डेटासेट है, जो यह प्रदर्शित करता है कि प्रोप्रायटरी विशाल मॉडल्स पर निर्भर किए बिना उच्च गुणवत्ता वाला, बड़े पैमाने पर नैतिक कहानी लेखन प्राप्त किया जा सकता है।

Mihai Nadas, Laura Diosan, Andrei Piscoran, Andreea Tomescu2026-05-06
💬 NLP

Adaptive GoGI-Skip: Coupling Goal-Gradient Importance with Dynamic Uncertainty for Efficient Reasoning

यह शोध पत्र Adaptive GoGI-Skip को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो Goal-Gradient Importance को गतिशील अनिश्चितता-आधारित स्किपिंग (dynamic uncertainty-based skipping) के साथ जोड़ता है ताकि सटीकता से समझौता किए बिना Chain-of-Thought रीजनिंग में टोकन वॉल्यूम को 45% से अधिक कम किया जा सके और इन्फरेंस को 2.0×\times तक त्वरित किया जा सके।

Ren Zhuang2026-05-06
💬 NLP

ATR-Bench: A Federated Learning Benchmark for Adaptation, Trust, and Reasoning

यह शोध पत्र ATR-Bench प्रस्तुत करता है, जो एक एकीकृत फेडरेटेड लर्निंग बेंचमार्क फ्रेमवर्क है जो विकेंद्रीकृत मॉडल प्रशिक्षण में मानकीकृत मूल्यांकन की कमी को दूर करने और निष्पक्ष तुलना को सुगम बनाने के लिए तीन मौलिक आयामों—अनुकूलन (Adaptation), विश्वास (Trust), और तर्क (Reasoning)—में विधियों का व्यवस्थित रूप से मूल्यांकन करता है।

Tajamul Ashraf, Mohammed Mohsen Peerzada, Moloud Abdar, Yutong Xie, Yuyin Zhou, Xiaofeng Liu, Iqra Altaf Gillani, Janibu (…)2026-05-06
💬 NLP

Automatic Correction of Writing Anomalies in Hausa Texts

यह शोध पत्र 4,00,000 से अधिक नॉइजी-क्लीन (noisy-clean) वाक्य युग्मों के एक बड़े पैमाने के समानांतर डेटासेट का निर्माण करके हौसा (Hausa) ग्रंथों में विसंगतियों को लिखने की चुनौती को संबोधित करता है और यह प्रदर्शित करता है कि फाइन-ट्यून्ड ट्रांसफॉर्मर मॉडल, विशेष रूप से M2M100, इन त्रुटियों को प्रभावी ढंग से सुधार सकते हैं ताकि डाउनस्ट्रीम एनएलपी (NLP) कार्यों में महत्वपूर्ण सुधार किया जा सके।

Ahmad Mustapha Wali, Sergiu Nisioi2026-05-06
💬 NLP

Constructing Interpretable Features from Compositional Neuron Groups

यह शोध पत्र एमएलपी (MLP) सक्रियणों (activations) को सह-सक्रिय न्यूरॉन्स से बनी विरल (sparse), व्याख्या योग्य विशेषताओं में विघटित करने के लिए सेमी-नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन (SNMF) का उपयोग करने का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण कॉज़ल स्टीयरिंग (causal steering) में स्पार्स ऑटोएनकोडर और सुपरवाइज्ड बेसलाइन्स से बेहतर प्रदर्शन करता है और बड़े भाषा मॉडलों में अवधारणात्मक निरूपणों की एक पदानुक्रमित संरचना को प्रकट करता है।

Or Shafran, Atticus Geiger, Mor Geva2026-05-06
💬 NLP

Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness

यह शोध पत्र अलाइनमेंट सुरक्षा मार्जिन को मापने के लिए एक फॉरवर्ड-पास डायग्नोस्टिक के रूप में "रिफ्यूज़ल-अफ़र्मेशन लॉजिट गैप" (refusal-affirmation logit gap) को प्रस्तुत करता है और प्रदर्शित करता है कि "लॉजिट-गैप स्टीयरिंग" (logit-gap steering) कुशलतापूर्वक कम-परप्लेक्सिटी वाले, हस्तांतरणीय इन-डिस्ट्रीब्यूशन सफ़िक्स (in-distribution suffixes) की खोज कर सकता है जो वर्तमान सुरक्षा प्रणालियों को बायपास कर देते हैं, जिससे यह पता चलता है कि अलाइनमेंट सुदृढ़ता अक्सर बहुत पतले परिचालन मार्जिन पर निर्भर करती है।

Tung-Ling Li, Hongliang Liu2026-05-06