💬 NLP

Generalization of Fine-Tuned Uncertainty Communication and Metacognition in Large Language Models

यह शोध पत्र प्रदर्शित करता है कि सुपरवाइज्ड फाइन-ट्यूनिंग बड़े भाषा मॉडलों की अनिश्चितता व्यक्त करने की क्षमता और सटीकता के साथ आत्मविश्वास को संरेखित करने की क्षमता में सुधार कर सकती है, हालांकि ये मेटाकॉग्निटिव लाभ विभिन्न कॉन्फिडेंस असेसमेंट फॉर्मेट्स की तुलना में विभिन्न डोमेन में बेहतर तरीके से सामान्यीकृत होते हैं, जिसमें मल्टीटास्क ट्रेनिंग सबसे सुदृढ़ सामान्यीकरण प्रदान करती है।

Mark Steyvers, Catarina Belem, Padhraic Smyth2026-06-23
💬 NLP

Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility

यह अध्ययन प्रदर्शित करता है कि मानव और एलएलएम (LLM) दोनों ही सामान्य ज्ञान वाले उत्तरों के तर्कसंगतता संबंधी निर्णयों में एलएलएम द्वारा निर्मित तर्कों से महत्वपूर्ण रूप से प्रभावित होते हैं, जो मानव संज्ञान के अध्ययन के लिए एक नवीन विधि को उजागर करता है और सामान्य ज्ञान के क्षेत्रों में भी मानवीय विश्वासों को अनुचित रूप से प्रभावित करने की एआई (AI) की क्षमता के बारे में चिंताएँ बढ़ाता है।

Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger2026-06-23
💬 NLP

The Alignment Veto: How Safety Training Suppresses Cultural Knowledge in LLMs

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) प्रशिक्षण अक्सर सांस्कृतिक ज्ञान को मिटाने के बजाय उसे दबा देता है, जिससे एक असमान "अलाइनमेंट वीटो" उत्पन्न होता है जहाँ आंतरिक प्रतिनिधित्व सटीक रहते हैं लेकिन आउटपुट के स्तर पर बाधित हो जाते हैं, जिसके परिणामस्वरूप विभिन्न राष्ट्रों और भाषाओं के बीच महत्वपूर्ण सुरक्षा लागत और गुणवत्ता अंतराल पैदा होते हैं।

Pardis Sadat Zahraei, Gokhan Tur, Dilek Hakkani-Tür, Ehsaneddin Asgari2026-06-23
💬 NLP

The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models

यह शोध पत्र 'कौमेलियन बेंचमार्क' (Chameleon Benchmark) को प्रस्तुत करता है जो यह प्रकट करता है कि सर्च-सक्षम लार्ज लैंग्वेज मॉडल्स (LLMs) गंभीर "कौमेलियन व्यवहार" प्रदर्शित करते हैं—सीमित ज्ञान विविधता और क्वेरी फ्रेमिंग पर अत्यधिक निर्भरता के कारण बहु-चरणीय (multi-turn) बातचीत में व्यवस्थित रूप से अपने रुख बदलते हैं—जो स्वास्थ्य सेवा और कानून जैसे उच्च-जोखिम वाले क्षेत्रों के लिए महत्वपूर्ण विश्वसनीयता जोखिम पैदा करते हैं।

Shivam Ratnakar, Sanjay Raghavendra2026-06-23
💬 NLP

OpenSIR: Open-Ended Self-Improving Reasoner

OpenSIR एक सेल्फ-प्ले फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को शिक्षक और छात्र के रूप में बारी-बारी से कार्य करके, बिना किसी बाहरी एनोटेशन के नवीन समस्याओं को उत्पन्न करने और उन्हें हल करने के माध्यम से उनकी तर्क क्षमता में निरंतर सुधार करने में सक्षम बनाता है, जिससे गणित और सामान्य रीजनिंग बेंचमार्क में निरंतर प्रदर्शन लाभ प्राप्त होता है।

Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini2026-06-23
💬 NLP

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

यह शोध पत्र यह प्रकट करता है कि बहुभाषी LLMs में उच्च-संसाधन और निम्न-संसाधन भाषाओं के बीच दिखने वाला प्रदर्शन अंतराल काफी हद तक MGSM बेंचमार्क में अनुवाद त्रुटियों और असंगत उत्तर निष्कर्षण का एक परिणाम है, जो इन डेटा गुणवत्ता संबंधी समस्याओं को ठीक करने पर समाप्त हो जाता है।

Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag2026-06-23
💬 NLP

MedPath: Multi-Domain Cross-Vocabulary Hierarchical Paths for Biomedical Entity Linking

MedPath एक बड़े पैमाने का, बहु-डोमेन बायोमेडिकल एंटिटी लिंकिंग डेटासेट है जो व्याख्यात्मक और इंटरऑपरेबल क्लिनिकल NLP मॉडल के विकास को सक्षम करने के लिए UMLS सामान्यीकरण, 62 शब्दावली मैपिंग और पूर्ण ऑन्टोलॉजिकल पाथ के साथ नौ मौजूदा संसाधनों को एकीकृत करता है।

Nishant Mishra, Wilker Aziz, Iacer Calixto2026-06-23
💬 NLP

Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning

यह शोध पत्र "टेल मी" (Tell Me) को प्रस्तुत करता है, जो एक व्यापक LLM-संचालित मानसिक कल्याण प्रणाली है जो एक RAG-आधारित संवादात्मक सहायक, अनुसंधान और डेटा संवर्धन के लिए एक सिंथेटिक संवाद जनरेटर, और व्यक्तिगत स्व-देखभाल योजनाएं एवं निर्देशित ध्यान प्रदान करने के लिए एक एजेंटिक प्लानिंग क्रू को एकीकृत करती है, जिसका लक्ष्य जिम्मेदार, संदर्भ-जागरूक AI नवाचार के माध्यम से मानसिक स्वास्थ्य सहायता के अंतराल को पाटना है।

Trishala Jayesh Ahalpara2026-06-23
⚡ electrical engineering

Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking

यह शोध पत्र एक संयुक्त प्रशिक्षण दृष्टिकोण प्रस्तावित करता है जो सीमित स्पोकन डायलॉग स्टेट ट्रैकिंग डेटा को अन्य डोमेन के प्रचुर टेक्स्टुअल डेटा के साथ जोड़ता है ताकि लार्ज लैंग्वेज मॉडल-आधारित एंड-टू-एंड सिस्टम को बिना किसी टारगेट-डोमेन स्पोकन एनोटेशन की आवश्यकता के मजबूत क्रॉस-डोमेन सामान्यीकरण प्राप्त करने में सक्षम बनाया जा सके।

Katia Vendrame, Bolaji Yusuf, Santosh Kesiraju, Šimon Sedláček, Oldřich Plchot, Jan Černocký2026-06-23
💬 NLP

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

यह शोध पत्र IDRBench प्रस्तुत करता है, जो डीप रिसर्च एजेंटों की संवादात्मक क्षमताओं का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह मापता है कि वे स्पष्टीकरण कैसे मांगते हैं और विकसित होते उपयोगकर्ता के इरादे के साथ तालमेल कैसे बिठाते हैं, और यह प्रदर्शित करता है कि ऐसा संवाद विभिन्न बड़े भाषा मॉडलों (LLMs) में अनुसंधान की गुणवत्ता और मजबूती में महत्वपूर्ण सुधार करता है।

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung2026-06-23