🤖 machine learning

Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States

यह शोध पत्र मानक सुदृढीकरण शिक्षण (reinforcement learning) की क्षमता सीमा को पार करने के लिए एलएलएम (LLM) पोस्ट-ट्रेनिंग में स्पष्ट मार्कोव अवस्थाओं (Markov states) को पुन: पेश करने का प्रस्ताव देता है, जो सैद्धांतिक रूप से नमूना जटिलता (sample complexity) को कम करता है और इतिहास-निर्भर मॉडलिंग से संरचित मार्कोवियन प्रतिनिधित्वों की ओर स्थानांतरित होकर जटिल तर्क पहेलियों पर बेहतर प्रदर्शन को अनुभवजन्य रूप से प्रदर्शित करता है।

Yurun Yuan, Tengyang Xie2026-03-23
💬 NLP

When Contextual Inference Fails: Cancelability in Interactive Instruction Following

यह शोध पत्र 'बिल्ड व्हाट आई मीन' (BWIM) बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि अत्याधुनिक लार्ज लैंग्वेज मॉडल्स सहयोगात्मक कार्यों में वक्ता की अविश्वसनीयता का पता लगा सकते हैं, लेकिन वे इस अंतर्दृष्टि को कुशल स्पष्टीकरण रणनीतियों में बदलने में विफल रहते हैं, और अक्सर अत्यधिक स्पष्टीकरण या अनुमान लगाने जैसे उप-इष्टतम व्यवहारों का सहारा लेते हैं।

Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz2026-03-23
💬 NLP

LoASR-Bench: Evaluating Large Speech Language Models on Low-Resource Automatic Speech Recognition Across Language Families

यह शोध पत्र LoASR-Bench प्रस्तुत करता है, जो 9 परिवारों की 25 भाषाओं से युक्त एक व्यापक बेंचमार्क है, जिसे कम-संसाधन वाले स्वचालित भाषण पहचान (automatic speech recognition) परिदृश्यों में वर्तमान बड़े स्पीच लैंग्वेज मॉडल्स (Large Speech Language Models) की सीमाओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Jianan Chen, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen2026-03-23
💬 NLP

Reasoning Gets Harder for LLMs Inside A Dialogue

यह शोध पत्र BOULDER प्रस्तुत करता है, जो एक नया गतिशील बेंचमार्क है और यह दर्शाता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) आइसोलेटेड सेटिंग्स की तुलना में टास्क-ओरिएंटेड डायलॉग्स के भीतर फ्रेम किए जाने पर रीजनिंग कार्यों में प्रदर्शन का एक महत्वपूर्ण और निरंतर अंतराल प्रदर्शित करते हैं, जिसका मुख्य कारण मल्टी-टर्न इंटरैक्शन, रोल कंडीशनिंग और टूल-यूज़ की जटिलताएं हैं।

Ivan Kartáč, Mateusz Lango, Ondřej Dušek2026-03-23
💬 NLP

Semantic Token Clustering for Efficient Uncertainty Quantification in Large Language Models

यह शोध पत्र सिमेंटिक टोकन क्लस्टरिंग (STC) का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (LLMs) के लिए एक कुशल अनिश्चितता मात्रा निर्धारण (uncertainty quantification) विधि है, जो एकल पीढ़ी (single generation) के माध्यम से अर्थपूर्ण रूप से सुसंगत टोकन समूहों पर प्रायिकता द्रव्यमान (probability mass) को एकत्रित करता है, जिससे बार-बार नमूनाकरण (repeated sampling) या सहायक मॉडलों के कम्प्यूटेशनल ओवरहेड के बिना अत्याधुनिक प्रदर्शन प्राप्त होता है।

Qi Cao, Andrew Gambardella, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa2026-03-23
💬 NLP

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

यह शोध पत्र एक जलवायु मूल्यांकन ढांचे का उपयोग करते हुए यह मूल्यांकन करता है कि कैसे निर्देश-ट्यून किए गए भाषा मॉडल उपयोगकर्ता-संरेखण (user-alignment) के दबावों और इन-कॉन्टेक्स्ट साक्ष्य के प्रति निष्ठा के बीच संतुलन बनाते हैं, जो यह प्रकट करता है कि केवल समृद्ध साक्ष्य ही चाटुकारितापूर्ण उलटफेर (sycophantic reversals) को रोकने में विफल रहते हैं और मॉडल विशिष्ट विफलता मोड प्रदर्शित करते हैं जिनमें ज्ञानमीमांसीय सूक्ष्मता (epistemic nuance) के साथ नकारात्मक अंतःक्रिया, गैर-एकदिष्ट सुदृढ़ता स्केलिंग (non-monotonic robustness scaling), और संघर्ष के तहत भिन्न वितरण प्रसार (distributional dispersion) शामिल हैं।

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer2026-03-23
💬 NLP

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

यह शोध पत्र यह प्रदर्शित करता है कि LLM चेन-ऑफ-थॉट रीजनिंग के लिए रिपोर्ट किए गए फेथफुलनेस (faithfulness) मेट्रिक्स वस्तुनिष्ठ गुण नहीं हैं, बल्कि वे मूल्यांकन क्लासिफायर के चयन के प्रति अत्यधिक संवेदनशील हैं, जिससे दरों, रैंकिंग और निष्कर्षों में सांख्यिकीय रूप से महत्वपूर्ण विसंगतियां उत्पन्न होती हैं जो एकल बिंदु अनुमानों के बजाय संवेदनशीलता श्रेणियों को रिपोर्ट करने की आवश्यकता पर बल देती हैं।

Richard J. Young2026-03-23
💬 NLP

DAVIS: Planning Agent with Knowledge Graph-Powered Inner Monologue

यह शोध पत्र DAVIS को प्रस्तुत करता है, जो एक नवीन वैज्ञानिक नियोजन एजेंट है जो मौजूदा रिट्रीवल-ऑगमेंटेड जनरेशन दृष्टिकोणों की तुलना में जटिल प्रयोगशाला कार्यों और मल्टी-हॉप प्रश्न उत्तर देने में श्रेष्ठ प्रदर्शन प्राप्त करने के लिए नॉलेज ग्राफ-संचालित इनर मोनोलॉग और स्ट्रक्चर्ड टेम्पोरल मेमोरी का लाभ उठाता है।

Minh Pham Dinh, Munira Syed, Michael G Yankoski, Trenton W. Ford2026-03-20
💬 NLP

LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmetics

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल चेन-ऑफ-थॉट रीजनिंग के दौरान उत्तरों को पहले से निर्धारित करने के बजाय उन्हें पुनरावृत्ति (iteratively) के माध्यम से निष्ठापूर्वक गणना करते हैं, जो इस बात की पुष्टि करता है कि उनके द्वारा उत्पन्न रीजनिंग चेन उनकी आंतरिक कम्प्यूटेशनल प्रक्रिया को सटीक रूप से दर्शाती है।

Keito Kudo, Yoichi Aoki, Tatsuki Kuribayashi, Shusaku Sone, Masaya Taniguchi, Ana Brassard, Keisuke Sakaguchi, Kentaro I (…)2026-03-20
💬 NLP

Enhancing Lexicon-Based Text Embeddings with Large Language Models

यह शोध पत्र LENS को प्रस्तुत करता है, जो एक नवीन लेक्सिकन-आधारित एम्बेडिंग विधि है जो प्रतिस्पर्धी, संक्षिप्त टेक्स्ट रिप्रेजेंटेशन प्राप्त करने के लिए लार्ज लैंग्वेज मॉडल्स और टोकन क्लस्टरिंग का लाभ उठाती है, जो MTEB बेंचमार्क पर डेंस एम्बेडिंग्स से बेहतर प्रदर्शन करती है और उनके साथ संयोजन में अत्याधुनिक परिणाम प्राप्त करती है।

Yibin Lei, Tao Shen, Yu Cao, Andrew Yates2026-03-20