💬 NLP

Hybrid topic modelling for computational close reading: Mapping narrative themes in Pushkin's Evgenij Onegin

यह अध्ययन पुश्किन की 'इवगेनी ओनेगिन' में कथात्मक विषयों के एक पुनरुत्पादनीय, सूक्ष्म-पठन विश्लेषण को करने के लिए लेटेंट डिरिचलेट एलोकेशन और स्पार्स पार्शियल लीस्ट स्क्वायर्स डिस्क्रिमिनेन्ट एनालिसिस को संयोजित करने वाले एक हाइब्रिड कम्प्यूटेशनल ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि कैसे हल्के संभाव्यता मॉडल एकल अनुवादित संस्करण पर निर्भर होने के बावजूद छोटे-कॉर्पस साहित्यिक ग्रंथों में विषयगत संरचनाओं को प्रभावी ढंग से मानचित्रित कर सकते हैं।

Angelo Maria Sabatini2026-03-23
🤖 AI

On the Ability of Transformers to Verify Plans

यह शोध पत्र C*-RASP को प्रस्तुत करता है ताकि सैद्धांतिक रूप से यह स्थापित किया जा सके कि डिकोडर-ओनली ट्रांसफॉर्मर, अनुक्रम लंबाई (sequence length) और शब्दावली आकार (vocabulary size) में एक साथ वृद्धि के बावजूद, शास्त्रीय नियोजन डोमेन (classical planning domains) में लंबी योजनाओं को सत्यापित करना प्रमाणिक रूप से सीख सकते हैं, जो अनुभवजन्य प्रयोगों द्वारा समर्थित एक निष्कर्ष है।

Yash Sarrof, Yupei Du, Katharina Stein, Alexander Koller, Sylvie Thiébaux, Michael Hahn2026-03-23
🤖 machine learning

Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States

यह शोध पत्र मानक सुदृढीकरण शिक्षण (reinforcement learning) की क्षमता सीमा को पार करने के लिए एलएलएम (LLM) पोस्ट-ट्रेनिंग में स्पष्ट मार्कोव अवस्थाओं (Markov states) को पुन: पेश करने का प्रस्ताव देता है, जो सैद्धांतिक रूप से नमूना जटिलता (sample complexity) को कम करता है और इतिहास-निर्भर मॉडलिंग से संरचित मार्कोवियन प्रतिनिधित्वों की ओर स्थानांतरित होकर जटिल तर्क पहेलियों पर बेहतर प्रदर्शन को अनुभवजन्य रूप से प्रदर्शित करता है।

Yurun Yuan, Tengyang Xie2026-03-23
💬 NLP

When Contextual Inference Fails: Cancelability in Interactive Instruction Following

यह शोध पत्र 'बिल्ड व्हाट आई मीन' (BWIM) बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि अत्याधुनिक लार्ज लैंग्वेज मॉडल्स सहयोगात्मक कार्यों में वक्ता की अविश्वसनीयता का पता लगा सकते हैं, लेकिन वे इस अंतर्दृष्टि को कुशल स्पष्टीकरण रणनीतियों में बदलने में विफल रहते हैं, और अक्सर अत्यधिक स्पष्टीकरण या अनुमान लगाने जैसे उप-इष्टतम व्यवहारों का सहारा लेते हैं।

Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz2026-03-23
💬 NLP

LoASR-Bench: Evaluating Large Speech Language Models on Low-Resource Automatic Speech Recognition Across Language Families

यह शोध पत्र LoASR-Bench प्रस्तुत करता है, जो 9 परिवारों की 25 भाषाओं से युक्त एक व्यापक बेंचमार्क है, जिसे कम-संसाधन वाले स्वचालित भाषण पहचान (automatic speech recognition) परिदृश्यों में वर्तमान बड़े स्पीच लैंग्वेज मॉडल्स (Large Speech Language Models) की सीमाओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Jianan Chen, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen2026-03-23
💬 NLP

Reasoning Gets Harder for LLMs Inside A Dialogue

यह शोध पत्र BOULDER प्रस्तुत करता है, जो एक नया गतिशील बेंचमार्क है और यह दर्शाता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) आइसोलेटेड सेटिंग्स की तुलना में टास्क-ओरिएंटेड डायलॉग्स के भीतर फ्रेम किए जाने पर रीजनिंग कार्यों में प्रदर्शन का एक महत्वपूर्ण और निरंतर अंतराल प्रदर्शित करते हैं, जिसका मुख्य कारण मल्टी-टर्न इंटरैक्शन, रोल कंडीशनिंग और टूल-यूज़ की जटिलताएं हैं।

Ivan Kartáč, Mateusz Lango, Ondřej Dušek2026-03-23
💬 NLP

Semantic Token Clustering for Efficient Uncertainty Quantification in Large Language Models

यह शोध पत्र सिमेंटिक टोकन क्लस्टरिंग (STC) का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (LLMs) के लिए एक कुशल अनिश्चितता मात्रा निर्धारण (uncertainty quantification) विधि है, जो एकल पीढ़ी (single generation) के माध्यम से अर्थपूर्ण रूप से सुसंगत टोकन समूहों पर प्रायिकता द्रव्यमान (probability mass) को एकत्रित करता है, जिससे बार-बार नमूनाकरण (repeated sampling) या सहायक मॉडलों के कम्प्यूटेशनल ओवरहेड के बिना अत्याधुनिक प्रदर्शन प्राप्त होता है।

Qi Cao, Andrew Gambardella, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa2026-03-23
💬 NLP

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

यह शोध पत्र एक जलवायु मूल्यांकन ढांचे का उपयोग करते हुए यह मूल्यांकन करता है कि कैसे निर्देश-ट्यून किए गए भाषा मॉडल उपयोगकर्ता-संरेखण (user-alignment) के दबावों और इन-कॉन्टेक्स्ट साक्ष्य के प्रति निष्ठा के बीच संतुलन बनाते हैं, जो यह प्रकट करता है कि केवल समृद्ध साक्ष्य ही चाटुकारितापूर्ण उलटफेर (sycophantic reversals) को रोकने में विफल रहते हैं और मॉडल विशिष्ट विफलता मोड प्रदर्शित करते हैं जिनमें ज्ञानमीमांसीय सूक्ष्मता (epistemic nuance) के साथ नकारात्मक अंतःक्रिया, गैर-एकदिष्ट सुदृढ़ता स्केलिंग (non-monotonic robustness scaling), और संघर्ष के तहत भिन्न वितरण प्रसार (distributional dispersion) शामिल हैं।

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer2026-03-23
💬 NLP

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

यह शोध पत्र यह प्रदर्शित करता है कि LLM चेन-ऑफ-थॉट रीजनिंग के लिए रिपोर्ट किए गए फेथफुलनेस (faithfulness) मेट्रिक्स वस्तुनिष्ठ गुण नहीं हैं, बल्कि वे मूल्यांकन क्लासिफायर के चयन के प्रति अत्यधिक संवेदनशील हैं, जिससे दरों, रैंकिंग और निष्कर्षों में सांख्यिकीय रूप से महत्वपूर्ण विसंगतियां उत्पन्न होती हैं जो एकल बिंदु अनुमानों के बजाय संवेदनशीलता श्रेणियों को रिपोर्ट करने की आवश्यकता पर बल देती हैं।

Richard J. Young2026-03-23
💬 NLP

DAVIS: Planning Agent with Knowledge Graph-Powered Inner Monologue

यह शोध पत्र DAVIS को प्रस्तुत करता है, जो एक नवीन वैज्ञानिक नियोजन एजेंट है जो मौजूदा रिट्रीवल-ऑगमेंटेड जनरेशन दृष्टिकोणों की तुलना में जटिल प्रयोगशाला कार्यों और मल्टी-हॉप प्रश्न उत्तर देने में श्रेष्ठ प्रदर्शन प्राप्त करने के लिए नॉलेज ग्राफ-संचालित इनर मोनोलॉग और स्ट्रक्चर्ड टेम्पोरल मेमोरी का लाभ उठाता है।

Minh Pham Dinh, Munira Syed, Michael G Yankoski, Trenton W. Ford2026-03-20