💻 computer science

ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models

यह शोध पत्र ThermoQA को प्रस्तुत करता है, जो CoolProp 7.2.0 ग्राउंड ट्रुथ के विरुद्ध मूल्यांकित 293 ऊष्मागतिकी (thermodynamics) समस्याओं का एक तीन-स्तरीय ओपन-सोर्स बेंचमार्क है, जो यह प्रकट करता है कि जबकि फ्रंटियर LLMs उच्च सटीकता प्राप्त करते हैं, उनकी तर्क करने की क्षमता कार्य की जटिलता के साथ काफी कम हो जाती है और रन के दौरान उल्लेखनीय परिवर्तनशीलता प्रदर्शित करती है।

Kemal Düzkar2026-04-23
💬 NLP

Evidence of Layered Positional and Directional Constraints in the Voynich Manuscript: Implications for Cipher-Like Structure

यह शोधपत्र वॉयनिच पांडुलिपि (Voynich Manuscript) के ग्राफीम अनुक्रमों में अद्वितीय दिशात्मक बाधाओं की पहचान करता है जो इसे प्राकृतिक भाषाओं से अलग करती हैं और यह प्रदर्शित करता है कि न तो पैरामीट्रिक स्लॉट-आधारित (parametric slot-based) और न ही कार्डन ग्रिल जनरेटर (Cardan grille generators) इसके संरचनात्मक हस्ताक्षरों को पूरी तरह से पुनरुत्पादित कर सकते हैं, जो यह सुझाव देता है कि इस पाठ में जटिल कूट-समान (cipher-like) गुण हैं जो सरल जनरेटिव मॉडलों का प्रतिरोध करते हैं।

Christophe Parisel2026-04-23
💬 NLP

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में पहचाने गए "हैलुसिनेशन न्यूरॉन्स" विभिन्न ज्ञान डोमेन में सामान्यीकृत नहीं होते हैं, जो यह प्रकट करता है कि हैलुसिनेशन तंत्र सार्वभौमिक होने के बजाय डोमेन-विशिष्ट हैं और डोमेन-कैलिब्रेटेड डिटेक्टरों की आवश्यकता को अनिवार्य बनाते हैं।

Snehit Vaddi, Pujith Vaddi2026-04-23
💬 NLP

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models

PR-CAD एक प्रगतिशील परिशोधन ढांचे (progressive refinement framework) को पेश करता है जो एक उच्च-निष्ठा वाले इंटरेक्शन डेटासेट और सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाकर टेक्स्ट-टू-सीएडी (text-to-CAD) जनरेशन और संपादन को एक एकल, नियंत्रणीय एजेंट में एकीकृत करता है ताकि सीएडी मॉडलिंग में अत्याधुनिक निष्ठा और दक्षता प्राप्त की जा सके।

Jiyuan An, Jiachen Zhao, Fan Chen, Liner Yang, Zhenghao Liu, Hongyan Wang, Weihua An, Meishan Zhang, Erhong Yang2026-04-23
💻 computer science

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

यह शोध पत्र एक कॉन्फॉर्मल इंटरप्रिटेबिलिटी फ्रेमवर्क पेश करता है जो स्टेप-वाइज रिवॉर्ड मॉडलिंग को कॉन्फॉर्मल प्रेडिक्शन के साथ जोड़ता है ताकि एलएलएम (LLM) एजेंटों के भीतर रैखिक रूप से विभाज्य टेम्पोरल कॉन्सेप्ट्स की पहचान और नियंत्रण किया जा सके, जिससे जटिल संवादात्मक वातावरण में प्रारंभिक विफलता का पता लगाना और प्रदर्शन में सुधार करना सक्षम हो सके।

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. (…)2026-04-23
💬 NLP

Towards High-Quality Machine Translation for Kokborok: A Low-Resource Tibeto-Burman Language of Northeast India

यह शोध पत्र KokborokMT को प्रस्तुत करता है, जो कम संसाधन वाले तिब्बती-बर्मन भाषा कोकबोरोक के लिए एक उच्च-गुणवत्ता वाला न्यूरल मशीन ट्रांसलेशन सिस्टम है, जो पिछले प्रयासों की तुलना में महत्वपूर्ण BLEU स्कोर सुधार (38.56 तक) और मजबूत मानव मूल्यांकन रेटिंग प्राप्त करने के लिए एक बहु-स्रोत समानांतर कॉर्पस और फाइन-ट्यून किए गए NLLB-200 मॉडल का लाभ उठाता है।

Badal Nyalang, Biman Debbarma2026-04-23
💻 computer science

Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment

यह शोध पत्र प्रदर्शित करता है कि छोटे भाषा मॉडलों में मौखिक रूप से व्यक्त आत्मविश्वास, एक लागत-कुशल कैस्केड सिस्टम में शैक्षिक मूल्यांकन कार्यों को बड़े मॉडलों तक प्रभावी ढंग से रूट कर सकता है, बशर्ते कि छोटे मॉडल अनिश्चित मामलों की सटीक पहचान करने के लिए मजबूत आत्मविश्वास भेदभाव प्रदर्शित करें।

Tyler Burleigh2026-04-23
💬 NLP

How Much Does Persuasion Strategy Matter? LLM-Annotated Evidence from Charitable Donation Dialogues

तीन बड़े भाषा मॉडलों के माध्यम से पर्सुएशनफॉरगुड (PersuasionForGood) कॉर्पस को 41 अनुनय रणनीतियों (persuasion strategies) के साथ एनोटेट करके, यह अध्ययन पाता है कि रणनीति श्रेणियां अकेले दान परिणामों में बहुत कम भिन्नता स्पष्ट करती हैं, जिसमें अपराधबोध (guilt) का प्रेरण अनुपालन को महत्वपूर्ण रूप से कम करता है और पारस्परिकता (reciprocity) सबसे मजबूत सकारात्मक सहसंबंध प्रदर्शित करती है।

Tatiana Petrova, Stanislav Sokol, Radu State2026-04-23
⚡ electrical engineering

Enhancing ASR Performance in the Medical Domain for Dravidian Languages

यह शोध पत्र एक नवीन कॉन्फिडेंस-अवेयर ट्रेनिंग फ्रेमवर्क प्रस्तावित करता है जो तेलुगु और कन्नड़ मेडिकल एएसआर (ASR) के लिए वर्ड एरर रेट को महत्वपूर्ण रूप से कम करने हेतु हाइब्रिड स्टैटिक और डायनेमिक मेट्रिक्स का उपयोग करके वास्तविक और सिंथेटिक स्पीच डेटा को एकीकृत करता है, जो क्रमशः मानक फाइन-ट्यूनिंग बेसलाइन से 8.5% और 6.3% बेहतर प्रदर्शन करता है।

Sri Charan Devarakonda, Ravi Sastry Kolluru, Manjula Sri Rayudu, Rashmi Kapoor, Madhu G, Anil Kumar Vuppala2026-04-23
💬 NLP

Depression Risk Assessment in Social Media via Large Language Models

यह शोध पत्र मल्टी-लेबल इमोशन क्लासिफिकेशन और एक वेटेड सेवेरिटी इंडेक्स के माध्यम से रेडिट पोस्ट में अवसाद (डिप्रेशन) के जोखिम का आकलन करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करते हुए एक लागत प्रभावी, स्केलेबल सिस्टम प्रस्तावित करता है, जो फाइन-ट्यून किए गए मॉडल्स के मुकाबले प्रतिस्पर्धी प्रदर्शन प्रदर्शित करता है और विभिन्न ऑनलाइन समुदायों में स्थिर जोखिम प्रोफाइल को प्रकट करता है।

Giorgia Gulino, Manuel Petrucci2026-04-23