💬 NLP

Controlling Long-Horizon Behavior in Language Model Agents with Explicit State Dynamics

यह शोध पत्र यह प्रदर्शित करता है कि एक बाहरी भावनात्मक अवस्था (affective state) पर स्पष्ट प्रथम- और द्वितीय-क्रम के गतिशील नियमों को लागू करने से, अंतर्निहित मॉडल मापदंडों को संशोधित किए बिना, बहु-चरण संवादों में लार्ज लैंग्वेज मॉडल एजेंटों की दीर्घकालिक टेम्पोरल सुसंगतता (temporal coherence) और रिकवरी क्षमताओं में महत्वपूर्ण सुधार होता है।

Sukesh Subaharan2026-01-23
💬 NLP

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing

यह शोध पत्र EDIR को प्रस्तुत करता है, जो एक इमेज एडिटिंग पाइपलाइन के माध्यम से निर्मित एक नवीन सूक्ष्म-स्तरीय (fine-grained) कंपोज्ड इमेज रिट्रीवल बेंचमार्क है, जो मौजूदा मूल्यांकनों के सीमित दायरे को संबोधित करने के लिए बनाया गया है, जो विविध संशोधन श्रेणियों में वर्तमान अत्याधुनिक मॉडलों के प्रदर्शन में महत्वपूर्ण अंतराल को प्रकट करता है।

Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu2026-01-23
💬 NLP

LLM Prompt Evaluation for Educational Applications

यह अध्ययन शैक्षिक संवाद के लिए LLM प्रॉम्प्ट टेम्पलेट्स का मूल्यांकन करने हेतु Glicko2 रेटिंग सिस्टम का उपयोग करते हुए एक व्यवस्थित, टूर्नामेंट-शैली वाले मूल्यांकन ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि 'परसोना' (persona) और 'कॉन्टेक्स्ट मैनेजमेंट' (context management) रणनीतियों को संयोजित करने वाला एक प्रॉम्प्ट, अन्य की तुलना में शैक्षणिक रूप से संरेखित अनुवर्ती प्रश्न उत्पन्न करने में काफी बेहतर प्रदर्शन करता है।

Langdon Holmes, Adam Coscia, Scott Crossley, Joon Suh Choi, Wesley Morris2026-01-23
💬 NLP

Automatic Classification of Arabic Literature into Historical Eras

यह शोध पत्र कविता से परे, समय काल के आधार पर अरबी साहित्य के स्वचालित वर्गीकरण में मौजूद अंतराल को संबोधित करता है, जिसमें प्री-इस्लामिक युग से आधुनिक युग तक फैले डेटासेट पर मॉडलों का मूल्यांकन करने के लिए न्यूरल नेटवर्क और डीप लर्निंग का उपयोग किया गया है, जिससे बाइनरी क्लासिफिकेशन में उच्च प्रदर्शन प्राप्त हुआ है लेकिन सूक्ष्म-स्तरीय बहु-काल (multi-era) कार्यों में सटीकता काफी कम रही है।

Zainab Alhathloul, Irfan Ahmad2026-01-23
💬 NLP

Weight Averaging: A Simple Yet Effective Method to Overcome Catastrophic Forgetting in Automatic Speech Recognition

यह शोध पत्र एक सरल लेकिन प्रभावी वेट एवरेजिंग (weight averaging) विधि प्रस्तावित करता है, जिसे वैकल्पिक रूप से नॉलेज डिस्टिलेशन (knowledge distillation) के साथ उन्नत किया जा सकता है, ताकि पुराने और नए दोनों कार्यों पर उच्च प्रदर्शन प्राप्त करके एंड-टू-एंड ऑटोमैटिक स्पीच रिकग्निशन में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को दूर किया जा सके।

Steven Vander Eeckt, Hugo Van hamme2026-01-22
💬 NLP

BayesAgent: Bayesian Agentic Reasoning Under Uncertainty via Verbalized Probabilistic Graphical Modeling

यह शोध पत्र BayesAgent प्रस्तुत करता है, जो एक ऐसा ढांचा है जो बड़े भाषा मॉडल (Large Language Model) एजेंटों को मौखिक संभाव्य ग्राफिकल मॉडलिंग (Verbalized Probabilistic Graphical Model - vPGM) के साथ जोड़ता है ताकि विशेषज्ञ-संचालित मॉडल डिज़ाइन की आवश्यकता के बिना अनिश्चितता के तहत सिद्धांत-आधारित बेयसियन तर्क (Bayesian reasoning) को सक्षम किया जा सके, जिससे आत्मविश्वास अंशांकन (confidence calibration) और पाठ निर्माण की गुणवत्ता में सुधार होता है।

Hengguan Huang, Xing Shen, Songtao Wang, Lingfa Meng, Dianbo Liu, David Alejandro Duchene, Hao Wang, Samir Bhatt2026-01-22
💬 NLP

GECOBench: A Gender-Controlled Text Dataset and Benchmark for Quantifying Biases in Explanations

यह शोधपत्र GECOBench प्रस्तुत करता है, जो एक जेंडर-नियंत्रित (gender-controlled) डेटासेट और मूल्यांकन ढांचा है जो यह प्रदर्शित करता है कि कैसे BERT जैसे प्री-ट्रेंड मॉडल्स को फाइन-ट्यून करना, विशेष रूप से एम्बेडिंग लेयर्स को फिर से प्रशिक्षित करके, एक्सप्लेनेबल एआई (XAI) विधियों द्वारा उत्पन्न फीचर एट्रिब्यूशंस में जेंडर बायस (लिंग संबंधी पूर्वाग्रह) को महत्वपूर्ण रूप से कम करता है।

Rick Wilming, Artur Dox, Hjalmar Schulz, Marta Oliveira, Benedict Clark, Stefan Haufe2026-01-22
💬 NLP

H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs

H3Fusion एक मिक्सचर-ऑफ-एक्सपर्ट्स-आधारित फ्यूजन तंत्र पेश करता है जो संरेखण (alignment) को प्रतिनिधित्व उप-स्थान (representation subspace) के भीतर एक नियंत्रणीय ड्रिफ्ट के रूप में मॉडल करता है, जो प्रभावी रूप से मौजूदा व्यक्तिगत रूप से संरेखित मॉडलों, एन्सेम्बल दृष्टिकोणों और मॉडल-मर्जिंग तकनीकों से बेहतर प्रदर्शन करने के लिए सहायकता (helpfulness), हानिरहितता (harmlessness) और ईमानदारी (honesty) को संतुलित करता है।

Selim Furkan Tekin, Fatih Ilhan, Tiansheng Huang, Sihao Hu, Yichang Xu, Zachary Yahn, Ling Liu2026-01-22
💬 NLP

Temporal Relation Extraction in Clinical Texts: A Span-based Graph Transformer Approach

यह शोध पत्र GRAPHTREX को प्रस्तुत करता है, जो एक नवीन स्पैन-आधारित ग्राफ ट्रांसफार्मर दृष्टिकोण है जो जटिल नैदानिक ग्रंथों में अत्याधुनिक टेम्पोरल रिलेशन एक्सट्रैक्शन (temporal relation extraction) को महत्वपूर्ण रूप से आगे बढ़ाने के लिए क्लिनिकल लार्ज प्री-ट्रेन्ड लैंग्वेज मॉडल्स और ग्लोबल लैंडमार्क्स के साथ हेटेरोजेनियस ग्राफ संरचनाओं का लाभ उठाता है।

Rochana Chaturvedi, Peyman Baghershahi, Sourav Medya, Barbara Di Eugenio2026-01-22