💬 NLP

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

यह शोध पत्र यह प्रकट करता है कि माइक्रोसकेलिंग क्वांटाइजेशन में घटते ब्लॉक आकार, संकीर्ण टेंसर वितरण और सीमित स्केल डायनेमिक रेंज के बीच परस्पर क्रिया के कारण विरोधाभासी रूप से मॉडल के प्रदर्शन को खराब कर सकते हैं, जिससे लेखक स्केल्स के लिए एक नए FP8 अनसाइंड E5M3 फॉर्मेट का प्रस्ताव देते हैं जो वैश्विक स्केलिंग ऑपरेशन्स की आवश्यकता को समाप्त करते हुए सटीकता बनाए रखता है।

Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang2026-01-28
💬 NLP

PsyProbe: Proactive and Interpretable Dialogue through User State Modeling for Exploratory Counseling

PsyProbe परामर्श के अन्वेषण चरण के लिए एक सक्रिय और व्याख्यात्मक संवाद प्रणाली है जो PPPPPI ढांचे और संज्ञानात्मक त्रुटि पहचान का लाभ उठाकर उपयोगकर्ता की अवस्थाओं को व्यवस्थित रूप से मॉडल करती है, जिससे यह संदर्भानुसार उपयुक्त प्रश्न उत्पन्न करने में सक्षम होती है जो उपयोगकर्ता और विशेषज्ञ दोनों के मूल्यांकन द्वारा प्रमाणित रूप से जुड़ाव, स्वाभाविकता और चिकित्सीय प्रभावशीलता में बेसलाइन से बेहतर प्रदर्शन करती है।

Sohhyung Park, Hyunji Kang, Sungzoon Cho, Dongil Kim2026-01-28
💬 NLP

Leveraging Sentence-oriented Augmentation and Transformer-Based Architecture for Vietnamese-Bahnaric Translation

यह शोध पत्र वियतनामी-बहारनिक अनुवाद के लिए एक लचीला, संसाधन-कुशल न्यूरल मशीन ट्रांसलेशन फ्रेमवर्क प्रस्तावित करता है जो डेटा की कमी की चुनौतियों से निपटने और बहारनिक भाषा के संरक्षण का समर्थन करने के लिए वाक्य-उन्मुख संवर्धन (sentence-oriented augmentation) और एक ट्रांसफॉर्मर-आधारित आर्किटेक्चर का लाभ उठाता है।

Tan Sang Nguyen, Quoc Nguyen Pham, Tho Quan2026-01-28
💬 NLP

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

यह शोध पत्र CONTEXT-VQA डेटासेट और मूल्यांकन ढांचे को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि विजन-लैंग्वेज मॉडल टेक्स्टुअल मिसइन्फॉर्मेशन (पाठ्य गलत सूचना) के प्रति अत्यधिक संवेदनशील हैं, जो अक्सर स्पष्ट दृश्य साक्ष्यों को विरोधाभासी प्रॉम्प्ट्स के साथ ओवरराइड कर देते हैं और महत्वपूर्ण प्रदर्शन गिरावट का शिकार होते हैं।

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney2026-01-28
💬 NLP

DREAMSTATE: Diffusing States and Parameters for Recurrent Large Language Models

यह शोध पत्र DREAMSTATE को प्रस्तुत करता है, जो एक कंडीशनल डिफ्यूजन ट्रांसफॉर्मर (conditional Diffusion Transformer) का उपयोग करके RWKV रिकरेंट स्टेट्स को संपादन योग्य ज्ञान निरूपण (editable knowledge representations) के रूप में मॉडल करता है और एक नवीन हाइब्रिड आर्किटेक्चर प्रस्तावित करता है जहाँ एक समानांतर DiT वैश्विक संदर्भ (global context) के आधार पर रिकरेंट पैरामीटर्स को गतिशील रूप से समायोजित करता है ताकि अनुकूलन क्षमता को बढ़ाया जा सके।

Liu Xiao2026-01-28
💬 NLP

Riddle Quest : The Enigma of Words

यह शोध पत्र एनालॉजी-आधारित पहेलियों को उत्पन्न करने के लिए एक पाइपलाइन प्रस्तुत करता है और इसका उपयोग यह प्रदर्शित करने के लिए करता है कि हालांकि बड़े भाषा मॉडल अक्सर प्राथमिक उत्तर की पहचान कर सकते हैं, वे अक्सर वैध व्याख्याओं के पूर्ण सेट को पुनः प्राप्त करने में विफल रहते हैं, जो पहेलियों को एआई में तर्क कवरेज और अस्पष्टता प्रबंधन का मूल्यांकन करने के लिए एक मूल्यवान उपकरण के रूप में रेखांकित करता है।

Niharika Sri Parasa, Chaitali Diwan, Srinath Srinivasa2026-01-28
💬 NLP

Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning

यह शोध पत्र मल्टी-एडवर्सरी ग्रुप डिस्ट्रीब्यूशनली रोबस्ट ऑप्टिमाइज़ेशन (GDRO) का प्रस्ताव करता है, जो LLM रीजनिंग में मानक RL की स्थिर अक्षमताओं को दूर करने के लिए कठिनाई-आधारित क्लासिफायर और बैंडिट कंट्रोलर्स के माध्यम से प्रॉम्प्ट सैंपलिंग और रोलआउट एलोकेशन को गतिशील रूप से अनुकूलित करने वाला एक ढांचा है, जो कंप्यूट न्यूट्रैलिटी बनाए रखते हुए कठिन कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

Kishan Panaganti, Zhenwen Liang, Wenhao Yu, Haitao Mi, Dong Yu2026-01-28
💬 NLP

MetaGen: Self-Evolving Roles and Topologies for Multi-Agent LLM Reasoning

MetaGen एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो जटिल तर्क कार्यों में सटीकता और लागत दक्षता में सुधार करने के लिए, स्थिर मल्टी-एजेंट सिस्टम की कठोरता को दूर करने हेतु इन्फरेंस के समय भूमिका विशिष्टताओं (role specifications) और सहयोग टोपोलॉजी (collaboration topologies) दोनों को गतिशील रूप से अनुकूलित करता है।

Yimeng Wang, Jiaxing Zhao, Hongbin Xie, Hexing Ma, Yuzhen Lei, Shuangxue Liu, Xuan Song, Zichen Zhang, Haoran Zhang2026-01-28
💬 NLP

Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text Generation

यह शोध पत्र क्रॉस-एग्जामिनेशन फ्रेमवर्क (CEF) को प्रस्तुत करता है, जो एक संदर्भ-मुक्त (reference-free), बहु-आयामी नैदानिक उपकरण है, जो स्रोत और उम्मीदवार ग्रंथों को स्वतंत्र ज्ञान आधारों के रूप में मानकर कवरेज, अनुरूपता और निरंतरता के लिए व्याख्यात्मक स्कोर उत्पन्न करके टेक्स्ट-टू-टेक्स्ट जनरेशन की निष्ठा का मूल्यांकन करता है, जिससे विविध कार्यों में सिमेंटिक त्रुटियों की पहचान करने में पारंपरिक मेट्रिक्स से बेहतर प्रदर्शन करता है।

Tathagata Raha, Clement Christophe, Nada Saadi, Hamza A Javed, Marco AF Pimentel, Ronnie Rajan, Praveenkumar Kanithi2026-01-28
💬 NLP

Binary Token-Level Classification with DeBERTa for All-Type MWE Identification: A Lightweight Approach with Linguistic Enhancement

यह शोध पत्र एक हल्का, भाषाई रूप से उन्नत DeBERTa-v3-large मॉडल प्रस्तुत करता है जो मल्टीवर्ड एक्सप्रेशन पहचान को बाइनरी टोकन-स्तरीय वर्गीकरण के रूप में पुनर्गठित करता है, और अग्रणी लार्ज लैंग्वेज मॉडल्स की तुलना में 165 गुना कम पैरामीटर्स का उपयोग करते हुए CoAM और STREUSLE डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Diego Rossini, Lonneke van der Plas2026-01-28