💬 NLP

Clash of the models: Comparing performance of BERT-based variants for generic news frame detection

यह अध्ययन जेनेरिक न्यूज़ फ्रेम डिटेक्शन के लिए पांच BERT-आधारित वेरिएंट्स का तुलनात्मक मूल्यांकन करके, सुदृढ़ फाइन-ट्यून्ड मॉडल पेश करके, और अमेरिकी-केंद्रित डेटा से परे प्रासंगिक मजबूती का परीक्षण करने के लिए एक नवीन स्विस चुनावी डेटासेट प्रदान करके राजनीतिक संचार अनुसंधान को आगे बढ़ाता है।

Vihang Jumle2026-03-30
🤖 machine learning

DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

DataFlex एक एकीकृत, मॉड्यूलर फ्रेमवर्क है जो LLaMA-Factory पर निर्मित है और जो नमूना चयन (sample selection), डोमेन मिश्रण समायोजन (domain mixture adjustment) और नमूना पुन: भारण (sample reweighting) को एकीकृत करता है ताकि बड़े भाषा मॉडलों (large language models) के लिए कुशल, पुनरुत्पादक और उच्च-प्रदर्शन वाले डेटा-केंद्रित गतिशील प्रशिक्षण को सक्षम बनाया जा सके।

Hao Liang, Zhengyang Zhao, Meiyi Qiang, Mingrui Chen, Lu Ma, Rongyi Yu, Hengyi Feng, Shixuan Sun, Zimo Meng, Xiaochen Ma (…)2026-03-30
💬 NLP

Sparse Auto-Encoders and Holism about Large Language Models

यह शोध पत्र तर्क देता है कि जबकि स्पार्स ऑटो-एनकोडर के माध्यम से व्याख्या योग्य लेटेंट फीचर्स (interpretable latent features) की खोज इस दृष्टिकोण को चुनौती देती है कि लार्ज लैंग्वेज मॉडल्स अर्थ के एक समग्र सिद्धांत (holistic theory of meaning) को समाहित करते हैं, फिर भी एक समग्र चित्र तब तक व्यवहार्य बना रहता है जब तक कि ये फीचर्स गणनीय (countable) हों।

Jumbly Grindrod2026-03-30
💬 NLP

GS-BrainText: A Multi-Site Brain Imaging Report Dataset from Generation Scotland for Clinical Natural Language Processing Development and Validation

यह शोध पत्र GS-BrainText को प्रस्तुत करता है, जो जनरेशन स्कॉटलैंड कोहोर्ट से 8,511 एनोटेटेड ब्रेन रेडियोलॉजी रिपोर्टों का एक क्यूरेटेड मल्टी-साइट डेटासेट है, जिसे यूके के क्लिनिकल टेक्स्ट संसाधनों में कमियों को दूर करने और सामान्यीकरण योग्य क्लिनिकल नेचुरल लैंग्वेज प्रोसेसिंग टूल्स के विकास और सत्यापन में सहायता करने के लिए डिज़ाइन किया गया है।

Beatrice Alex, Claire Grover, Arlene Casey, Richard Tobin, Heather Whalley, William Whiteley2026-03-30
💬 NLP

A Universal Vibe? Finding and Controlling Language-Agnostic Informal Register with SAEs

यह शोध पत्र यह प्रदर्शित करता है कि बहुभाषी भाषा मॉडल अनौपचारिक रजिस्टर को अलग-थलग यादों के बजाय एक एकीकृत, भाषा-अज्ञेय प्रासंगिक अमूर्तता (language-agnostic pragmatic abstraction) के रूप में आत्मसात करते हैं, जिसका प्रमाण Gemma-2-9B-IT में एक सुदृढ़ क्रॉस-लिंग्विस्टिक "अनौपचारिक रजिस्टर सबस्पेस" की खोज है जिसे प्रशिक्षित और अनदेखी दोनों भाषाओं में औपचारिकता को बदलने के लिए कारणिक रूप से हेरफेर (causally manipulated) किया जा सकता है।

Uri Z. Kialy, Avi Shtarkberg, Ayal Klein2026-03-30
💬 NLP

Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR

यह शोध पत्र "एब्स्ट्रैक्ट कम्प्रेशन" (Abstract Compression) का प्रस्ताव करता है, जो कच्चे ऑडियो अनुक्रमों को संसाधित करने की उच्च कम्प्यूटेशनल लागत के बिना, विशेष रूप से प्रासंगिक संस्थाओं (contextual entities) को पहचानने के लिए, बेहतर LLM-आधारित ASR हेतु संवादात्मक संदर्भ का कुशलतापूर्वक लाभ उठाने के लिए ट्रांसक्रिप्ट्स को बनाए रखते हुए पूर्व-टर्न ऑडियो को निश्चित लेटेंट टोकन (fixed latent tokens) से बदल देता है।

Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu, Thibault Bañeras-Roux, Hasindri Watawana, Dairazali (…)2026-03-30
💬 NLP

Working Notes on Late Interaction Dynamics: Analyzing Targeted Behaviors of Late Interaction Models

यह शोध पत्र NanoBEIR बेंचमार्क पर लेट इंटरेक्शन रिट्रीवल मॉडल्स की अंतर्निहित गतिशीलता की जांच करता है, जो यह प्रकट करता है कि जहाँ कॉज़ल मॉडल्स एक व्यावहारिक लंबाई पूर्वाग्रह (length bias) प्रदर्शित करते हैं, वहीं द्वि-दिशीय (bi-directional) मॉडल्स भी चरम मामलों में इससे ग्रस्त हो सकते हैं, और यह पुष्टि करता है कि MaxSim ऑपरेटर शीर्ष-स्कोरिंग टोकन से परे महत्वपूर्ण रुझानों के बिना टोकन-स्तरीय समानताओं का प्रभावी ढंग से उपयोग करता है।

Antoine Edy, Max Conti, Quentin Macé2026-03-30
💬 NLP

findsylls: A Language-Agnostic Toolkit for Syllable-Level Speech Tokenization and Embedding

यह शोध पत्र **findsylls** को प्रस्तुत करता है, जो एक मॉड्यूलर, भाषा-तटस्थ टूलकिट है जो उच्च-संसाधन और कम-संसाधन वाली दोनों भाषाओं में मानकीकृत, पुनरुत्पादनीय शब्दांश-स्तरीय (syllable-level) स्पीच टोकनाइज़ेशन और मूल्यांकन को सक्षम करने के लिए एक सामान्य इंटरफ़ेस के तहत विविध शब्दांश-विभाजन (syllabification) विधियों को एकीकृत करता है।

Héctor Javier Vázquez Martínez2026-03-30
💬 NLP

From Human Cognition to Neural Activations: Probing the Computational Primitives of Spatial Reasoning in LLMs

यह शोधपत्र कार्य को तीन संज्ञानात्मक मूल तत्वों (cognitive primitives) में विभाजित करके और यांत्रिक विश्लेषणों का उपयोग करके बहुभाषी एलएलएम (LLMs) में स्थानिक तर्क (spatial reasoning) के आंतरिक तंत्रों की जांच करता है, जिससे यह प्रकट होता है कि हालांकि मॉडल क्षणिक और खंडित स्थानिक सूचनाओं को एनकोड करते हैं जो व्यवहार को कारणवश प्रभावित कर सकती हैं, लेकिन उनमें मजबूत, सर्व-उद्देश्यीय स्थानिक प्रतिनिधित्वों का अभाव है और इसके बजाय वे संदर्भ-निर्भर पथों पर निर्भर करते हैं जो विभिन्न भाषाओं में यांत्रिक अपभ्रंश (mechanistic degeneracy) प्रदर्शित करते हैं।

Jiyuan An, Liner Yang, Mengyan Wang, Luming Lu, Weihua An, Erhong Yang2026-03-30
💬 NLP

CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law

यह शोध पत्र CALRK-Bench प्रस्तुत करता है, जो एक कोरियाई कानूनी बेंचमार्क है जिसे संदर्भ-जागरूक तर्क क्षमताओं—विशेष रूप से सामयिक वैधता, सूचना पर्याप्तता और निर्णय परिवर्तनों के संबंध में—का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान बड़े भाषा मॉडल सरल ज्ञान स्मृति से परे इन कार्यों के साथ संघर्ष करते हैं।

JiHyeok Jung, TaeYoung Yoon, HyunSouk Cho2026-03-30