💬 NLP

ClinicalEncoder26AM: A Multlilingual Diagnosable ColBERT Model; Evidences from the MultiClinNER Shared Task

यह शोध पत्र ClinicalEncoder26AM को प्रस्तुत करता है, जो एक बहुभाषी Diagnosable ColBERT मॉडल है जिसे क्लिनिकल और बायोमेडिकल डेटा पर प्रशिक्षित किया गया है, जो MultiClinNER साझा कार्य (shared task) में अत्याधुनिक बहुभाषी एंटिटी रिकॉल और शीर्ष-पाँच समग्र प्रदर्शन प्राप्त करता है, जबकि अपने बेस मॉडल की तुलना में बेहतर डेटा दक्षता प्रदर्शित करता है।

François Remy2026-05-28
💬 NLP

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

यह शोध पत्र GUI-CIDER का प्रस्ताव करता है, जो एक मिड-ट्रेनिंग फ्रेमवर्क है जो कारण संबंधी ज्ञान आसवन (causal knowledge distillation), घनत्व-जागरूक उदाहरण पुन: चयन (density-aware exemplar reselection), और परिष्कृत मॉडल प्रशिक्षण की तीन-चरणीय प्रक्रिया के माध्यम से विश्व ज्ञान को स्पष्ट रूप से आंतरिक रूप से आत्मसात करके मल्टीमॉडल GUI एजेंटों के वास्तविक दुनिया के कार्य प्रदर्शन को बढ़ाता है।

Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang2026-05-28
🤖 AI

Cultural Binding Heads in Language Models

यह शोध पत्र बड़े भाषा मॉडलों (large language models) में उन विशिष्ट मिड-लेयर अटेंशन हेड्स (mid-layer attention heads) की पहचान करता है जो सांस्कृतिक बंधन (cultural binding) को कार्यवत रूप से संचालित करते हैं, यह प्रकट करते हुए कि जबकि मॉडलों के पास पर्याप्त सांस्कृतिक ज्ञान मौजूद है, समान व्यवहार करने की उनकी प्रवृत्ति एक रूटिंग बॉटलनेक (routing bottleneck) से उत्पन्न होती जिसे हेड नॉकआउट (head knockout) और α\alpha-स्केलिंग (α\alpha-scaling) जैसे लक्षित मैकेनिस्टिक हस्तक्षेपों के माध्यम से कम किया जा सकता है।

Avrile Floro, Luca Benedetto2026-05-28
💬 NLP

Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

यह शोधपत्र Soft-SVeRL प्रस्तुत करता है, जो एक स्व-सत्यापित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो आंशिक रूप से सत्यापन योग्य कार्यों में निर्देश-अनुपालन में सुधार के लिए विघटित, चेकलिस्ट-आधारित सॉफ्ट रिवॉर्ड्स का उपयोग करता है, और साथ ही स्पष्ट स्थिरीकरण तंत्रों के माध्यम से सत्यापनकर्ता शोर (verifier noise) और रिवॉर्ड मुद्रास्फीति के बीच महत्वपूर्ण ट्रेड-ऑफ को संबोधित करता है।

Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis2026-05-28
💬 NLP

Measuring Form and Function in Language Models

यह शोध पत्र अंग्रेजी के निर्धारक (determiners) के औपचारिक वाक्यात्मक और कार्यात्मक विमर्श गुणों पर भाषा मॉडलों का मात्रात्मक मूल्यांकन करने के लिए कॉन्टेक्स्टुअल अल्टरनेटिव चॉइस (CAC) मीट्रिक प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि कुछ अत्यंत बड़े मॉडल दोनों बेंचमार्क पर मानव बच्चों के प्रदर्शन के बराबर हो सकते हैं, तुलनात्मक डेटा पर प्रशिक्षित कोई भी वर्तमान मॉडल एक साथ इसे प्राप्त नहीं कर पाता है।

Héctor Javier Vázquez Martínez, Charles Yang2026-05-28
💬 NLP

GraphLit: Learning Text-Enriched Dynamic Character Network Representations for Literary Study

यह शोधपत्र GraphLit प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित शिक्षण ढांचा (self-supervised learning framework) है जो पात्रों की परस्पर क्रियाओं को उनके पाठ्य संदर्भों के साथ एकीकृत करने के लिए डायनेमिक हेट्रोजेनियस कैरेक्टर नेटवर्क्स (DHCNs) का उपयोग करता है, जिससे यह विविध साहित्यिक कार्यों पर मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है और कथा गैर-रैखिकता (narrative non-linearity) में नई अंतर्दृष्टि सक्षम करता है।

Gaspard Michel, Elena V. Epure, Romain Hennequin, Christophe Cerisara, Mirella Lapata2026-05-28
🤖 machine learning

Interpretability-Guided Layer Selection over Subspace Projection: SAEs as Stethoscopes, Not Scalpels, for Raw Task Vector Model Editing

यह शोध पत्र यह प्रदर्शित करता है कि टास्क वेक्टर्स (task vectors) को SAE फीचर सबस्पेस पर प्रोजेक्ट करना ज्यामितीय मिसअलाइनमेंट (geometric misalignment) के कारण एक मॉडल एडिटिंग रणनीति के रूप में विफल रहता है, और इसके बजाय विशिष्ट परतों में कच्चे टास्क वेक्टर्स को चुनिंदा रूप से इंजेक्ट करने के लिए SAEs को नैदानिक "स्टेथोस्कोप" के रूप में उपयोग करने का प्रस्ताव देता है, जो बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के गणितीय तर्क प्रदर्शन में महत्वपूर्ण सुधार करता है।

Li Lei, Madalina Ciobanu, Qingqing Mao, Ritankar Das2026-05-28
🤖 machine learning

Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection

यह शोध पत्र प्रदर्शित करता है कि जबकि एक्टिवेशन स्टीयरिंग (Activation Steering) डाउनस्ट्रीम सुरक्षा पहचान में सुधार के लिए प्रभावी सिंथेटिक डेटा उत्पन्न कर सकता है, इसकी उपयोगिता एक संकीर्ण क्षेत्र तक सीमित है जहाँ अवधारणा संरेखण (concept alignment) और सुसंगतता (coherence) के साथ प्रतिक्रिया विविधता बनाए रखने के लिए स्टीयरिंग स्ट्रेंथ को सावधानीपूर्वक संतुलित किया जाना चाहिए।

Vijeta Deshpande, Tootiya Giyahchi, Veena Padmanabhan, Leman Akoglu, Anna Rumshisky2026-05-28
🤖 AI

The Importance of Being Statistically Earnest: A Critical Re-evaluation of GSM-Symbolic

यह शोध पत्र GSM-Symbolic बेंचमार्क के इस निष्कर्ष को चुनौती देता है कि LLMs में वास्तविक तर्क क्षमता का अभाव है, यह प्रदर्शित करते हुए कि रिपोर्ट की गई प्रदर्शन गिरावट अक्सर सांख्यिकीय रूप से महत्वहीन होती है और समस्या के पाठ में अनपेक्षित वितरण संबंधी बदलावों (distributional shifts) से भ्रमित होती है, जो इसके बजाय यह प्रकट करती है कि मॉडल की विफलताएं सार्वभौमिक होने के बजाय विशिष्ट और विषम हैं।

Dominika Agnieszka Długosz, Arlindo Oliveira, Natalia Díaz Rodríguez2026-05-28
💬 NLP

Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

यह अनुभवजन्य अध्ययन उच्च-, मध्यम- और निम्न-संसाधन वाली भाषाओं में विश्वसनीय बहुभाषी LLM-as-a-judge विकसित करने की रणनीतियों की जांच करता है, जो यह प्रकट करता है कि फाइन-ट्यून किए गए छोटे मॉडल इन-डोमेन डेटा के साथ उत्कृष्ट प्रदर्शन करते हैं जबकि बड़े ज़ीरो-शॉट मॉडल आउट-ऑफ-डोमेन परिदृश्यों के लिए बेहतर होते हैं, और यह चेतावनी देता है कि आउट-ऑफ-डोमेन फाइन-ट्यूनिंग प्रदर्शन को कम कर सकती है।

Irune Zubiaga, Aitor Soroa, Rodrigo Agerri2026-05-28