💬 NLP

A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Transformer-Based Language Models

यह शोध पत्र एक एकीकृत व्याख्यात्मकता ढांचे (interpretability framework) को प्रस्तुत करता है जो ट्रांसफॉर्मर-आधारित भाषा मॉडलों के लिए स्थिर, इनपुट-स्तरीय महत्व स्कोर उत्पन्न करने के लिए मोनोसेमेंटिक फीचर निष्कर्षण (monosemantic feature extraction) का लाभ उठाता है, जिससे पॉलीसेमेंटिसिटी (polysemanticity) और अंतर-विधि परिवर्तनशीलता की चुनौतियों को संबोधित किया जा सके ताकि अल्जाइमर रोग के निदान में विश्वसनीय नैदानिक अनुप्रयोगों को सक्षम बनाया जा सके।

Michail Mamalakis, Tiago Azevedo, Cristian Cosentino, Chiara D'Ercoli, Subati Abulikemu, Zhongtian Sun, Richard Bethlehe (…)2026-06-02
💬 NLP

Demystifying Multi-Agent Debate: The Role of Confidence and Diversity

यह शोध पत्र पहचान करता है कि वैनिला मल्टी-एजेंट डिबेट अक्सर दृष्टिकोण विविधता और कैलिब्रेटेड आत्मविश्वास की कमी के कारण विफल हो जाती है, और दो हल्के हस्तक्षेपों—विविधता-जागरूक इनिशियलाइजेशन और कॉन्फिडेंस-मॉड्यूलेटेड अपडेट्स—का प्रस्ताव और सत्यापन करता है जो कई बेंचमार्क में तर्क करने के प्रदर्शन में महत्वपूर्ण सुधार करते हैं।

Xiaochen Zhu, Caiqi Zhang, Yizhou Chi, Tom Stafford, Nigel Collier, Andreas Vlachos2026-06-02
💬 NLP

Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation Extraction

यह शोध पत्र फ्यू-शॉट रिलेशन एक्सट्रैक्शन (few-shot relation extraction) के लिए एक हाइब्रिड इन-कॉन्टेक्स्ट लर्निंग फ्रेमवर्क का प्रस्ताव करता है जो एलएलएम-जनरेटेड (LLM-generated) उदाहरणों को सिंटैक्टिक-सिमेंटिक स्ट्रक्चरल समानता (syntactic-semantic structural similarity) के आधार पर अतिरिक्त उदाहरणों को चुनने की एक नवीन रणनीति के साथ जोड़ता है, जिससे कई डेटासेट्स और मॉडल परिवारों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco2026-06-02
💬 NLP

APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention

APB-V एक सीक्वेंस-पैरेलल फ्रेमवर्क है जो एप्रोक्सिमेट अटेंशन को कई GPUs में वितरित करके लार्ज मल्टीमॉडल मॉडल्स में लॉन्ग-वीडियो इन्फरेंस को तेज़ करता है, जिससे विजुअल कंप्रेशन की आवश्यकता के बिना और प्रदर्शन से समझौता किए बिना मौजूदा तरीकों की तुलना में महत्वपूर्ण गति प्राप्त होती है।

Yuxiang Huang, Mingye Li, Xu Han, Chaojun Xiao, Weilin Zhao, Ao Sun, Ziqi Yuan, Hao Zhou, Fandong Meng, Zhiyuan Liu2026-06-02
💬 NLP

Reconsidering Positional Supervision in Masked Diffusion Language Model Training

यह शोध पत्र प्रदर्शित करता है कि मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स (Masked Diffusion Language Models) इटरेटिव डिकोडिंग के दौरान मामूली पोजीशनल शिफ्ट्स के प्रति संवेदनशील होते हैं और एक विशिष्ट अनसर्टेनिटी-एब्जॉर्बिंग टोकन (uncertainty-absorbing token) के साथ कनेक्शनिस्ट टेम्पोरल क्लासिफिकेशन (CTC) को अनुकूलित करने का प्रस्ताव देता है ताकि सख्त पोजीशनल बाधाओं को शिथिल किया जा सके, जिसके परिणामस्वरूप कई जनरेशन बेंचमार्क में सांख्यिकीय रूप से महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Mengyu Ye, Keito Kudo, Ryosuke Takahashi, Jun Suzuki2026-06-02
💬 NLP

R2-Router: A New Paradigm for LLM Routing with Reasoning

यह शोध पत्र R2-Router प्रस्तुत करता है, जो एक नवीन रूटिंग फ्रेमवर्क है जो आउटपुट लंबाई को एक नियंत्रणीय चर (controllable variable) के रूप में मानता है ताकि इष्टतम LLM और बजट को संयुक्त रूप से चुनकर, लंबाई-निर्भर गुणवत्ता और लागत विविधताओं की अनदेखी करने वाले मौजूदा राउटरों की सीमाओं को दूर करते हुए काफी कम लागत पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Jiaqi Xue, Qian Lou, Jiarong Xing, Heng Huang2026-06-02
💬 NLP

Prototype Transformer: Towards Language Model Architectures Interpretable by Design

यह शोध पत्र प्रोटोटाइप ट्रांसफॉर्मर (ProtoT) को प्रस्तुत करता है, जो एक नवीन ऑटोरेग्रेसिव लैंग्वेज मॉडल आर्किटेक्चर है जो नामकरण योग्य अवधारणाओं (nameable concepts) को स्वतः कैप्चर करने के लिए क्वाड्रेटिक-कॉस्ट सेल्फ-अटेंशन को लीनियर-कॉस्ट प्रोटोटाइप-आधारित मॉड्यूल से बदल देता है, जिससे मजबूत प्रदर्शन और स्केलेबिलिटी बनाए रखते हुए व्याख्यात्मक तर्क (interpretable reasoning) सक्षम होता है।

Yordan Yordanov, Matteo Forasassi, Bayar Menzat, Ruizhi Wang, Chang Qi, Markus Kaltenberger, Amine M'Charrak, Tommaso Sa (…)2026-06-02
💬 NLP

Bridging the Domain Divide: Supervised vs. Zero-Shot Clinical Section Segmentation from MIMIC-III to Obstetrics

यह शोध पत्र एक नया प्रसूति (ऑब्स्टेट्रिक्स) डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि जहाँ सुपरवाइज्ड मॉडल आउट-ऑफ-डोमेन क्लिनिकल सेक्शन सेगमेंटेशन के साथ संघर्ष करते हैं, वहीं ज़ीरो-शॉट लार्ज लैंग्वेज मॉडल्स, भ्रमित हेडर (hallucinated headers) को ठीक करने के बाद, विविध चिकित्सा डोमेन के लिए एक सुदृढ़ विकल्प प्रदान करते हैं।

Baris Karacan, Barbara Di Eugenio, Patrick Thornton2026-06-02
💬 NLP

SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning

SmartThinker एक नवीन GRPO-आधारित विधि है जो बड़े रीजनिंग मॉडल्स में रेडंडेंसी (अनावश्यकता) और ओवरथिंकिंग को कम करने के लिए प्रशिक्षण के दौरान चेन-ऑफ-थॉट की लंबाई को गतिशील रूप से कैलिब्रेट करती है, जिससे जटिल बेंचमार्क पर सटीकता में सुधार या उसे बनाए रखते हुए महत्वपूर्ण टोकन संपीड़न (कंप्रेशन) प्राप्त होता है।

Chenzhi Hu, Qinzhe Hu, Yuhang Xu, Junyi Chen, Ruijie Wang, Shengzhong Liu, Jianxin Li, Fan Wu, Guihai Chen2026-06-02
💬 NLP

AEyeDE: An Attention-Based Attribution Framework for AI-Generated Text Detection

यह शोध पत्र AEyeDE का प्रस्ताव करता है, जो एक व्याख्यात्मक ढांचा (interpretable framework) है जो एक प्रॉक्सी ट्रांसफॉर्मर मॉडल से अटेंशन-आधारित एट्रिब्यूशन मैप्स का लाभ उठाकर एआई-जनित टेक्स्ट का प्रभावी ढंग से पता लगाने के लिए एक हल्के वजन वाले CNN को इन संरचनात्मक संकेतों पर प्रशिक्षित करता है, जो विभिन्न सेटिंग्स और व्यवधानों (perturbations) में मजबूत प्रदर्शन प्रदर्शित करता है जहाँ पारंपरिक सतही-सांख्यिकीय (surface-statistic) विधियाँ संघर्ष करती हैं।

Aria Nourbakhsh, Adelaide Danilov, Christoph Schommer, Salima Lamsiyah2026-06-02