💬 NLP

CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention

CARVE एक कंटेंट-अवेयर रिकरेंट आर्किटेक्चर है जो इरेज़ ऑपरेशन्स को की एक्सिस (key axis) तक सीमित करके प्रमुख डेल्टा-रूल मॉडल्स के मुख्य दोषों को हल करता है, जिससे कम पैरामीटर्स और मेमोरी उपयोग के साथ परप्लेक्सिटी, रीजनिंग और रिट्रीवल में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करते हुए कुशल WY-फॉर्म चंक-पैरेलल ट्रेनिंग सक्षम होती है।

Sayak Dutta2026-06-26
💬 NLP

LMs as Task-Specific Knowledge Bases: An Interpretability Analysis

यह शोध पत्र व्यवहारिक और यांत्रिक विश्लेषणों के माध्यम से इस दृष्टिकोण को चुनौती देता है कि भाषा मॉडल एकीकृत ज्ञान आधार हैं, जो यह प्रदर्शित करता है कि तथ्यात्मक ज्ञान एक कार्य-विशिष्ट तरीके से एनकोडेड होता है, जहाँ क्वेरी संदर्भ के आधार पर विशिष्ट पैरामीटर उपसमुच्चय सक्रिय होते हैं, जिससे तथ्यात्मक पुनर्प्राप्ति की निरंतरता और विश्वसनीयता बाधित होती है।

Amit Elhelo, Amir Globerson, Mor Geva2026-06-26
📊 statistics

The Geometry of Updates: Fisher Alignment at Vocabulary Scale

यह शोध पत्र FisherSketch प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), स्ट्रीमिंग-कुशल विधि है जो साझा शब्दावली वाले LLM परिवारों के लिए स्केलेबल स्रोत चयन और कार्य समानता निदान (task similarity diagnostics) को सक्षम करने हेतु कर्नेल मीन एम्बेडिंग्स (kernel mean embeddings) के माध्यम से हेड फिशर संरेखण (head Fisher alignment) का अनुमान लगाता है, जो केवल प्रतिनिधित्व-आधारित मेट्रिक्स की सीमाओं और पूर्ण फिशर मैट्रिसेस की कम्प्यूटेशनल लागत पर विजय प्राप्त करता है।

John Sweeney2026-06-26
💬 NLP

How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation

यह शोध पत्र एक नैदानिक ढांचे का प्रस्ताव करता है जो ऐतिहासिक इतालवी में टोकनाइज़ेशन लागत को अर्थ संबंधी बोध से अलग करता है, जिससे यह स्पष्ट होता है कि जबकि 17वीं शताब्दी के ग्रंथों में मजबूत एम्बेडिंग समानता के बावजूद उच्च भविष्य कहनेवाला अनिश्चितता होती है, इस जनरेटिव अस्थिरता को सरल टेम्पोरल कॉन्टेक्स्ट प्रॉम्प्टिंग के माध्यम से लगभग 60% तक प्रभावी ढंग से कम किया जा सकता है।

Maria Levchenko2026-06-26
💬 NLP

Multilingual Reasoning Cascades Need More Context

यह शोध पत्र एक प्रशिक्षण-मुक्त, संदर्भ-जागरूक अनुवाद कैस्केड (translation cascade) का प्रस्ताव और सत्यापन करता है जो तर्क प्रक्रिया (reasoning pipeline) के दौरान मूल उपयोगकर्ता प्रश्न को सुरक्षित रखता है, और मानक बहुभाषी तर्क दृष्टिकोणों में निहित सूचना की हानि और त्रुटि प्रसार को कम करके विविध भाषाओं और कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

Arnav Mazumder, Dengjia Zhang, Shuyue Stella Li, Yulia Tsvetkov, Niyati Bafna2026-06-26
💬 NLP

Narrative Feature or Structured Feature? A Study of Large Language Models to Identify Cancer Patients at Risk of Heart Failure

यह अध्ययन प्रदर्शित करता है कि एक लार्ज लैंग्वेज मॉडल (GatorTron-3.9B), जो संरचित चिकित्सा कोडों से प्राप्त नवीन नैरेटिव विशेषताओं का उपयोग करता है, हृदय गति रुकने (हार्ट फेल्योर) के जोखिम वाले कैंसर रोगियों की पहचान करने में पारंपरिक मशीन लर्निंग और डीप लर्निंग मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है।

Ziyi Chen, Mengyuan Zhang, Mustafa Mohammed Ahmed, Yi Guo, Thomas J. George, Jiang Bian, Yonghui Wu2026-06-25
💬 NLP

Privacy-Aware Visual Language Models

यह शोध पत्र उच्च गुणवत्ता वाले बेंचमार्क (PrivBench और PrivBench-H) और एक इंस्ट्रक्शन-ट्यूनिंग डेटासेट (PrivTune) को पेश करते हुए गोपनीयता-संवेदनशील सामग्री को संभालने में विजुअल लैंग्वेज मॉडल्स की सीमाओं को संबोधित करता है, और यह प्रदर्शित करता है कि न्यूनतम डेटा पर फाइन-ट्यूनिंग करने से समग्र प्रदर्शन को बनाए रखते हुए गोपनीयता जागरूकता में उल्लेखनीय वृद्धि होती है।

Laurens Samson, Nimrod Barazani, Sennay Ghebreab, Yuki M. Asano2026-06-25
💬 NLP

Hengqin-RA-v1: Advanced Large Language Model for Diagnosis and Treatment of Rheumatoid Arthritis with Dataset based Traditional Chinese Medicine

यह शोध पत्र Hengqin-RA-v1 को प्रस्तुत करता है, जो पारंपरिक चीनी चिकित्सा के लिए एक विशिष्ट लार्ज लैंग्वेज मॉडल है, जो निदान और उपचार की सटीकता में सामान्य-उद्देश्य वाले मॉडलों और यहाँ तक कि मानव चिकित्सकों से भी बेहतर प्रदर्शन करने के लिए एक नए क्यूरेटेड रुमेटॉइड अर्थराइटिस डेटासेट का लाभ उठाता है।

Yishen Liu2026-06-25
💬 NLP

A Systematic Analysis of Hybrid Linear Attention

यह शोध पत्र व्यवस्थित रूप से 72 हाइब्रिड लीनियर अटेंशन मॉडलों का मूल्यांकन करता है यह निर्धारित करने के लिए कि जबकि स्टैंडअलोन लीनियर प्रदर्शन हाइब्रिड सफलता की गारंटी नहीं देता है, HGRN-2 या GatedDeltaNet जैसी आर्किटेक्चर जो 3:1 से 6:1 के लीनियर-टू-फुल अटेंशन अनुपात का उपयोग करती हैं, चयनात्मक गेटिंग (selective gating), पदानुक्रमित पुनरावृत्ति (hierarchical recurrence) और नियंत्रित विस्मृति (controlled forgetting) का लाभ उठाकर कुशलतापूर्वक ट्रांसफॉर्मर-स्तर की रिकॉल प्राप्त करती हैं।

Dustin Wang, Rui-Jie Zhu, Steven Abreu, Yong Shan, Taylor Kergan, Yuqi Pan, Yuhong Chou, Zheng Li, Jibin Wu, Ge Zhang, W (…)2026-06-25
💬 NLP

Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

यह शोध पत्र प्रदर्शित करता है कि, एक निश्चित कंप्यूट बजट के तहत, मानक इंस्ट्रक्शन फाइन-ट्यूनिंग (instruction fine-tuning) अधिकांश मॉडल स्केल्स और कार्यों में रीजनिंग डिस्टिलेशन (reasoning distillation) से बेहतर प्रदर्शन करती है या उसके बराबर रहती है, जबकि बाद वाला केवल बड़े मॉडलों के लिए ओपन-एंडेड समस्याओं पर तभी फायदेमंद होता है जब इसे 25-50% रीजनिंग डेटा के लागत प्रभावी करिकुलम मिक्सिंग (curriculum mixing) के साथ जोड़ा जाए।

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo2026-06-25