💬 NLP

From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks

यह शोध पत्र यह प्रकट करता है कि बड़े भाषा मॉडल अक्सर वर्ण गणना (character counting) के कार्यों में आंतरिक प्रतिनिधित्व की कमी के कारण नहीं, बल्कि इसलिए विफल होते हैं क्योंकि बाद की परतों में विशिष्ट नकारात्मक सर्किट सही संकेतों के बजाय गलत, उच्च-संभावना वाले आउटपुट को सक्रिय रूप से दबा देते हैं।

Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi2026-04-03
💬 NLP

LinguDistill: Recovering Linguistic Ability in Vision- Language Models via Selective Cross-Modal Distillation

LinguDistill एक अडैप्टर-मुक्त डिस्टिलेशन विधि है जो लेयर-वाइज़ KV-कैश शेयरिंग के माध्यम से एक फ्रोजन लैंग्वेज मॉडल को शिक्षक के रूप में उपयोग करके विजन-लैंग्वेज मॉडल्स की क्षीण हुई भाषाई क्षमताओं को पुनः प्राप्त करती है, जिससे विजुअल टास्क पर प्रदर्शन से समझौता किए बिना या आर्किटेक्चरल जटिलता बढ़ाए बिना भाषा बेंचमार्क पर महत्वपूर्ण प्रदर्शन सुधार हासिल किया जाता है।

Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva2026-04-03
💬 NLP

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

यह शोध पत्र IKEA-Bench प्रस्तुत करता है, जो क्रॉस-डेपिक्शन असेंबली निर्देश संरेखण (cross-depiction assembly instruction alignment) पर विजन-लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि प्रदर्शन में पैरामीटर संख्या की तुलना में आर्किटेक्चरल फैमिली अधिक महत्वपूर्ण है और साथ ही विलगित विजुअल सबस्पेस (disjoint visual subspaces) एवं टेक्स्ट-ड्रिवन रीजनिंग को प्रमुख यांत्रिक बाधाओं (mechanistic bottlenecks) के रूप में पहचानता है।

Zhuchenyang Liu, Yao Zhang, Yu Xiao2026-04-03
💬 NLP

GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training

यह शोध पत्र GPT-NL पब्लिक कॉर्पस का परिचय देता है, जो कि 36 बिलियन अद्वितीय डच टोकन के साथ-साथ क्यूरेटेड अंग्रेजी, कोड और जर्मन/डेनिश डेटा वाला एक उदार लाइसेंस प्राप्त डेटासेट है, जिसे वैध और उपयोगी वाणिज्यिक भाषा मॉडल के विकास को सुगम बनाने के लिए डिज़ाइन किया गया है।

Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink2026-04-03
💬 NLP

Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization

यह शोध पत्र वेरिएशनल रिवॉर्ड फैक्टराइजेशन (VRF) को प्रस्तुत करता है, जो एक अनिश्चितता-जागरूक ढांचा है जो उपयोगकर्ता की प्राथमिकताओं को एक साझा स्थान में वेरिएशनल वितरणों के रूप में प्रदर्शित करके लार्ज लैंग्वेज मॉडल्स को व्यक्तिगत बनाता है, जिससे विविध बेंचमार्क और परिदृश्यों में मौजूदा नियत (deterministic) विधियों की तुलना में अनुमान सटीकता और विश्वसनीयता में सुधार होता है।

Gyuseok Lee, Wonbin Kweon, Zhenrui Yue, SeongKu Kang, Jiawei Han, Dong Wang2026-04-03
💬 NLP

CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance

यह शोध पत्र CARE को प्रस्तुत करता है, जो एक गोपनीयता-अनुपालक एजेंटिक रीजनिंग फ्रेमवर्क है जो संरचित मार्गदर्शन उत्पन्न करने के लिए एक रिमोट LLM और साक्ष्य-आधारित निर्णय लेने के लिए एक लोकल LLM को जोड़ता है ताकि नए प्रस्तावित MIMIC-DOS डेटासेट पर मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन करते हुए ICU अंग शिथिलता (organ dysfunction) भविष्यवाणी में विरोधाभासी नैदानिक साक्ष्यों को प्रभावी ढंग से हल किया जा सके।

Haochen Liu, Weien Li, Rui Song, Zeyu Li, Chun Jason Xue, Xiao-Yang Liu, Sam Nallaperuma, Xue Liu, Ye Yuan2026-04-03
💻 computer science

The Overlooked Repetitive Lengthening Form in Sentiment Analysis

यह शोध पत्र सेंटीमेंट एनालिसिस में अनदेखे 'रिपिटेटिव लेंथनिंग फॉर्म' (RLF) को संबोधित करने के लिए "Lengthening" डेटासेट और "ExpInstruct" फ्रेमवर्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह अनूठी अनौपचारिक शैली एक महत्वपूर्ण सेंटीमेंट संकेतक है और प्रस्तावित द्वि-चरणीय इंस्ट्रक्शन ट्यूनिंग ओपन-सोर्स LLMs को इस कार्य पर GPT-4 के प्रदर्शन और व्याख्यात्मकता (explainability) के स्तर तक सक्षम बना सकती है।

Lei Wang, Eduard Dragut2026-04-03
💻 computer science

M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency

यह शोध पत्र M2-Verify को प्रस्तुत करता है, जो 16 वैज्ञानिक डोमेन में फैले 469K से अधिक इंस्टेंस वाला एक बड़े पैमाने का, विशेषज्ञ-सत्यापित मल्टीमॉडल बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल जटिल दावा-साक्ष्य निरंतरता (claim-evidence consistency) के साथ संघर्ष करते हैं और सरल कार्यों पर उच्च प्रदर्शन के बावजूद अक्सर स्पष्टीकरणों में मतिभ्रम (hallucinate) का शिकार होते हैं।

Abolfazl Ansari, Delvin Ce Zhang, Zhuoyang Zou, Wenpeng Yin, Dongwon Lee2026-04-03
💻 computer science

Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences

यह शोध पत्र एक फीचर-संवर्धित (feature-augmented), व्याख्या योग्य रिवॉर्ड मॉडलिंग ढांचे का प्रस्ताव करता है जो प्रतिक्रिया की लंबाई और विषाक्तता जैसे संकेतों को शामिल करता है ताकि पूर्वाग्रह और निर्णय लेने वाली प्रणालियों का विश्लेषण करते हुए भाषा मॉडल में मानव प्राथमिकता शिक्षण की सटीकता में महत्वपूर्ण सुधार किया जा सके।

Simona-Vasilica Oprea, Adela Bâra2026-04-03
💻 computer science

Procedural Knowledge at Scale Improves Reasoning

यह शोध पत्र 'रीज़निंग मेमोरी' (Reasoning Memory) का परिचय देता है, जो एक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो 32 मिलियन रीज़निंग ट्राजेक्टरीज को पुन: प्रयोज्य प्रक्रियात्मक ज्ञान प्रविष्टियों में विघटित करके तर्क प्रदर्शन को स्केल करता है, जिससे मॉडल को इन्फरेंस के दौरान प्रासंगिक सबरूटीन्स को खोजने और लागू करने में सक्षम बनाया जाता है ताकि वे गणित, विज्ञान और कोडिंग बेंचमार्क में मौजूदा टेस्ट-टाइम स्केलिंग और RAG बेसलाइन्स से बेहतर प्रदर्शन कर सकें।

Di Wu, Devendra Singh Sachan, Wen-tau Yih, Mingda Chen2026-04-03