💬 NLP

Architecture, Not Scale: Circuit Localization in Large Language Models

यह शोध पत्र इस धारणा को चुनौती देता है कि मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) स्वाभाविक रूप से मॉडल के पैमाने के साथ खराब होती है, बल्कि यह प्रदर्शित करता है कि ग्रुपेड क्वेरी अटेंशन (grouped query attention) जैसे आर्किटेक्चरल विकल्प और विशिष्ट स्केलिंग थ्रेशोल्ड (scaling thresholds), बड़े भाषा मॉडलों में अधिक केंद्रित और स्थिर सर्किट लोकलाइजेशन (circuit localization) की ओर ले जाते हैं।

Sohan Venkatesh2026-05-12
🤖 machine learning

Max-pooling Network Revisited: Analyzing the Role of Semantic Probability in Multiple Instance Learning for Hallucination Detection

यह शोध पत्र एक गणनात्मक रूप से कुशल मतिभ्रम (hallucination) पहचान पद्धति प्रस्तावित करता है जो अत्याधुनिक MIL दृष्टिकोणों के खर्चीले सिमेंटिक निरंतरता गणनाओं को एक मैक्स-पूलिंग नेटवर्क और हल्के एमएलपी (MLP) से प्रतिस्थापित करता है, जो निर्णय मार्जिन विस्तार (decision margin enlargement) में सैद्धांतिक अंतर्दृष्टि का लाभ उठाकर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

Shota Fujikawa, Issei Sato2026-05-12
🤖 AI

Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

यह शोध पत्र प्रकट करता है कि अत्यधिक क्वांटाइज्ड लार्ज लैंग्वेज मॉडल्स व्यवस्थित स्मूथनेस डिग्रेडेशन (smoothness degradation) से ग्रस्त होते हैं जिससे जनरेशन की गुणवत्ता खराब हो जाती है, और एक स्मूथनेस-प्रिजर्विंग सिद्धांत प्रस्तावित करता है जो केवल संख्यात्मक सटीकता सुधारों से परे प्रदर्शन लाभ प्रदान करता है।

Yuzhuang Xu, Xu Han, Yuxuan Li, Pengzhan Li, Wanxiang Che2026-05-12
🤖 AI

FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness

यह शोध पत्र FragileFlow प्रस्तुत करता है, जो एक प्लग-इन रेगुलराइज़र है जो फाउंडेशन मॉडल्स में क्लीन एक्यूरेसी को बनाए रखते हुए वर्स्ट-क्लास रोबस्टनेस को सुधारने के लिए मार्जिन-अवेयर स्पेक्ट्रल एनालिसिस के माध्यम से "करेक्ट-बट-फ्रैजाइल" प्रेडिक्शन एरर्स को औपचारिक रूप देता है और नियंत्रित करता है।

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Xiaowei Huang, Yi Dong2026-05-12
🤖 machine learning

Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes

यह शोध पत्र प्रकट करता है कि एप्पल के MPS बैकएंड में ऑटोरेग्रेसिव इन्फरेंस (autoregressive inference) के दौरान अप्रत्याशित नॉन-मोनोटोनिक लेटेंसी स्पाइक्स (non-monotonic latency spikes) दिखाई देते हैं, जहाँ बैकएंड निष्पादन गतिकी (backend execution dynamics) के कारण विशिष्ट कॉन्फ़िगरेशन के लिए डिकोडिंग प्रदर्शन अचानक 21 गुना तक गिर सकता है, जो CPU और NVIDIA CUDA सिस्टम पर देखे गए सुचारू स्केलिंग के विपरीत है।

Willy Fitra Hendria2026-05-12
🤖 AI

Improving Lexical Difficulty Prediction with Context-Aligned Contrastive Learning and Ridge Ensembling

यह शोधपत्र कॉन्टेक्स्ट-अलाइन्ड कॉन्ट्रास्टिव रिग्रेशन (Context-Aligned Contrastive Regression) का प्रस्ताव देता है, जो एक नवीन ढांचा है जो क्रॉस-लिंगुअल अलाइनमेंट को बेहतर बनाने, ऑर्डिनल संरचनाओं को पकड़ने और व्यवस्थित मॉडल पूर्वाग्रहों को कम करने के लिए क्रॉस-व्यू और ऑर्डिनल कॉन्ट्रास्टिव लर्निंग के साथ रिज रिग्रेशन एनसेम्बलिंग को जोड़कर लेक्सिकल कठिनाई भविष्यवाणी को बढ़ाने का कार्य करता है।

Wicaksono Leksono Muhamad, Joanito Agili Lopo, Tsamarah Rana Nugraha, Ahmad Cahyono Adi, Muhammad Oriza Nurfajri2026-05-12
🤖 machine learning

LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language

यह शोध पत्र LLiMba को प्रस्तुत करता है, जो एक 3B-पैरामीटर वाला सार्डिनियन भाषा मॉडल है जिसे निरंतर प्रीट्रेनिंग और फाइन-ट्यूनिंग के माध्यम से एकल कंज्यूमर GPU पर अनुकूलित किया गया है, जो यह प्रदर्शित करता है कि एक हाई-रैंक rsLoRA कॉन्फ़िगरेशन अन्य अनुकूलन विधियों की तुलना में अनुवाद की गुणवत्ता में बेहतर प्रदर्शन करता है, साथ ही स्क्रिप्ट लीकेज और तथ्यात्मक मतिभ्रम (hallucinations) जैसी गुणात्मक विफलताओं को पकड़ने में मानक मेट्रिक्स की महत्वपूर्ण सीमाओं को भी उजागर करता है।

Luca Ballore2026-05-12
🤖 machine learning

GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives

यह शोध पत्र GAMBIT को प्रस्तुत करता है, जो मल्टी-एजेंट LLM कलेक्टिव्स में सह-विकसित अनुकूलनशील विरोधियों (co-evolving adaptive adversaries) को प्रदर्शित करने वाला एक नवीन बेंचमार्क और डेटासेट है, ताकि यह दर्शाया जा सके कि अनुकूलनशील खतरों के लिए ज़ीरो-शॉट मूल्यांकन भ्रामक है और मजबूत छद्म पहचान (imposter detection) के लिए फ्यू-शॉट पुनर्मूल्यांकन (few-shot recalibration) अत्यंत महत्वपूर्ण है।

Alexandre Le Mercier, Chris Develder, Thomas Demeester2026-05-12
💬 NLP

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में व्यावहारिक तर्क (प्रैग्मैटिक रीजनिंग), जिसे स्केलर विविधता के माध्यम से आंका गया है, एक स्थिर क्षमता नहीं है बल्कि आंतरिक संभाव्यतात्मक निरूपणों और कार्य-प्रेरित प्रॉम्प्टिंग व्यवहारों के बीच एक परिवर्तनशील अंतःक्रिया है, जो मॉडल की क्षमताओं की व्याख्या करने में मूल्यांकन डिजाइन के महत्वपूर्ण प्रभाव को रेखांकित करता है।

Ye-eun Cho2026-05-12
🤖 AI

Phase Transitions in Affective Meaning Divergence: The Hidden Drift Before the Break

यह शोध पत्र भावनात्मक अर्थ विचलन (AMD) को संबंध टूटने के एक महत्वपूर्ण भविष्यवक्ता के रूप में औपचारिक रूप देता है, जो गेम-थ्योरेटिक मॉडलिंग और संवादात्मक डेटा के अनुभवजन्य विश्लेषण के माध्यम से यह प्रदर्शित करता है कि बातचीत में मरम्मत समन्वय (repair coordination) में एक अचानक, हिस्टेरेटिक पतन होता है जब AMD-जनित भार एक विशिष्ट सीमा से अधिक हो जाता है, जो कि एक ऐसी घटना है जो पारंपरिक विषाक्तता और भावना मेट्रिक्स से बेहतर प्रदर्शन करने वाले विशिष्ट क्रिटिकल-स्लोइंग-डाउन हस्ताक्षरों द्वारा लक्षित है।

Napassorn Litchiowong2026-05-12