🤖 machine learning

Lost in the Middle at Birth: An Exact Theory of Transformer Position Bias

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स में "लॉस्ट इन द मिडल" (Lost in the Middle) घटना कॉज़ल डिकोडर आर्किटेक्चर का एक अंतर्निहित ज्यामितीय गुण है जो इनिशियलाइजेशन के समय मौजूद होता है, जो कॉज़ल मास्किंग और रेसिडुअल कनेक्शन्स के बीच परस्पर क्रिया के कारण होता है जो कॉन्टेक्स्ट के मध्य में एक संरचनात्मक रूप से प्रतिकूल "डेड ज़ोन" (dead zone) बनाता है, एक ऐसा पूर्वाग्रह जो मानक प्रीट्रेनिंग के बाद भी बना रहता है।

Borun D Chowdhury2026-03-12
💬 NLP

The Prediction-Measurement Gap: Toward Meaning Representations as Scientific Instruments

यह शोध पत्र यह तर्क देता है कि कम्प्यूटेशनल सोशल साइंस में प्रेडिक्शन-मेज़रमेंट गैप (पूर्वानुमान-मापन अंतराल) को पाटने के लिए, टेक्स्ट एम्बेडिंग्स को प्रेडिक्शन-केंद्रित अनुकूलन से हटाकर "वैज्ञानिक उपयोगिता" की ओर पुनोरिorient किया जाना चाहिए, जो विश्वसनीय, पता लगाने योग्य सिमेंटिक इन्फरेंस (अर्थ संबंधी अनुमान) को सक्षम करने के लिए ज्यामितिक स्पष्टता, व्याख्यात्मकता और सुदृढ़ता को प्राथमिकता दे।

Hubert Plisiecki2026-03-12
⚡ electrical engineering

Calibration-Reasoning Framework for Descriptive Speech Quality Assessment

यह शोध पत्र एक अंशांकन-तर्क (calibration-reasoning) ढांचे को प्रस्तुत करता है जो बहुआयामी स्पीच गुणवत्ता मूल्यांकन, आर्टिफैक्ट स्थानीयकरण और MOS भविष्यवाणी में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक अंशांकन चरण और ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन-आधारित सुदृढीकरण लर्निंग के माध्यम से मौलिक ऑडियो लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करता है।

Elizaveta Kostenok, Mathieu Salzmann, Milos Cernak2026-03-12
💬 NLP

Video-Based Reward Modeling for Computer-Use Agents

यह शोध पत्र एक्ज़ीक्यूशन वीडियो रिवॉर्ड मॉडल (ExeVRM) को प्रस्तुत करता है, जो एक स्केलेबल और मॉडल-अग्नोस्टिक फ्रेमवर्क है जो एक नए 53k वीडियो-टास्क-रिवॉर्ड डेटासेट और स्पैटियोटेम्पोरल टोकन प्रूनिंग का लाभ उठाकर निष्पादन वीडियो से कंप्यूटर-उपयोग करने वाले एजेंट के प्रक्षेपवक्रों का सटीक मूल्यांकन करता है, जो कार्य सफलता भविष्यवाणी में अग्रणी प्रोप्राइटरी मॉडलों से बेहतर प्रदर्शन करता है।

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao2026-03-12
💬 NLP

Adaptive Activation Cancellation for Hallucination Mitigation in Large Language Models

यह शोध पत्र एडेप्टिव एक्टिवेशन कैंसलेशन (AAC) को प्रस्तुत करता है, जो एक वास्तविक समय, प्रशिक्षण-मुक्त इन्फरेंस फ्रेमवर्क है जो भ्रम (hallucinations) से जुड़ी न्यूरल एक्टिवेशन्स को स्ट्रक्चर्ड इंटरफेरेंस के रूप में पहचानकर और उन्हें दबाकर बड़े भाषा मॉडलों में भ्रम को कम करता है, जिससे सामान्य क्षमताओं या प्रवाह को कम किए बिना कई मॉडल स्केल्स में तथ्यात्मक सटीकता में सुधार होता है।

Eric Yocam, Varghese Vaidyan, Gurcan Comert, Paris Kalathas, Yong Wang, Judith L. Mwakalonge2026-03-12
💬 NLP

Sabiá-4 Technical Report

यह तकनीकी रिपोर्ट साबिया-4 (Sabi'a-4) और साबियाज़िन्हो-4 (Sabiazinho-4) को पेश करती है, जो ब्राजीलियाई पुर्तगाली भाषा के मॉडल की एक नई पीढ़ी है, जिसमें 128K टोकन का कॉन्टेक्स्ट विंडो और कानूनी एवं एजेंटिक कार्यों में विशेष प्रशिक्षण है, जो पिछली पीढ़ियों की तुलना में कानूनी मसौदा तैयार करने, संवाद और टूल के उपयोग में बेहतर लागत-प्रदर्शन और क्षमताओं का प्रदर्शन करते हैं।

Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Roseval Malaquias Junior, Giovana Kerche Bonás, Marcos Piau, Celio La (…)2026-03-12
💬 NLP

S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings

यह शोध पत्र S-GRADES को प्रस्तुत करता है, जो एक ओपन-सोर्स वेब-आधारित बेंचमार्क है जो मानकीकृत मूल्यांकन को सक्षम करने और ऑटोमेटेड एसे स्कोरिंग एवं शॉर्ट आंसर ग्रेडिंग कार्यों के बीच सामान्यीकरण अंतराल (जनरलाइजेशन गैप्स) को प्रकट करने के लिए 14 विविध छात्र प्रतिक्रिया मूल्यांकन डेटासेट्स को एकीकृत करता है।

Tasfia Seuti, Sagnik Ray Choudhury2026-03-12
💬 NLP

Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas

यह शोध पत्र RINoBench प्रस्तुत करता है, जो स्वचालित अनुसंधान विचार नवीनता निर्णयों के मूल्यांकन के लिए पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि बड़े भाषा मॉडल (LLMs) मानव विशेषज्ञों के समान तर्क उत्पन्न कर सकते हैं, फिर भी वे सटीक नवीनता मूल्यांकन उत्पन्न करने में संघर्ष करते हैं जो मानव स्वर्ण मानकों (human gold standards) के अनुरूप हों।

Tim Schopf, Michael Färber2026-03-12
💬 NLP

Large language models can disambiguate opioid slang on social media

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स), लेक्सिकॉन-आधारित, लेक्सिकॉन-मुक्त और उभरते हुए स्लैंग परिदृश्यों में, अस्पष्ट ओपिओइड स्लैंग को सटीक रूप से स्पष्ट करने और प्रासंगिक सोशल मीडिया पोस्टों की पहचान करने में पारंपरिक लेक्सिकॉन-आधारित रणनीतियों से काफी बेहतर प्रदर्शन करते हैं, जिससे ओपिओइड ओवरडोज़ संकट की निगरानी में वृद्धि होती है।

Kristy A. Carpenter, Issah A. Samori, Mathew V. Kiang, Keith Humphreys, Anna Lembke, Johannes C. Eichstaedt, Russ B. Alt (…)2026-03-12
💬 NLP

Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck

यह शोध पत्र DIBJudge को प्रस्तुत करता है, जो एक सुदृढ़ फाइन-ट्यूनिंग फ्रेमवर्क है जो एक विलगित सूचना बाधा (disentangled information bottleneck) का उपयोग करके निर्णय-महत्वपूर्ण निरूपणों से भ्रामक क्रॉस-लिंगुअल सहसंबंधों को अलग करता है, जिससे बहुभाषी LLM-as-a-Judge प्रणालियों में ट्रांसलेशनिस (translationese) पूर्वाग्रह को कम किया जा सके।

Hongbin Zhang, Kehai Chen, Xuefen Bai, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang2026-03-12