💬 NLP

Linear representations of grammaticality in neural language models

यह शोध पत्र प्रदर्शित करता है कि व्याकरणिकता विविध पूर्व-प्रशिक्षित न्यूरल लैंग्वेज मॉडलों की आंतरिक अवस्थाओं के भीतर एक विशिष्ट प्रतिनिधित्वत्मक आयाम के रूप में सुदृढ़ और स्वतंत्र रूप से एनकोडेड है, जो उनकी वाक्यात्मक सक्षमता का मूल्यांकन करने के लिए एक संभाव्यता-मुक्त ढांचा प्रदान करता है।

Jane Li, Najoung Kim2026-07-17
💬 NLP

T^2MLR: Transformer with Temporal Middle-Layer Recurrence

यह शोधपत्र T^2MLR प्रस्तुत करता है, जो एक ट्रांसफॉर्मर आर्किटेक्चर है जो पिछले टोकन के कैश किए गए मध्य-परत (middle-layer) निरूपणों को वर्तमान टोकन की प्रारंभिक परतों में संलयित (fuse) करके लेटेंट रीजनिंग (latent reasoning) को बढ़ाता है, जो एक लक्षित दृष्टिकोण है जो मानक बेसलाइन और पूर्ण-परत पुनरावृत्ति (full-layer recurrence) से बेहतर प्रदर्शन करता है और मौजूदा प्रीट्रेन्ड मॉडलों के कुशल रेट्रोफिटिंग की अनुमति देता है।

Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora2026-07-17
💬 NLP

Mask-Aware Policy Gradients for Diffusion Language Models

यह शोध पत्र मास्क-अवेयर पॉलिसी ग्रेडिएंट्स (Mask-Aware Policy Gradients) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल जनरेशन को टोकन चयन और स्थिति मास्किंग को संयुक्त रूप से अनुकूलित करने के लिए एक दो-चरणीय निर्णय प्रक्रिया के रूप में औपचारिक रूप देता है, जिससे लॉग-लाइक्लीहुड (log-likelihood) की जटिलता को दूर किया जा सकता है और गणितीय तर्क एवं कोडिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है।

Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl2026-07-17
💬 NLP

Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya

यह शोधपत्र VEXMLM को प्रस्तुत करता है, जो अम्हारिक और तिग्रिन्या जैसी गीज़-लिपि वाली भाषाओं के लिए विशेष रूप से तैयार किया गया XLM-R का एक शब्दावली-विस्तारित संस्करण है, जो एक विशिष्ट दो-चरणीय प्रशिक्षण रणनीति के माध्यम से आउट-ऑफ-वोकेबुलरी दरों और अत्यधिक सबवर्ड विखंडन को कम करके प्रश्न उत्तर, भावना विश्लेषण और नामित इकाई पहचान जैसे डाउनस्ट्रीम कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है, जो 17 अन्य कम-संसाधन वाली अफ्रीकी भाषाओं को भी लाभान्वित करता है।

Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl2026-07-17
💬 NLP

In-Place Tokenizer Expansion for Pre-trained LLMs

यह शोध पत्र एक इन-प्लेस टोकेनाइज़र एक्सपेंशन विधि प्रस्तुत करता है जो एक बहुभाषी कॉर्पस पर BPE मर्ज को जारी रखकर और सब-टोकेन एवरेजिंग के माध्यम से नए एम्बेडिंग्स को इनिशियलाइज़ करके प्री-ट्रेंड LLMs को अपग्रेड करती है, जिससे मॉडल की गुणवत्ता से समझौता किए बिना हिंदी और वियतनामी जैसी भाषाओं के लिए टोकन काउंट को काफी कम किया जाता है और डिकोड गति में सुधार किया जाता है।

Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, A (…)2026-07-17
💬 NLP

Language Identification via Compositional Data Analysis: A Linear-Time Classifier Based on Log-Ratio Geometry

यह शोध पत्र एक गणनात्मक रूप से कुशल, रैखिक-समय भाषा पहचान वर्गीकरण (classifier) प्रस्तावित करता है जो सेंटर्ड लॉग-रेशियो (CLR) रूपांतरणों और लैप्लेस स्मूथिंग का उपयोग करके कंपोजिशनल डेटा के रूप में वर्ण (character) और बिग्राम आवृत्तियों को मॉडल करता है, जिससे संसाधन-गहन न्यूरल आर्किटेक्चर के एक नियतात्मक और व्याख्या योग्य विकल्प के रूप में सुदृढ़ सटीकता प्राप्त होती है।

Paul-Andrei Pogăcean, Sanda-Maria Avram2026-07-17
💬 NLP

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

यह शोध पत्र मीडियाइवल मेडिकोको 2025 जीआई एंडोस्कोपी डेटासेट पर नौ मल्टीमॉडल वीक्यूए (VQA) प्रणालियों का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि जहाँ पैरामीटर-कुशल अनुकूलन (parameter-efficient adaptation) मजबूत प्रदर्शन प्रदान करता है, वहीं विश्वसनीय स्वास्थ्य सेवा एआई प्राप्त करने के लिए केवल उत्तर की सटीकता के बजाय संरचित तर्क (structured reasoning), स्पष्ट ग्राउंडिंग (explicit grounding) और सुदृढ़ मूल्यांकन मेट्रिक्स को प्राथमिकता देना आवश्यक है।

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks2026-07-17
💬 NLP

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search

यह शोध पत्र प्रदर्शित करता है कि मल्टी-स्टेप एजेंटिक सर्च में स्टैटिक रिट्रीवल यूटिलिटी (static retrieval utility), कॉज़ल यूटिलिटी (causal utility) का पूर्वानुमान लगाने में विफल रहती है, जिससे यह प्रकट होता है कि एक एजेंट की सफलता के लिए आवश्यक लगभग एक-तिहाई दस्तावेज़ ("ब्रिज डॉक्यूमेंट्स") स्टैटिक पाठकों के लिए बेकार प्रतीत होते हैं क्योंकि उनका वास्तविक मूल्य वर्तमान प्रश्न का सीधा उत्तर देने के बजाय भविष्य के प्रश्नों को पुनर्निर्देशित करने वाले डिस्क्रिमिनेटिव एंटिटीज (discriminative entities) प्रदान करने में निहित है।

Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee2026-07-17
💬 NLP

Pretraining Data Can Be Poisoned through Computational Propaganda

यह शोध पत्र प्रदर्शित करता है कि सार्वजनिक चर्चा इंटरफेस के माध्यम से भाषा मॉडलों के लिए बड़े पैमाने पर प्रीट्रेनिंग डेटा को विषाक्त किया जा सकता है और "HalfLife" का परिचय देता है, जो वेब क्रॉलिंग और क्यूरेशन के बाद ऐसे प्रतिकूल कंटेंट के समावेश का अनुमान लगाने के लिए एक नवीन विश्लेषण पद्धति है।

Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo2026-07-17
🤖 AI

Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems

यह सर्वेक्षण लार्ज लैंग्वेज मॉडल-आधारित प्रणालियों में रूटिंग रणनीतियों का एक व्यापक अवलोकन प्रदान करता है, जो यह विश्लेषण करता है कि कैसे प्रश्नों को उपयुक्त मॉडलों की ओर गतिशील रूप से निर्देशित करना मोनोलिथिक आर्किटेक्चर की अक्षमताओं को दूर करके संसाधन खपत को अनुकूलित कर सकता है, लागत कम कर सकता है और प्रदर्शन को बढ़ा सकता है।

Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet2026-07-16