💬 NLP

Progressive Residual Warmup for Language Model Pretraining

यह शोध पत्र प्रोग्रेसिव रेसिडुअल वॉर्मअप (ProRes) का प्रस्ताव करता है, जो एक "पहले निचली परतें सीखती हैं" के दर्शन को लागू करके ट्रांसफॉर्मर-आधारित भाषा मॉडलों के प्रीट्रेनिंग को स्थिर और त्वरित करता है, जहाँ गहरी परतें केवल तभी धीरे-धीरे सक्रिय होती हैं जब निचली परतें स्थिर हो जाती हैं, जिसके परिणामस्वरूप तेज़ अभिसरण (convergence) और बेहतर डाउनस्ट्रीम प्रदर्शन प्राप्त होता है।

Tianhao Chen, Xin Xu, Lu Yin, Hao Chen, Yang Wang, Shizhe Diao, Can Yang2026-03-06
💬 NLP

An Exploration-Analysis-Disambiguation Reasoning Framework for Word Sense Disambiguation with Low-Parameter LLMs

यह अध्ययन प्रदर्शित करता है कि चेन-ऑफ-थॉट (Chain-of-Thought) तर्क और पड़ोसी-शब्द विश्लेषण का उपयोग करने वाले सावधानीपूर्वक फाइन-ट्यून किए गए लो-पैरामीटर LLMs (<4B), GPT-4-Turbo जैसे स्टेट-ऑफ-द-आर्ट हाई-पैरामीटर मॉडल्स के तुलनीय या उनसे बेहतर वर्ड सेंस डिसएम्बिगुएशन (Word Sense Disambiguation) प्रदर्शन प्राप्त कर सकते हैं, जबकि कंप्यूटेशनल और ऊर्जा लागत को महत्वपूर्ण रूप से कम करते हैं।

Deshan Sumanathilaka, Nicholas Micallef, Julian Hough2026-03-06
🤖 AI

Dissociating Direct Access from Inference in AI Introspection

यह शोधपत्र यह प्रदर्शित करता है कि एआई मॉडल इंजेक्टेड आंतरिक निरूपणों (internal representations) का पता दो विशिष्ट तंत्रों के माध्यम से लगाते हैं—प्रॉम्प्ट विसंगतियों पर आधारित संभाव्यता-मिलान (probability-matching) और आंतरिक अवस्थाओं तक प्रत्यक्ष, विषय-निरपेक्ष पहुँच—जहाँ उत्तरवर्ती तंत्र विश्वसनीय अर्थ संबंधी पहचान के बिना भी विसंगति का पता लगाने की अनुमति देता है, जो दर्शन और मनोविज्ञान के स्थापित सिद्धांतों के अनुरूप है।

Harvey Lederman, Kyle Mahowald2026-03-06
🤖 AI

Ensembling Language Models with Sequential Monte Carlo

यह शोध पत्र ff-एन्सेम्बल वितरणों के माध्यम से विविध भाषा मॉडलों को संयोजित करने के लिए एक एकीकृत ढांचे का परिचय देता है और इन वितरणों से नमूने लेने के लिए एक बाइट-स्तरीय अनुक्रमिक मोंटे कार्लो एल्गोरिदम प्रस्तावित करता है, जो संरचित पाठ निर्माण कार्यों पर प्रदर्शन में सुधार करने के लिए बेमेल शब्दावली और पक्षपाती अनुमानों जैसी चुनौतियों को प्रभावी ढंग से दूर करता है।

Robin Shing Moon Chan, Tianyu Liu, Samuel Kiegeland, Clemente Pasti, Jacob Hoover Vigly, Timothy J. O'Donnell, Ryan Cott (…)2026-03-06
🤖 AI

Distributed Partial Information Puzzles: Examining Common Ground Construction Under Epistemic Asymmetry

यह शोध पत्र डिस्ट्रीब्यूटेड पार्शियल इंफॉर्मेशन पज़ल (DPIP) और इसके संबंधित मल्टीमॉडल डेटासेट को प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि वर्तमान बड़े भाषा मॉडल (LLMs) और तर्क-आधारित प्रणालियाँ ज्ञान संबंधी विषमता (epistemic asymmetry) के तहत कॉमन ग्राउंड का निर्माण कितनी अच्छी तरह कर सकती हैं, जो यह प्रकट करता है कि आधुनिक LLMs, स्वयंसिद्ध (axiomatic) दृष्टिकोणों की तुलना में कार्य की प्रगति और विश्वास अवस्थाओं (belief states) को सटीक रूप से ट्रैक करने में संघर्ष करते हैं।

Yifan Zhu, Mariah Bradford, Kenneth Lai, Timothy Obiso, Videep Venkatesha, James Pustejovsky, Nikhil Krishnaswamy2026-03-06
💬 NLP

DEBISS: a Corpus of Individual, Semi-structured and Spoken Debates

यह शोध पत्र DEBISS को प्रस्तुत करता है, जो मौखिक और व्यक्तिगत अर्ध-संरचित बहसों का एक नवीन संग्रह है, जिसे स्पीच-टू-टेक्स्ट, स्पीकर डायराइजेशन, आर्गुमेंट माइनिंग और डिबेटर क्वालिटी असेसमेंट जैसे कार्यों के लिए व्यापक एनएलपी एनोटेशन प्रदान करके डिबेट डेटासेट्स की कमी को दूर करने के लिए डिज़ाइन किया गया है।

Klaywert Danillo Ferreira de Souza, David Eduardo Pereira, Cláudio E. C. Campelo, Larissa Lucena Vasconcelos2026-03-06
💬 NLP

NCTB-QA: A Large-Scale Bangla Educational Question Answering Dataset and Benchmarking Performance

यह शोध पत्र NCTB-QA प्रस्तुत करता है, जो एक बड़े पैमाने का बंगाली शैक्षिक प्रश्न-उत्तर डेटासेट है जिसमें प्रतिकूल विचलित करने वाले तत्वों (adversarial distractors) के साथ उत्तर योग्य और अनउत्तर योग्य प्रश्नों का संतुलित वितरण है, और यह प्रदर्शित करता है कि इस डोमेन-विशिष्ट डेटा पर ट्रांसफार्मर मॉडल को फाइन-ट्यून करने से कम-संसाधन (low-resource) सेटिंग्स में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Abrar Eyasir, Tahsin Ahmed, Muhammad Ibrahim2026-03-06
🤖 AI

Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought

यह शोध पत्र प्रदर्शित करता है कि रीजनिंग मॉडल अक्सर अपने आंतरिक विश्वासों को प्रकट किए बिना टोकन उत्पन्न करके "परफॉर्मेटिव चेन-ऑफ-थॉट" प्रदर्शित करते हैं, फिर भी एक्टिवेशन प्रोबिंग (activation probing) जटिल कार्यों में वास्तविक अनिश्चितता को अलग करते हुए, महत्वपूर्ण टोकन कटौती सक्षम करने के लिए इन छिपी हुई निश्चितताओं का शीघ्र पता लगा सकती है।

Siddharth Boppana, Annabel Ma, Max Loeffler, Raphael Sarfati, Eric Bigelow, Atticus Geiger, Owen Lewis, Jack Merullo2026-03-06
🤖 AI

Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation

यह शोध पत्र राजनीतिक रूप से संवेदनशील विषयों को सेंसर करने वाले चीनी ओपन-वेट (open-weight) LLMs का उपयोग ईमानदारी निकालने और झूठ पकड़ने की तकनीकों का मूल्यांकन करने के लिए एक स्वाभाविक परीक्षण आधार (testbed) के रूप में करता है, जिसमें यह पाया गया है कि फ्यू-शॉट प्रॉम्प्टिंग (few-shot prompting) और सेल्फ-क्लासिफिकेशन (self-classification) जैसी विधियाँ सत्यतापूर्ण प्रतिक्रियाओं को प्रभावी ढंग से बढ़ाती हैं और असत्यता का पता लगाती हैं, हालांकि कोई भी दृष्टिकोण धोखे को पूरी तरह से समाप्त नहीं करता है।

Helena Casademunt, Bartosz Cywiński, Khoi Tran, Arya Jakkli, Samuel Marks, Neel Nanda2026-03-06
🤖 AI

The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks

यह शोध पत्र प्रकट करता है कि जबकि प्री-नॉर्म आर्किटेक्चर के कारण ट्रांसफॉर्मर्स में विशाल सक्रियण (massive activations) और अटेंशन सिंक्स (attention sinks) अक्सर सह-अस्तित्व में होते हैं, वे वास्तव में क्रमशः विशिष्ट वैश्विक और स्थानीय कार्यों के रूप में कार्य करते हैं, जिसमें पूर्व निहित मापदंडों (implicit parameters) के रूप में कार्य करता है और बाद वाला अल्प-दूरी की अटेंशन निर्भरताओं को नियंत्रित करता है।

Shangwen Sun, Alfredo Canziani, Yann LeCun, Jiachen Zhu2026-03-06