💬 NLP

Priors Persist Through Suppression: A Stroop Paradigm for Lexical Override

यह शोध पत्र यह प्रदर्शित करता है कि भाषा मॉडलों में, परिचित लेक्सिकल प्रायोरिटीज़ (lexical priors) को स्पष्ट ओवरराइड नियमों द्वारा प्रतिस्थापित करने के बजाय उनके माध्यम से बना रहता है, जिससे स्ट्रोप-समान हस्तक्षेप (Stroop-like interference) उत्पन्न होता है जो परिभाषा लक्ष्यों (definition targets) को क्वेरी शब्दों (query words) से जोड़ने वाले विशिष्ट सक्रियण पथों (activation pathways) से उत्पन्न और यांत्रिक रूप से स्थानीयकृत होता है।

Han-yu Wang2026-06-09
💬 NLP

Phantom transitions in language model fine-tuning

यह शोध पत्र प्रकट करता है कि निकट-समानार्थी (near-synonym) कार्यों पर भाषा मॉडल के फाइन-ट्यूनिंग के दौरान दिखने वाले आभासी चरण संक्रमण (phase transitions), एम्बेडिंग स्पेस में वास्तविक ज्यामितीय परिवर्तनों के बजाय सॉफ्टमैक्स रीडआउट में विच्छिन्नता (discontinuities) के कारण उत्पन्न "फैंटम" आर्टिफैक्ट्स हैं, एक ऐसी घटना जिसे एक एकीकृत ऑर्डर पैरामीटर द्वारा अभिलक्षित किया जाता है जो विविध आर्किटेक्चरों में महत्वपूर्ण लर्निंग रेट्स की सफलतापूर्वक भविष्यवाणी करता है।

Vaibhav Prakash, Jayasri Dontabhaktuni2026-06-09
💬 NLP

Function-Vector Heads Are Two Populations: Writers and Cancellers in In-Context Learning

यह शोध पत्र इस धारणा को चुनौती देता है कि फंक्शन-वेक्टर हेड्स (function-vector heads) एक सजातीय समूह हैं, यह प्रकट करते हुए कि वे दो विरोधी उप-जनसंख्याओं—सही नियमों को बढ़ावा देने वाले 'राइटर्स' (writers) और उन्हें दबाने वाले 'कैंसलर्स' (cancellers)—से बने हैं, जो केवल परिमाण-आधारित रैंकिंग (magnitude-only ranking) के लिए अदृश्य हैं लेकिन जब उनकी पहचान कर ली जाती है और उन्हें हटाया (ablated) जाता है, तो मॉडल के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करते हैं।

Han-yu Wang2026-06-09
💬 NLP

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

यह शोध पत्र स्विस जर्मन ASR के लिए विस्पर (Whisper) को फाइन-ट्यून करने का एक व्यवस्थित अध्ययन प्रस्तुत करता है जो पूर्ववर्ती अत्याधुनिक परिणामों में गंभीर बेंचमार्क संदूषण (benchmark contamination) को उजागर करता है, मानक जर्मन उपशीर्षक वाले ब्रॉडकास्ट डेटा का उपयोग करके 25.6% WER (13.8% cWER) का एक कठोरता से मूल्यांकित ईमानदार आधारभूत स्तर (baseline) स्थापित करता है, और प्रतिलिपि प्रस्तुत करने योग्य मॉडल जारी करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान बेंचमार्क मुख्य रूप रूप से वास्तविक बोली संबंधी समझ के बजाय कन्वेंशन मिलान को मापते हैं।

Felix Akeret2026-06-09
🤖 machine learning

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

यह शोध पत्र LEAF का प्रस्ताव करता है, जो एक रेट्रोस्पेक्टिव ट्री-आधारित सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) विधि है जो रोलआउट बैचों में साझा प्रीफिक्स को स्पैन-स्तरीय लाभ (स्पैन-लेवल एडवांटेज) प्रदान करके स्पीच-अवेयर लार्ज लैंग्वेज मॉडल पोस्ट-ट्रेनिंग में सुधार करता है, जिससे यह मौजूदा GRPO-शैली के दृष्टिकोणों और यहाँ तक कि छोटे मॉडलों वाले फुल-पैरामीटर बेसलाइनों को भी पीछे छोड़ देता है।

Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson, Venugopal V. Veeravalli2026-06-09
💬 NLP

Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing

Crayotter एक ओपन-सोर्स, ट्रेस करने योग्य मल्टी-एजेंट सिस्टम है जो नैरेटिव कोहेरेंस (कथा सुसंगतता) और थीम अलाइनमेंट (विषय संरेखण) में मौजूदा बेसलाइन्स की तुलना में बेहतर प्रदर्शन करने के लिए दीर्घ-रूप वीडियो संपादन को तीन आर्टिफैक्ट-संचालित चरणों में व्यवस्थित करता है ताकि डायग्नोस्टिक संशोधनों को सक्षम बनाया जा सके।

Lecheng Yan, Yichong Zhang, Ben Pan, Xiaoyu Zheng, Jiawei Qian, Anqi Wu, Wenxi Li, Chenyang Lyu2026-06-09
🤖 machine learning

How Much Dense Attention is Necessary? Oracle-Guided Sparse Prefill for Full/GQA Layers in Hybrid Long-Context Models

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट हाइब्रिड मॉडल्स के लिए आवश्यक न्यूनतम डेंस अटेंशन (dense attention) निर्धारित करने हेतु एक अटेंशन-मास टॉप-के ओरकल (attention-mass top-k oracle) प्रस्तुत करता है और यह प्रदर्शित करता है कि एक फ्रोजन-बैकबोन (frozen-backbone), केएल-डिस्टिल्ड (KL-distilled) स्पार्स इंडेक्सर, क्यूवेन-फैमिली (Qwen-family) मॉडल्स पर महत्वपूर्ण प्रीफिल स्पीडअप प्रदान करते हुए लगभग ओरकल-गुणवत्ता वाला संरक्षण प्राप्त कर सकता है।

Hongxing Wang, Harenome Razanajato, Zhen Zhang, Yujie Yuan, Hongsheng Liu2026-06-09
🤖 AI

Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning

यह शोध पत्र AGCLR प्रस्तुत करता है, जो मध्यवर्ती तथ्यों को ओवरराइट करने की "कॉन्सेप्ट बॉटलनेक" (concept bottleneck) की समस्या को दूर करने के लिए एक गेटेड पर्सिस्टेंट मेमोरी स्ट्रीम जोड़कर CoCoNuT रीजनिंग प्रतिमान (paradigm) को उन्नत करता है, जिससे रीजनिंग की गहराई बढ़ने के साथ मल्टी-हॉप रीजनिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Mujtaba Farhan, Maheep Chaudhary2026-06-09
💬 NLP

ReadingMachine: A Computational Methodology for Structured Corpus Reading and Large-Scale Synthesis

ReadingMachine एक ओपन-सोर्स कम्प्यूटेशनल फ्रेमवर्क है जो पारंपरिक रिट्रीवल या रिकर्सिव समराइजेशन पर निर्भर रहने के बजाय, प्रक्रिया को इनसाइट एक्सट्रैक्शन और सिमेंटिक क्लस्टरिंग जैसे निरीक्षण योग्य चरणों में विभाजित करके, बड़े दस्तावेज़ कॉर्पोरा के संरचित, ट्रेस करने योग्य और कवरेज-संरक्षण विश्लेषण को करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।

James Morrissey2026-06-09
💬 NLP

Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

यह शोध पत्र एक मूल्यांकन प्रोटोकॉल और विश्लेषणात्मक ढांचे का प्रस्ताव करता है ताकि स्वच्छ (clean), विषाक्त (poisoned) या मिश्रित (mixed) रिट्रीवल साक्ष्य का सामना करते समय तथ्यात्मक सटीकता बनाए रखने की क्षमता का परीक्षण करके, भ्रामक सूचनाओं के विरुद्ध रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) प्रणालियों की मजबूती का व्यवस्थित रूप से आकलन किया जा सके।

Sevgi Yigit-Sert2026-06-09