💬 NLP

RILEC: Detection and Generation of L1 Russian Interference Errors in English Learner Texts

यह शोध पत्र RILEC प्रस्तुत करता है, जो अंग्रेजी सीखने वाले ग्रंथों में L1 रूसी हस्तक्षेप त्रुटियों का पता लगाने और उन्हें बनाने के लिए एक बड़े पैमाने के डेटासेट और एक जनरेटिव फ्रेमवर्क का परिचय देता है, जो यह प्रदर्शित करता है कि इस संवर्धित डेटा पर फाइन-ट्यून किए गए मॉडल ट्रांसलिट्रेशन (लिप्यंतरण) और टेन्स (काल) के दुरुपयोग जैसे विशिष्ट त्रुटि प्रकारों की पहचान करने में महत्वपूर्ण सुधार करते हैं।

Darya Kharlamova, Irina Proskurina2026-03-10
💬 NLP

Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams

यह शोधपत्र OAKS का परिचय देता है, जो निरंतर विकसित होते ज्ञान प्रवाह के अनुकूल ढलने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल्स और एजेंटिक मेमोरी सिस्टम सटीक स्टेट-ट्रैकिंग करने में संघर्ष करते हैं और गतिशील वातावरण में विचलित होने के प्रति अत्यधिक संवेदनशील हैं।

Jiyeon Kim, Hyunji Lee, Dylan Zhou, Sue Hyun Park, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Sungmin Cha, Minjoon S (…)2026-03-10
💬 NLP

Cross-Modal Taxonomic Generalization in (Vision-) Language Models

यह शोध पत्र यह प्रदर्शित करता है कि विज़न-लैंग्वेज मॉडल भाषाई निरूपणों से वर्गीकरण संबंधी ज्ञान (हाइपरनिम) को पुनः प्राप्त और सामान्यीकृत कर सकते हैं, भले ही प्रशिक्षण के दौरान उन्हें स्पष्ट दृश्य साक्ष्य से वंचित रखा गया हो, बशर्ते कि प्रति-तथ्यात्मक छवि-लेबल मैपिंग श्रेणियों के भीतर उच्च दृश्य सुसंगतता बनाए रखे।

Tianyang Xu, Marcelo Sandoval-Castaneda, Karen Livescu, Greg Shakhnarovich, Kanishka Misra2026-03-10
💬 NLP

Skip to the Good Part: Representation Structure & Inference-Time Layer Skipping in Diffusion vs. Autoregressive LLMs

यह शोध पत्र प्रकट करता है कि डिफ्यूजन लैंग्वेज मॉडल्स, ऑटोरेग्रेसिव मॉडल्स की तुलना में प्रारंभिक-परत अतिरेक (early-layer redundancy) के साथ विशिष्ट, पदानुक्रमित आंतरिक प्रतिनिधित्व विकसित करते हैं, जो एक नवीन, प्रशिक्षण-मुक्त लेयर-स्किपिंग इन्फरेंस पद्धति को सक्षम बनाता है जो उच्च प्रदर्शन बनाए रखते हुए कम्प्यूटेशनल लागतों को महत्वपूर्ण रूप से कम करता है।

Raghavv Goel, Risheek Garrepalli, Sudhanshu Agrawal, Chris Lott, Mingu Lee, Fatih Porikli2026-03-10
💬 NLP

A Joint Neural Baseline for Concept, Assertion, and Relation Extraction from Clinical Text

यह शोध पत्र एक नवीन एंड-टू-एंड संयुक्त न्यूरल सिस्टम प्रस्तावित करता है जो नैदानिक पाठ (clinical text) के लिए अवधारणा पहचान (concept recognition), अभिकथन वर्गीकरण (assertion classification) और संबंध निष्कर्षण (relation extraction) को एक साथ अनुकूलित करता है, जो तीनों कार्यों में पारंपरिक पाइपलाइन बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।

Fei Cheng, Ribeka Tanaka, Sadao Kurohashi2026-03-10
💬 NLP

Bolbosh: Script-Aware Flow Matching for Kashmiri Text-to-Speech

यह शोध पत्र बोलबोश (Bolbosh) को प्रस्तुत करता है, जो कश्मीरी के लिए पहला ओपन-सोर्स न्यूरल टेक्स्ट-टू-स्पीच सिस्टम है, जो ज़ीरो-शॉट मल्टीलिंगुअल बेसलाइन्स की सीमाओं को दूर करने और काफी उच्च स्पीच गुणवत्ता एवं बोधगम्यता प्राप्त करने के लिए ऑप्टिमल ट्रांसपोर्ट कंडीशनल फ्लो मैचिंग (Optimal Transport Conditional Flow Matching) पर आधारित एक स्क्रिप्ट-अवेयर, सुपरवाइज्ड क्रॉस-लिंगुअल अडैप्टेशन रणनीति और एक तीन-चरणीय ध्वनिक संवर्धन पाइपलाइन का उपयोग करता है।

Tajamul Ashraf, Burhaan Rasheed Zargar, Saeed Abdul Muizz, Ifrah Mushtaq, Nazima Mehdi, Iqra Altaf Gillani, Aadil Amin K (…)2026-03-10
🤖 machine learning

Scalable Training of Mixture-of-Experts Models with Megatron Core

यह शोध पत्र मेग्रोटन कोर (Megatron Core) प्रस्तुत करता है, जो एक स्केलेबल और प्रोडक्शन-रेडी ओपन-सोर्स फ्रेमवर्क है जो एकीकृत सिस्टम-स्तरीय अनुकूलन के माध्यम से मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रशिक्षण की युग्मित मेमोरी, संचार और गणना संबंधी चुनौतियों का समाधान करता है, जिससे बड़े पैमाने के GPU क्लस्टर्स पर अरबों से लेकर ट्रिलियन पैरामीटर्स तक के मॉडल्स का उच्च-प्रदर्शन प्रशिक्षण सक्षम होता है।

Zijie Yan (NVIDIA), Hongxiao Bai (NVIDIA), Xin Yao (NVIDIA), Dennis Liu (NVIDIA), Tong Liu (NVIDIA), Hongbin Liu (NVIDIA (…)2026-03-10
💬 NLP

Whitening Reveals Cluster Commitment as the Geometric Separator of Hallucination Types

यह शोध पत्र प्रदर्शित करता है कि GPT-2-small एम्बेडिंग्स पर PCA-whitening लागू करने से क्लस्टर कमिटमेंट (cluster commitment) एक ज्यामितीय विभाजक के रूप में प्रकट होता है जो मतिभ्रम (hallucination) के प्रकारों को अलग करता है, विशेष रूप से पहले अविभेदित "wrong-well convergence" और "coverage gap" विफलताओं को हल करता है और "center-drift" को "wrong-well convergence" से अलग करने में असमर्थता को माप संबंधी आर्टिफैक्ट के बजाय एक मॉडल क्षमता सीमा के रूप में पहचानता है।

Matic Korun2026-03-10
💬 NLP

ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs

ArcLight एक हल्का (lightweight) LLM इन्फरेंस आर्किटेक्चर है जिसे विशेष रूप से many-core CPUs के लिए डिज़ाइन किया गया है जो कुशल मेमोरी प्रबंधन, थ्रेड शेड्यूलिंग और नियंत्रित टेंसर पैरेललिज्म के माध्यम से cross-NUMA मेमोरी एक्सेस बाधाओं को दूर करता है, जिससे व्यापक डिवाइस अनुकूलता बनाए रखते हुए मुख्यधारा के फ्रेमवर्क्स की तुलना में 46% तक अधिक थ्रूपुट प्राप्त होता है।

Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che2026-03-10
💬 NLP

Dual-Metric Evaluation of Social Bias in Large Language Models: Evidence from an Underrepresented Nepali Cultural Context

यह अध्ययन एक 'डुअल-मेट्रिक बायस असेसमेंट' फ्रेमवर्क का उपयोग करके कम प्रतिनिधित्व वाले नेपाली सांस्कृतिक संदर्भ में सात अत्याधुनिक लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे यह स्पष्ट होता है कि जहाँ पक्षपाती कथनों के साथ स्पष्ट सहमति को मापा जा सकता है, वहीं अंतर्निहित जनरेटिव पूर्वाग्रह (इम्प्लिसिट जनरेटिव बायस) विशिष्ट है, तापमान (टेम्परेचर) के साथ एक गैर-रेखीय संबंध का अनुसरण करता है, और सहमति मेट्रिक्स द्वारा खराब तरीके से अनुमानित किया जाता है, जिससे सांस्कृतिक रूप से आधारित डेटासेट और मूल्यांकन रणनीतियों की महत्वपूर्ण आवश्यकता रेखांकित होती है।

Ashish Pandey, Tek Raj Chhetri2026-03-10