💬 NLP

RO-N3WS: Enhancing Generalization in Low-Resource ASR with Diverse Romanian Speech Benchmarks

यह शोध पत्र RO-N3WS को प्रस्तुत करता है, जो एक विविध 126-घंटे का रोमानियाई स्पीच बेंचमार्क है जिसे लो-रिसोर्स ऑटोमैटिक स्पीच रिकग्निशन में सामान्यीकरण (जनरलाइजेशन) को बढ़ाने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि इस डेटासेट पर सीमित फाइन-ट्यूनिंग ज़ीरो-शॉट बेसलाइन्स की तुलना में वर्ड एरर रेट्स में महत्वपूर्ण सुधार करती है।

Alexandra Diaconu, Mădălina Vînaga, Bogdan Alexe2026-03-04
💬 NLP

CoDAR: Continuous Diffusion Language Models are More Powerful Than You Think

यह शोध पत्र CoDAR को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा (two-stage framework) है जो निरंतर एम्बेडिंग-स्पेस डिफ्यूजन (continuous embedding-space diffusion) को एक प्रासंगिक ऑटोरेग्रेसिव डिकोडर (contextual autoregressive decoder) के साथ जोड़कर निरंतर डिफ्यूजन लैंग्वेज मॉडल्स में टोकन राउंडिंग की बाधा को दूर करता है, जिससे यह मजबूत डिस्क्रीट डिफ्यूजन मॉडल्स के प्रतिस्पर्धी पीढ़ी गुणवत्ता प्राप्त करने के साथ-साथ प्रवाह (fluency) और विविधता (diversity) के बीच संतुलन बनाने के लिए एक सरल तंत्र भी प्रदान करता है।

Junzhe Shen, Jieru Zhao, Ziwei He, Zhouhan Lin2026-03-04
💬 NLP

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

यह शोध पत्र VC-STaR का प्रस्ताव करता है, जो एक नवीन स्व-सुधार ढांचा (self-improving framework) है जो मॉडल-जनित तर्कों में मतिभ्रम (hallucinations) को कम करने के लिए विजुअल कंट्रास्टिव पेयर्स का लाभ उठाता है, जिसके परिणामस्वरूप VisCoR-55K डेटासेट प्राप्त होता है जो विजन लैंग्वेज मॉडल्स की दृश्य तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye2026-03-04
💬 NLP

ExpGuard: LLM Content Moderation in Specialized Domains

यह शोध पत्र ExpGuard प्रस्तुत करता है, जो एक विशिष्ट गार्डरेल मॉडल और उसका संलग्न क्यूरेटेड डेटासेट (ExpGuardMix) है, जिसे वित्तीय, चिकित्सा और कानूनी डोमेन में सामग्री मॉडरेशन को बढ़ाने के लिए डिज़ाइन किया गया है, जो मौजूदा अत्याधुनिक मॉडलों की तुलना में डोमेन-विशिष्ट प्रतिकूल हमलों के विरुद्ध बेहतर लचीलापन प्रदर्शित करता है।

Minseok Choi, Dongjin Kim, Seungbin Yang, Subin Kim, Youngjun Kwak, Juyoung Oh, Jaegul Choo, Jungmin Son2026-03-04
💬 NLP

GPUTOK: GPU Accelerated Byte Level BPE Tokenization

यह शोध पत्र GPUTOK को प्रस्तुत करता है, जो एक GPU-त्वरित (accelerated) बाइट-लेवल BPE टोकेनाइज़र है जो लंबी-संदर्भ (long-context) इनपुट के लिए मौजूदा लाइब्रेरीज़ की तुलना में 7.6 गुना तक तेज़ प्रदर्शन प्राप्त करते हुए CPU सटीकता से मेल खाता है, जिससे बड़े भाषा मॉडलों (large language models) में टोकेनाइजेशन की बाधा को दूर किया जा सके।

Venu Gopal Kadamba, Kanishkha Jaisankar2026-03-04
💬 NLP

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए दो पॉज़-अवेयर (pause-aware), फाइन-ट्यूनिंग-फ्री डिकोडिंग रणनीतियों का प्रस्ताव करता है ताकि वास्तविक समय में गेम वीडियो कमेंट्री उत्पन्न की जा सके, जो यह प्रदर्शित करता है कि एक नवीन डायनेमिक इंटरवल-आधारित दृष्टिकोण मानव कथनों के साथ सामग्री और समय दोनों को संरेखित करने में फिक्स्ड-इंटरवल विधियों से बेहतर प्रदर्शन करता है।

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya (…)2026-03-04
💬 NLP

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

यह शोध पत्र M3IRT को प्रस्तुत करता है, जो एक मल्टीमॉडल आइटम रिस्पॉन्स थ्योरी फ्रेमवर्क है जो मॉडल क्षमता और आइटम कठिनाई को केवल-छवि, केवल-पाठ और क्रॉस-मोडल घटकों में विभाजित करता है, जिससे शॉर्टकट प्रश्नों को फ़िल्टर किया जा सके, और इस प्रकार मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में वास्तविक क्रॉस-मोडल तर्क के अधिक विश्वसनीय और लागत प्रभावी मूल्यांकन को सक्षम बनाया जा सके।

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi2026-03-04
💬 NLP

ITLC at SemEval-2026 Task 11: Normalization and Deterministic Parsing for Formal Reasoning in LLMs

ITLC टीम SemEval-2026 टास्क 11 के लिए एक नवीन विधि प्रस्तावित करती है जो न्यायवाक्यों (syllogisms) को मानक तार्किक रूपों में बदलकर और नियत पार्सिंग (deterministic parsing) लागू करके बहुभाषी तर्क में सामग्री संबंधी पूर्वाग्रहों को कम करती है, जिससे जटिल फाइन-ट्यूनिंग पर निर्भर किए बिना सभी उप-कार्यों (subtasks) में शीर्ष-5 रैंकिंग प्राप्त होती है।

Wicaksono Leksono Muhamad, Joanito Agili Lopo, Tack Hwa Wong, Muhammad Ravi Shulthan Habibi, Samuel Cahyawijaya2026-03-04
💬 NLP

HateMirage: An Explainable Multi-Dimensional Dataset for Decoding Faux Hate and Subtle Online Abuse

यह शोध पत्र HateMirage प्रस्तुत करता है, जो खंडित गलत सूचनाओं (debunked misinformation) से प्राप्त 4,530 एनोटेटेड "फॉक्स हेट" (faux hate) टिप्पणियों का एक नवीन बहु-आयामी डेटासेट है, जिसे विकृत आख्यानों, हानिकारक इरादे और सामाजिक प्रभाव के बीच सूक्ष्म अंतर्संबंधों को पकड़कर व्याख्यात्मक एआई (explainable AI) अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

Sai Kartheek Reddy Kasu, Shankar Biradar, Sunil Saumya, Md. Shad Akhtar2026-03-04
💬 NLP

OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets

यह शोध पत्र एक बड़े पैमाने के बेंचमार्किंग अध्ययन को प्रस्तुत करता है जो यह प्रदर्शित करता है कि शक्तिशाली मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs), केवल इमेज-ओनली इनपुट्स का उपयोग करके, पारंपरिक OCR-संवर्धित पाइपलाइनों के तुलनीय दस्तावेज़ सूचना निष्कर्षण प्रदर्शन प्राप्त कर सकते हैं, साथ ही एक स्वचालित त्रुटि विश्लेषण ढांचा और स्कीमा एवं निर्देशों को अनुकूलित करने के लिए व्यावहारिक दिशा-निर्देश भी प्रदान करते हैं।

Jiyuan Shen, Peiyue Yuan, Atin Ghosh, Yifan Mai, Daniel Dahlmeier2026-03-04