💬 NLP

Adaptive Block-Scaled Data Types

यह शोध पत्र एडेप्टिव ब्लॉक-स्केल्ड डेटा टाइप्स, विशेष रूप से IF4 फॉर्मेट को प्रस्तुत करता है, जो NVFP4 की क्वांटाइजेशन एरर सीमाओं को दूर करने के लिए प्रत्येक 16 मानों के समूह के लिए FP4 और INT4 निरूपणों के बीच गतिशील रूप से चयन करता है, जिससे भाषा मॉडल क्वांटाइजेशन में बेहतर प्रदर्शन प्राप्त होता है और कुशल हार्डवेयर कार्यान्वयन का प्रदर्शन होता है।

Jack Cook, Hyemin S. Lee, Kathryn Le, Junxian Guo, Giovanni Traverso, Anantha P. Chandrakasan, Song Han2026-03-31
🧬 biology

Beyond cognacy

यह शोध पत्र यह प्रदर्शित करता है कि एक पेयर-हिडन मार्कोव मॉडल (pair-hidden Markov model) से प्राप्त मल्टीपल सीक्वेंस एलाइनमेंट (MSA), भाषा संबंधी वंशावली (phylogenies) के निर्माण के लिए पारंपरिक विशेषज्ञ-एनोटेटेड संज्ञानात्मक सेटों (expert-annotated cognate sets) के एक स्केलेबल और पूर्णतः स्वचालित विकल्प के रूप में कार्य करता है, जो ऐसे वृक्ष (trees) प्रदान करता है जो स्थापित भाषाई वर्गीकरणों के अधिक सुसंगत हैं और टिपोलॉजिकल भिन्नता का बेहतर पूर्वानुमान लगाने में सक्षम हैं।

Gerhard Jäger2026-03-30
🧬 biology

From dots to faces: Individual differences in visual imagery capacity predict the content of Ganzflicker-induced hallucinations

यह अध्ययन प्रदर्शित करता है कि दृश्य कल्पना क्षमता में व्यक्तिगत अंतर गान्ज़फ्लिकर (Ganzflicker)-प्रेरित मतिभ्रम की जटिलता का पूर्वानुमान लगाते हैं, जिसमें प्रबल कल्पना करने वाले स्वाभाविक, जटिल सामग्री रिपोर्ट करते हैं जबकि दुर्बल कल्पना करने वाले सरल ज्यामितीय पैटर्न देखते हैं।

Ana Chkhaidze, Reshanne R. Reeder, Connor Gag, Anastasia Kiyonaga, Seana Coulson2026-03-30
💬 NLP

Neural Models and Language Model Prompting for the Multidimensional Evaluation of Open-Ended Conversations

यह शोध पत्र DSTC-12 चुनौती में ओपन-एंडेड बातचीत के मूल्यांकन को संबोधित करता है, जिसमें छोटे पैमाने के लैंग्वेज मॉडल प्रॉम्प्टिंग की तुलना प्रशिक्षित एनकोडर-आधारित रिग्रेशन और क्लासिफिकेशन मॉडल्स से की गई है, और यह पाया गया है कि जहाँ प्रॉम्प्टिंग ने मामूली सहसंबंध और दूसरा स्थान प्राप्त किया, वहीं छोटे प्रशिक्षित मॉडल्स ने एनोटेशन स्कोर वितरण शिफ्ट के कारण उत्पन्न टेस्ट सेट की चुनौतियों के बावजूद उच्च वैलिडेशन प्रदर्शन दिखाया।

Michelle Elizabeth, Alicja Kasicka, Natalia Krawczyk, Magalie Ochs, Gwénolé Lecorvé, Justyna Gromada, Lina M. Rojas-Bara (…)2026-03-30
💬 NLP

Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum

यह शोध पत्र मॉडल-क्षमता निरंतरता (model-capability continuum) को सुपरवाइज्ड फाइन-ट्यूनिंग उद्देश्यों की प्रभावशीलता को नियंत्रित करने वाले महत्वपूर्ण कारक के रूप में पहचानता है, यह प्रदर्शित करते हुए कि पूर्व-झुकाव वाले संभाव्यता-आधारित नुकसान (prior-leaning probability-based losses) मजबूत मॉडलों के लिए मानक नकारात्मक लॉग-लाइक्लीहुड (NLL) से बेहतर प्रदर्शन करते हैं, जबकि कमजोर मॉडलों के लिए NLL श्रेष्ठ बना रहता है।

Gaotang Li, Ruizhong Qiu, Xiusi Chen, Heng Ji, Hanghang Tong2026-03-30
💬 NLP

Attention-Aligned Reasoning for Large Language Models

यह शोध पत्र ATAR को पेश करता है, जो एक नवीन तर्क पद्धति (reasoning method) है जो LLM के ध्यान (attention) को निर्देशित करती है ताकि महत्वपूर्ण जानकारी को लंबी तर्क श्रृंखलाओं में दबने से रोका जा सके, जिससे कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और गैर-तर्क (non-reasoning) मॉडलों को समान आकार के तर्क मॉडलों से बेहतर प्रदर्शन करने में सक्षम बनाया जाता है।

Hongxiang Zhang, Yuan Tian, Tianyi Zhang2026-03-30
💬 NLP

When to Think and When to Look: Uncertainty-Guided Lookback

यह शोध पत्र प्रकट करता है कि लार्ज विजन लैंग्वेज मॉडल्स में अत्यधिक सोचना अक्सर इमेज-इग्नोरिंग (छवि-अनदेखी) त्रुटियों की ओर ले जाता है, और एक प्रशिक्षण-मुक्त "अनसर्टेन्टी-गाइडेड लुकबैक" रणनीति प्रस्तावित करता है जो मॉडल्स को अनिश्चित होने पर छवि की पुन: जांच करने के लिए गतिशील रूप से प्रेरित करती है, जिससे विजुअल रीजनिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhan (…)2026-03-30
💬 NLP

StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos

यह शोध पत्र StreamGaze प्रस्तुत करता है, जो कि पहला बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal Large Language Models) स्ट्रीमिंग वीडियो में टेम्पोरल रीजनिंग और प्रोएक्टिव इंटेंशन प्रेडिक्शन के लिए मानव दृष्टि संकेतों (human gaze signals) का उपयोग कैसे करते हैं, जो वर्तमान मॉडलों और मानवीय क्षमताओं के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Daeun Lee, Subhojyoti Mukherjee, Branislav Kveton, Ryan A. Rossi, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Franck Dernon (…)2026-03-30
💬 NLP

Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models

यह शोधपत्र नेमेट्रॉन-कैस्केड (Nemotron-Cascade) का परिचय देता है, जो एक 14B सामान्य-उद्देश्य वाला तर्क मॉडल (reasoning model) है, जो क्रॉस-डोमेन विषमता (cross-domain heterogeneity) की इंजीनियरिंग और प्रशिक्षण चुनौतियों से निपटने के लिए एक कैस्केड, डोमेन-वार सुदृढीकरण शिक्षण (reinforcement learning) रणनीति को नियोजित करके विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, और साथ ही यह भी प्रदर्शित करता है कि RLHF संरेखण केवल प्राथमिकता अनुकूलन (preference optimization) से परे तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Moh (…)2026-03-30
💬 NLP

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs

यह शोध पत्र "हियरिंग टू ट्रांसलेट" (Hearing to Translate) प्रस्तुत करता है, जो विविध स्थितियों में 16 कैस्केड सिस्टम के विरुद्ध 6 स्पीचएलएलएम (SpeechLLMs) का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि जबकि कैस्केड आर्किटेक्चर समग्र रूप से सबसे विश्वसनीय बने हुए हैं, उच्च गुणवत्ता वाले स्पीच ट्रांसलेशन के लिए एलएलएम (LLMs) को एकीकृत करना आवश्यक है और हालिया स्पीचएलएलएम विशिष्ट सेटिंग्स में कैस्केड्स के बराबर या उनसे बेहतर हो सकते हैं।

Sara Papi, Javier Garcia Gilabert, Zachary Hopton, Vilém Zouhar, Carlos Escolano, Gerard I. Gállego, Jorge Iranzo-Sánche (…)2026-03-30