💬 NLP

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

यह शोध पत्र RELIC को पेश करता है, जो बड़े भाषा मॉडलों (LLMs) की जटिल तर्क क्षमता का मूल्यांकन करने के लिए एक ढांचा है, जो इन-कॉन्टेक्स्ट (in-context) संदर्भ-मुक्त भाषाओं (context-free languages) को पहचानने की उनकी क्षमता का परीक्षण करता है, जिससे यह पता चलता है कि उन्नत मॉडल भी कार्य की कठिनाई के साथ इन्फरेंस कंप्यूट (inference compute) को स्केल करने में विफल रहते हैं और अक्सर जटिलता बढ़ने के साथ एल्गोरिद्मिक तर्क (algorithmic reasoning) से अनुमान लगाने (guessing) की ओर स्थानांतरित हो जाते हैं।

Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen2026-04-29
💬 NLP

Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?

यह अध्ययन प्रकट करता है कि प्रश्नों का प्रारूप, जिसमें विकल्पों की संख्या और विशिष्ट शब्दावली शामिल है, तर्क संबंधी कार्यों पर लार्ज लैंग्वेज मॉडल के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है, जिससे अक्सर तर्क के चरणों की सटीकता और अंतिम उत्तर की शुद्धता के बीच एक विसंगति उत्पन्न होती है।

Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong2026-04-29
💬 NLP

Named Entity Recognition of Historical Texts via Large Language Model

यह अध्ययन दर्शाता है कि लार्ज लैंग्वेज मॉडल्स, ज़ीरो-शॉट और फ्यू-शॉट प्रॉम्प्टिंग रणनीतियों का उपयोग करते हुए, उन ऐतिहासिक ग्रंथों के लिए नेमड एंटिटी रिकग्निशन (Named Entity Recognition) हेतु एक व्यवहार्य और कुशल विकल्प प्रदान करते हैं जहाँ एनोटेटेड ट्रेनिंग डेटा की कमी है, जो पूरी तरह से सुपरवाइज्ड मॉडल्स से पीछे रहने के बावजूद भी उचित रूप से मजबूत प्रदर्शन प्राप्त करते हैं।

Shibingfeng Zhang, Giovanni Colavizza2026-04-29
💬 NLP

Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal

यह शोध पत्र निर्देश-ट्यून किए गए बड़े भाषा मॉडलों (large language models) में इनकार (refusal) के आंतरिक तंत्र की जांच करता है, जिसमें विशिष्ट लेटेंट फीचर्स (latent features) को पहचानने और उन्हें हटाने (ablate करने) के लिए स्पार्स ऑटोएनकोडर्स (sparse autoencoders) को प्रशिक्षित किया गया है जो मॉडल को इनकार से अनुपालन (compliance) की ओर कारणवश बदल देते हैं, जिससे जेलब्रेकिंग के लिए एक बहु-चरणीय पाइपलाइन का खुलासा होता है और रेडंडेंट सुरक्षा फीचर्स (redundant safety features) के अस्तित्व पर प्रकाश पड़ता है।

Nirmalendu Prakash, Yeo Wei Jie, Amir Abdullah, Ranjan Satapathy, Erik Cambria, Roy Ka Wei Lee2026-04-29
💬 NLP

The Unheard Alternative: Contrastive Explanations for Speech-to-Text Models

यह योगदान स्पीच-टू-टेक्स्ट मॉडलों में कंट्रास्टिव स्पष्टीकरण (contrastive explanations) उत्पन्न करने की पहली विधि प्रस्तुत करता है, जो यह विश्लेषण करती है कि इनपुट स्पेक्ट्रोग्राम फीचर्स वैकल्पिक आउटपुट के बीच चयन को कैसे प्रभावित करते हैं, और स्पीच ट्रांसलेशन में जेंडर असाइनमेंट पर एक केस स्टडी के माध्यम से उनकी प्रभावशीलता को प्रदर्शित करता है।

Lina Conti, Dennis Fucci, Marco Gaido, Matteo Negri, Guillaume Wisniewski, Luisa Bentivogli2026-04-29
💬 NLP

From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models

यह शोध पत्र GISP को प्रस्तुत करता है, जो एक वैश्विक पुनरावृत्ति संरचित प्रूनिंग (iterative structured pruning) विधि है जो अटेंशन हेड्स और MLP चैनलों को कुशलतापूर्वक हटाने के लिए प्रथम-क्रम हानि-आधारित महत्व स्कोर (first-order loss-based importance scores) को एकत्रित करती है, जिससे यह उच्च विरलता स्तरों (high sparsity levels) पर सटीकता को स्थिर करने और मध्यवर्ती फाइन-ट्यूनिंग के बिना कार्य-विशिष्ट अनुकूलन को सक्षम करने में पारंपरिक स्थानीय प्रतिमानों (local paradigms) से बेहतर प्रदर्शन करती है।

Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Minwoo Lee, Shu-ping Yeh, Evgeny Stupachenko, Hao Feng, Li Yang2026-04-29
💬 NLP

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

यह शोध पत्र प्रकट करता है कि LLM-आधारित जज विभिन्न रन के दौरान महत्वपूर्ण इंट्रा-रेटर विसंगति प्रदर्शित करते हैं, जो उनके स्कोर की विश्वसनीयता को कम करता है, और यह जांच करता है कि क्या विशिष्ट दिशानिर्देशों के माध्यम से ऐसे मूल्यांकनों का अभी भी प्रभावी ढंग से उपयोग किया जा सकता है।

Rajarshi Haldar, Julia Hockenmaier2026-04-29
💬 NLP

MiMo-Embodied: X-Embodied Foundation Model Technical Report

यह शोधपत्र MiMo-Embodied को प्रस्तुत करता है, जो पहला ओपन-सोर्स क्रॉस-एम्बोडेड फाउंडेशन मॉडल है जो मल्टी-स्टेज लर्निंग, क्यूरेटेड डेटा और CoT/RL फाइन-ट्यूनिंग का लाभ उठाकर स्वायत्त ड्राइविंग (autonomous driving) और एम्बोडेड एआई (embodied AI) दोनों में अत्याधुनिक प्रदर्शन प्राप्त करता है ताकि इन दोनों डोमेन के बीच मजबूत सकारात्मक स्थानांतरण (positive transfer) को प्रदर्शित किया जा सके।

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhu (…)2026-04-29
💬 NLP

Voice, Bias, and Coreference: An Interpretability Study of Gender in Speech Translation

यह अध्ययन इस बात की जांच करता है कि कैसे स्पीच ट्रांसलेशन मॉडल वक्ता-संदर्भित शब्दों को व्याकरणिक लिंग आवंटित करते हैं, यह प्रकट करते हुए कि जबकि आंतरिक भाषा मॉडल एक पुरुष प्रधान पूर्वाग्रह प्रदर्शित करते हैं, उच्च-प्रदर्शन वाले मॉडल ध्वनिक संकेतों (acoustic cues) और एक नवीन तंत्र का उपयोग करके इसे ओवरराइड कर सकते हैं जो केवल पिच के बजाय वितरित आवृत्ति स्पेक्ट्रम जानकारी के माध्यम से प्रथम-पुरुष सर्वनामों को लिंग-निर्धारित शब्दों से जोड़ता है।

Lina Conti, Dennis Fucci, Marco Gaido, Matteo Negri, Guillaume Wisniewski, Luisa Bentivogli2026-04-29
💬 NLP

Limited Linguistic Diversity in Embodied AI Datasets

यह शोध पत्र व्यापक रूप से उपयोग किए जाने वाले विजन-लैंग्वेज-एक्शन (VLA) डेटासेट्स का एक व्यवस्थित ऑडिट प्रस्तुत करता है, जो यह प्रकट करता है कि वे मुख्य रूप से सीमित भाषाई विविधता वाले दोहरावपूर्ण, टेम्पलेट जैसे निर्देशों पर निर्भर हैं, जिससे भाषा के कवरेज को व्यापक बनाने के लिए अधिक सिद्धांतवादी डेटासेट क्यूरेशन और रिपोर्टिंग की आवश्यकता पर बल मिलता है।

Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor2026-04-29