💬 NLP

Self-Preference Bias in Rubric-Based Evaluation of Large Language Models

यह शोधपत्र यह प्रदर्शित करने वाला पहला अध्ययन प्रस्तुत करता है कि रूब्रिक-आधारित एलएलएम (LLM) मूल्यांकनों में स्व-वरीयता पूर्वाग्रह (self-preference bias) बना रहता है—वस्तुनिष्ठ मानदंडों के बावजूद—जो मॉडल के स्कोर और रैंकिंग को महत्वपूर्ण रूप से प्रभावित करता है, हालांकि कई जजों के समूह (ensembling) का उपयोग इस समस्या को आंशिक रूप से कम कर सकता है।

José Pombal, Ricardo Rei, André F. T. Martins2026-04-09
💬 NLP

Continuous Interpretive Steering for Scalar Diversity

यह शोधपत्र कंटीन्यूअस इंटरप्रिटिव स्टीयरिंग (CIS) और GraSD डेटासेट को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि बड़े भाषा मॉडलों में श्रेणीबद्ध व्यावहारिक संवेदनशीलता (graded pragmatic sensitivity) उनके प्रतिनिधित्व स्थान (representation space) में एनकोडेड होती है और इसे नियंत्रित, श्रेणीबद्ध सक्रियण स्टीयरिंग (controlled, graded activation steering) के माध्यम से व्यवस्थित रूप से पुनर्प्राप्त किया जा सकता है, जो यूनिफॉर्म स्टीयरिंग के विपरीत है जो आइटम-स्तरीय भिन्नता को समाप्त कर देता है।

Ye-eun Cho2026-04-09
💬 NLP

DTCRS: Dynamic Tree Construction for Recursive Summarization

यह शोध पत्र DTCRS को प्रस्तुत करता है, जो प्रश्नों के प्रकारों का विश्लेषण करके और उप-प्रश्न एम्बेडिंग (sub-question embeddings) को क्लस्टर केंद्रों के रूप में उपयोग करके पुनरावर्ती सारांशीकरण वृक्षों (recursive summarization trees) को गतिशील रूप से निर्मित करता है ताकि अनावश्यक नोड्स को समाप्त किया जा सके, जिससे निर्माण समय कम होता है और मल्टी-स्टेप रीजनिंग (multi-step reasoning) वाले प्रश्न-उत्तर कार्यों पर प्रदर्शन में सुधार होता है।

Guanran Luo, Zhongquan Jian, Wentao Qiu, Meihong Wang, Qingqiang Wu2026-04-09
💬 NLP

Corpora deduplication or duplication in Natural Language Processing of few resourced languages ? A case of study: The Mexico's Nahuatl

यह शोध पत्र इस बात की जांच करता है कि क्या नियंत्रित डेटा दोहराव (controlled data duplication) कम-संसाधन वाली भाषाओं के लिए प्राकृतिक भाषा प्रसंस्करण (Natural Language Processing) को प्रभावी ढंग से बढ़ा सकता है, यह प्रदर्शित करते हुए कि नहुआटल (Nahuatl) कॉर्पस पर लागू एक वृद्धिशील दोहराव तकनीक वाक्य-स्तरीय अर्थ संबंधी समानता कार्यों में मध्यम सुधार प्रदान करती है।

Juan-José Guzman-Landa, Juan-Manuel Torres-Moreno, Graham Ranger, Miguel Figueroa-Saavedra, Martha-Lorena Avendaño-Garri (…)2026-04-09
💬 NLP

MARS: Enabling Autoregressive Models Multi-Token Generation

MARS एक हल्का फाइन-ट्यूनिंग तरीका है जो बिना किसी आर्किटेक्चरल बदलाव या अतिरिक्त पैरामीटर्स के ऑटोरिग्रेसिव लैंग्वेज मॉडल्स को एक फॉरवर्ड पास में कई टोकन जेनरेट करने में सक्षम बनाता है, जो बेसलाइन सटीकता बनाए रखते हुए 1.5–1.7x थ्रूपुट प्राप्त करता है और कॉन्फिडेंस थ्रेशोल्डिंग के माध्यम से रीयल-टाइम स्पीड एडजस्टमेंट की सुविधा देता है।

Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun2026-04-09
💬 NLP

Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models

यह शोध पत्र कई कार्यों और प्रॉम्प्टिंग रणनीतियों के माध्यम से सात डेंस और मिक्स्चर-ऑफ-एक्सपर्ट्स (MoE) रीजनिंग लैंग्वेज मॉडल्स का एक व्यापक अनुभवजन्य बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि केवल स्पार्स एक्टिवेशन ही इष्टतम प्रदर्शन की गारंटी नहीं देता है और सर्वोत्तम सटीकता-दक्षता ट्रेड-ऑफ आर्किटेक्चर, प्रॉम्प्टिंग प्रोटोकॉल और कार्य संरचना के विशिष्ट परस्पर संबंध पर निर्भर करते हैं।

Md Motaleb Hossen Manik, Ge Wang2026-04-09
💬 NLP

ReDAct: Uncertainty-Aware Deferral for LLM Agents

यह शोध पत्र ReDAct का प्रस्ताव करता है, जो एक अनिश्चितता-जागरूक विलंबन ढांचा (uncertainty-aware deferral framework) है जो रणनीतिक रूप से निर्णयों को एक छोटे, लागत प्रभावी LLM से एक बड़े, अधिक विश्वसनीय मॉडल तक केवल तभी भेजता है जब अनिश्चितता एक सीमा से अधिक हो जाती है, जिससे बड़े मॉडल का विशेष रूप से उपयोग करने के समान प्रदर्शन प्राप्त होता है और साथ ही अनुमान लागत (inference costs) में काफी कमी आती है।

Dzianis Piatrashyn, Nikita Kotelevskii, Kirill Grishchenkov, Nikita Glazkov, Ivan Nasonov, Ilya Makarov, Timothy Baldwin (…)2026-04-09
💬 NLP

Sell More, Play Less: Benchmarking LLM Realistic Selling Skill

यह शोध पत्र SalesLLM को प्रस्तुत करता है, जो एक द्विभाषी बेंचमार्क और स्वचालित मूल्यांकन पाइपलाइन है जिसे 1,805 क्यूरेटेड परिदृश्यों और एक प्रशिक्षित CustomerLM का उपयोग करके LLMs के वास्तविक बिक्री वार्ता कौशल का आकलन करने के लिए डिज़ाइन किया गया है, जो मॉडलों के बीच महत्वपूर्ण प्रदर्शन परिवर्तनशीलता और मानव विशेषज्ञ रेटिंग के साथ मजबूत सहसंबंध को प्रकट करता है।

Xuanbo Su, Wenhao Hu, Le Zhan, Yanqi Yang, Leo Huang2026-04-09
💬 NLP

IndoBERT-Sentiment: Context-Conditioned Sentiment Classification for Indonesian Text

यह शोध पत्र IndoBERT-Sentiment को प्रस्तुत करता है, जो IndoBERT Large पर निर्मित एक संदर्भ-सशर्त (context-conditioned) क्लासिफायर है, जो उन अस्पष्टताओं को दूर करने के लिए विषयात्मक संदर्भ (topical context) को शामिल करता है जिनके कारण संदर्भ-मुक्त दृष्टिकोण विफल हो जाते हैं और यह मौजूदा इंडोनेशियाई सेंटिमेंट मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है।

Muhammad Apriandito Arya Saputra, Andry Alamsyah, Dian Puteri Ramadhani, Thomhert Suprapto Siadari, Hanif Fakhrurroja2026-04-09
💬 NLP

SemEval-2026 Task 3: Dimensional Aspect-Based Sentiment Analysis (DimABSA)

यह शोध पत्र SemEval-2026 टास्क 3 प्रस्तुत करता है, जो एक साझा कार्य (shared task) है जो श्रेणीगत लेबल के बजाय वैलेंस-अराउज़ल (valence-arousal) आयामों के साथ सेंटीमेंट और स्टांस को मॉडल करने के लिए डायमेंशनल एस्पेक्ट-बेस्ड सेंटीमेंट एनालिसिस (DimABSA) और डायमेंशनल स्टांस एनालिसिस (DimStance) को पेश करता है, जिसमें कई उप-कार्यों के साथ दो ट्रैक, एक नया निरंतर F1 मीट्रिक और 400 से अधिक प्रतिभागियों के परिणाम शामिल हैं।

Liang-Chih Yu, Jonas Becker, Shamsuddeen Hassan Muhammad, Idris Abdulmumin, Lung-Hao Lee, Ying-Lung Lin, Jin Wang, Jan P (…)2026-04-09