💬 NLP

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

यह शोध पत्र HarmMetric Eval प्रस्तुत करता है, जो एक व्यवस्थित बेंचमार्क है जो यह प्रकट करता है कि पारंपरिक संदर्भ-आधारित मेट्रिक्स सूक्ष्म-स्तरीय हानिकारक मूल्यांकन में LLM-आधारित जजों से बेहतर प्रदर्शन कर सकते हैं, जिससे इन मेट्रिक्स को एकीकृत करने वाले एक उन्नत जज का डिज़ाइन तैयार हुआ है जो अत्याधुनिक प्रदर्शन प्राप्त करता है।

Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren2026-03-19
💬 NLP

Bringing Emerging Architectures to Sequence Labeling in NLP

यह शोध पत्र अनुक्रम लेबलिंग (sequence labeling) कार्यों के लिए xLSTMs और स्ट्रक्चर्ड स्टेट-स्पेस मॉडल्स जैसे उभरते आर्किटेक्चर की प्रयोज्यता की जांच करता है, जो यह प्रकट करता है कि सरल परिवेशों में उनका मजबूत प्रदर्शन अक्सर विभिन्न भाषाओं, डेटासेट और संरचनात्मक रूप से जटिल टैगिंग समस्याओं में सामान्यीकरण करने में विफल रहता है।

Ana Ezquerro, Carlos Gómez-Rodríguez, David Vilares2026-03-19
📊 statistics

Silenced Biases: The Dark Side LLMs Learned to Refuse

यह शोध पत्र साइलेंस्ड बायस बेंचमार्क (SBB) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मॉडल के इनकार (refusals) को कम करने और "साइलेंस्ड बायस" (silenced biases) को उजागर करने के लिए एक्टिवेशन स्टीयरिंग का उपयोग करता है—जो कि सुरक्षा-संरेखित (safety-aligned) LLMs के भीतर छिपी अनैतिक प्राथमिकताएं हैं जिन्हें मानक मूल्यांकन विधियां गलती से निष्पक्षता मान लेती हैं।

Rom Himelstein, Amit LeVi, Brit Youngmann, Yaniv Nemcovsky, Avi Mendelson2026-03-19
💬 NLP

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

यह शोधपत्र SO-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें चार दृश्य डोमेन के माध्यम से 6,500 से अधिक विविध JSON स्कीमा और 1,800 क्यूरेटेड इमेज-स्कीमा जोड़े शामिल हैं, ताकि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की स्कीमा-अनुपालन संरचित आउटपुट क्षमताओं का व्यवस्थित रूप से मूल्यांकन और सुधार किया जा सके।

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang (…)2026-03-19
💬 NLP

The Moralization Corpus: Frame-Based Annotation and Analysis of Moralizing Speech Acts across Diverse Text Genres

यह शोधपत्र 'मोरलज़ेशन कॉर्पस' (Moralization Corpus) प्रस्तुत करता है, जो जर्मन ग्रंथों का एक नवीन बहु-शैली डेटासेट है जिसे नैतिक भाषण कृतियों (moralizing speech acts) का विश्लेषण करने के लिए एक फ्रेम-आधारित योजना के साथ एनोटेट किया गया है, जबकि यह इन जटिल, संदर्भ-संवेदनशील तर्कों का पता लगाने और उन्हें निकालने में बड़े भाषा मॉडलों (large language models) की क्षमताओं और सीमाओं का मूल्यांकन भी करता है।

Maria Becker, Mirko Sommer, Lars Tapken, Yi Wan Teh, Bruno Brocai2026-03-19
💬 NLP

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering for Enhanced Alignment and Reasoning

यह शोध पत्र EpiQAL को प्रस्तुत करता है, जो तीन प्रगतिशील रूप से चुनौतीपूर्ण उपसमूहों के माध्यम से साक्ष्य-आधारित महामारी विज्ञान संबंधी तर्क (epidemiological reasoning) पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला नैदानिक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल बहु-चरणीय अनुमान (multi-step inference) में संघर्ष करते हैं और प्रदर्शन केवल मॉडल के पैमाने द्वारा निर्धारित नहीं होता है।

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, W (…)2026-03-19
💬 NLP

APEX-SWE

यह शोध पत्र APEX-SWE को प्रस्तुत करता है, जो एक नया बेंचमार्क है और सिस्टम इंटीग्रेशन तथा प्रोडक्शन डिबगिंग जैसे आर्थिक रूप से मूल्यवान, वास्तविक दुनिया के सॉफ्टवेयर इंजीनियरिंग कार्यों पर फ्रंटियर AI मॉडल्स का मूल्यांकन करता है, जिससे यह पता चलता है कि शीर्ष प्रदर्शन करने वाले मॉडल्स मुख्य रूप से एपिस्टेमिक अनुशासन (epistemic discipline) और व्यवस्थित सत्यापन (systematic verification) के माध्यम से सफलता प्राप्त करते हैं।

Abhi Kottamasu, Chirag Mahapatra, Sam Lee, Ben Pan, Aakash Barthwal, Akul Datta, Ajay Arun, Silas Alberti, Adarsh Hirema (…)2026-03-19
💬 NLP

Speculative Decoding: Performance or Illusion?

यह शोध पत्र एक प्रोडक्शन-ग्रेड इन्फरेंस इंजन (vLLM) पर स्पेक्युलेटिव डिकोडिंग का पहला व्यवस्थित अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि वेरिफिकेशन ओवरहेड प्रदर्शन पर हावी है और देखे गए स्पीडअप तथा सैद्धांतिक सीमाओं के बीच महत्वपूर्ण अंतर मौजूद हैं, जिससे अनुकूलन के नए अवसर उभरते हैं।

Xiaoxuan Liu, Jiaxiang Yu, Jongseok Park, Ion Stoica, Alvin Cheung2026-03-19
💬 NLP

Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning

यह शोधपत्र कम-संसाधन वाली मशीन अनुवाद (low-resource machine translation) में सुधार के लिए NLLB मॉडलों के साथ राउंड-ट्रिप बूटस्ट्रैपिंग का उपयोग करते हुए एक स्व-पर्यवेक्षित सुदृढीकरण शिक्षण (self-supervised reinforcement learning) दृष्टिकोण प्रस्तावित करता है, जो कई लक्षित भाषाओं में प्रवाह (fluency) और अर्थपूर्ण निष्ठा (semantic fidelity) में निरंतर प्रदर्शन लाभ प्रदर्शित करता है।

Ahmed Attia, Alham Fikri Aji2026-03-19
💬 NLP

GTS: Inference-Time Scaling of Latent Reasoning with a Learnable Gaussian Thought Sampler

यह शोध पत्र गॉसियन थॉट सैंपलर (GTS) का प्रस्ताव करता है, जो एक हल्का मॉड्यूल है जो लेटेंट रीजनिंग मॉडल्स में अधिक विश्वसनीय और अनुकूलनीय इन्फरेंस-टाइम स्केलिंग प्राप्त करने के लिए ह्यूरिस्टिक परटर्बेशन्स को एक सीखने योग्य, संदर्भ-निर्भर कंडीशनल सैंपलिंग डिस्ट्रीब्यूशन से बदल देता है।

Minghan Wang, Ye Bai, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari2026-03-19