📊 statistics

Measuring all the noises of LLM Evals

यह शोध पत्र LLM मूल्यांकनों में प्रेडिक्शन (अनुमान) और डेटा शोर (नॉइज़) को परिभाषित और परिमाणित करता है, एक 'ऑल-पेयर्स पेयर्ड' पद्धति का प्रस्ताव करता है जो पूर्वानुमेय शोर पैटर्न को प्रकट करती है और यह प्रदर्शित करती है कि प्रेडिक्शन नॉइज़ को कम करने के लिए औसत निकालना मॉडल तुलनाओं के लिए सांख्यिकीय शक्ति को महत्वपूर्ण रूप से बढ़ाता है।

Sida Wang2026-03-31
💬 NLP

Beg to Differ: Understanding Reasoning-Answer Misalignment Across Languages

यह शोधपत्र एक मानव-सत्यापित ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि लैटिन लिपियों की तुलना में गैर-लैटिन लिपियों में बड़े भाषा मॉडल (LLMs) काफी अधिक तर्क-निष्कर्ष विसंगति (reasoning-conclusion misalignment) प्रदर्शित करते हैं, जो उच्च कार्य सटीकता के बावजूद होता है, जिससे वर्तमान बहुभाषी मूल्यांकन प्रथाओं में महत्वपूर्ण कमियां उजागर होती हैं।

Anaelia Ovalle, Candace Ross, Sebastian Ruder, Adina Williams, Karen Ullrich, Mark Ibrahim, Levent Sagun2026-03-31
💬 NLP

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

यह शोध पत्र AppellateGen प्रस्तुत करता है, जो द्वितीय-संस्थागत कानूनी निर्णय सृजन के लिए 7,351 केस युग्मों वाला एक बेंचमार्क है, और अपील समीक्षा की द्वंद्वात्मक जटिलताओं को संबोधित करने के लिए एक न्यायिक SOP-आधारित मल्टी-एजेंट सिस्टम (SLMAS) का प्रस्ताव करता है, जिससे यह पता चलता है कि हालांकि यह प्रणाली तार्किक निरंतरता में सुधार करती है, फिर भी वर्तमान LLMs अपील संबंधी तर्क देने की अंतर्निहित चुनौतियों से जूझते हैं।

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang (…)2026-03-31
💬 NLP

JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models

यह शोध पत्र JMedEthicBench को प्रस्तुत करता है, जो जापानी चिकित्सा LLM सुरक्षा के मूल्यांकन के लिए पहला मल्टी-टर्न संवादात्मक बेंचमार्क है, जो यह प्रकट करता है कि विशेष मॉडल वाणिज्यिक मॉडलों की तुलना में अधिक असुरक्षित हैं और सुरक्षा बातचीत के टर्न के साथ महत्वपूर्ण रूप से घट जाती है, जो भाषा-विशिष्ट कारकों के बजाय अंतर्निहित संरेखण सीमाओं के कारण है।

Junyu Liu, Zirui Li, Qian Niu, Zequn Zhang, Yue Xun, Wenlong Hou, Shujun Wang, Yusuke Iwasawa, Yutaka Matsuo, Kan Hatake (…)2026-03-31
💬 NLP

Compounding Disadvantage: Auditing Intersectional Bias in LLM-Generated Explanations Across Indian and American STEM Education

यह अध्ययन प्रकट करता है कि STEM शिक्षा में उपयोग किए जाने वाले लार्ज लैंग्वेज मॉडल्स, भारतीय और अमेरिकी दोनों संदर्भों में हाशिए पर मौजूद छात्रों के लिए व्यवस्थित रूप से निम्न-गुणवत्ता वाली व्याख्याएँ उत्पन्न करते हैं, जिसमें आय सबसे व्यापक पूर्वाग्रह है और प्रतिच्छेदी (intersectional) नुकसान मिलकर 2.55 ग्रेड स्तरों के बराबर अंतराल पैदा करते हैं।

Amogh Gupta (Neil), Niharika Patil (Neil), Sourojit Ghosh (Neil), SnehalKumar (Neil), S Gaikwad2026-03-31
💬 NLP

Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation

यह अध्ययन संदर्भ-सारांशित मल्टी-टर्न ग्राहक-सेवा प्रश्नोत्तर में इंस्ट्रक्शन-ट्यून्ड स्मॉल लैंग्वेज मॉडल्स (SLMs) की प्रभावशीलता का मूल्यांकन करता है, जो यह प्रकट करता है कि जहाँ कुछ SLMs लगभग LLM के समान प्रदर्शन प्राप्त करते हैं, वहीं अन्य संवाद निरंतरता बनाए रखने में संघर्ष करते हैं, जो संसाधन-सीमित परिनियोजन के लिए उनकी क्षमता और वर्तमान सीमाओं दोनों को उजागर करता है।

Lakshan Cooray, Deshan Sumanathilaka, Pattigadapa Venkatesh Raju2026-03-31
💬 NLP

Tokenization and Morphological Fidelity in Uralic NLP: A Cross-Lingual Evaluation

यह अध्ययन यह प्रदर्शित करता है कि ओवरलैप बीपीई (OBPE), बेहतर रूपात्मक संरेखण (morphological alignment) और पीओएस (POS) टैगिंग सटीकता प्राप्त करके यूरालिक भाषाओं में बीपीई (BPE) और यूनिग्राम (Unigram) जैसी पारंपरिक सबवर्ड टोकनाइजेशन विधियों से बेहतर प्रदर्शन करता है, जिससे यह सिद्ध होता है कि योगात्मक (agglutinative), कम-संसाधन वाले परिवेश में प्रभावी क्रॉस-लिंगुअल ट्रांसफर के लिए आकृति विज्ञान-संवेदी (morphology-sensitive) टोकनाइजेशन आवश्यक है।

Nuo Xu, Ahrii Kim2026-03-31
💬 NLP

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

यह शोधपत्र GreekMMLU को प्रस्तुत करता है, जो 45 विषयों में 21,000 से अधिक बहुविकल्पीय प्रश्नों वाला एक व्यापक, मूल-स्रोत (native-sourced) बेंचमार्क है, जिसे ग्रीक भाषा के मॉडलों के लिए प्रामाणिक मूल्यांकन उपकरणों की कमी को दूर करने के लिए डिज़ाइन किया गया है और जो फ्रंटियर, ओपन-वेट और ग्रीक-अनुकूलित मॉडलों के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Gio (…)2026-03-31
💬 NLP

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM एक कुशल वीडियो लैंग्वेज मॉडल है जो विविध वीडियो समझ बेंचमार्क में प्रदर्शन को बनाए रखते हुए या उससे बेहतर प्रदर्शन करते हुए, कंप्यूटेशनल ओवरहेड और विलंबता (लेटेंसी) को नाटकीय रूप से कम करने के लिए वीडियो कोडेक प्रिमिटिव्स से मोशन वेक्टर्स और रेसिडुअल्स का लाभ उठाता है।

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu2026-03-31
💬 NLP

Using LLMs for Knowledge Component-level Correctness Labeling in Open-ended Coding Problems

यह शोध पत्र ओपन-एंडेड छात्र कोड से सूक्ष्म-स्तरीय ज्ञान घटक-स्तर (knowledge component-level) की शुद्धता लेबल उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाने वाला एक स्वचालित ढांचा प्रस्तावित करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण पारंपरिक समस्या-स्तर की लेबलिंग विधियों की तुलना में अधिक संज्ञानात्मक रूप से सुसंगत लर्निंग कर्व्स और बेहतर भविष्य कहनेवाला प्रदर्शन प्रदान करता है।

Zhangqi Duan, Arnav Kankaria, Dhruv Kartik, Andrew Lan2026-03-31