💬 NLP

Maistros: A Greek Large Language Model Adapted Through Knowledge Distillation From Large Reasoning Models

यह शोध पत्र Maistros 8B को प्रस्तुत करता है, जो लार्ज रीजनिंग मॉडल्स से नॉलेज डिस्टिलेशन के माध्यम से विकसित एक अत्याधुनिक ओपन-वेट्स ग्रीक लार्ज लैंग्वेज मॉडल है और जिसे नए बनाए गए CulturaQA डेटासेट पर फाइन-ट्यून किया गया है, साथ ही इसमें एक व्यापक मूल्यांकन ढांचा भी शामिल है जिसे कम-संसाधन वाली भाषाओं में प्रदर्शन के अंतराल को दूर करने के लिए डिज़ाइन किया गया है।

Nikolaos Giarelis, Charalampos Mastrokostas, Nikos Karacapilidis2026-05-05
💬 NLP

StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models

यह शोध पत्र StressEval को पेश करता है, जो एक विफलता-संचालित डेटा संश्लेषण ढांचा (failure-driven data synthesis framework) है जो देखे गए मॉडल त्रुटियों को नियंत्रणीय, गतिशील परीक्षण उदाहरणों में परिवर्तित करता है ताकि Dynamic OneEval बेंचमार्क बनाया जा सके, जो स्थिर मूल्यांकनों की तुलना में ज्ञान-गहन तर्क (knowledge-intensive reasoning) में प्रदर्शन के अंतराल को अधिक प्रभावी ढंग से प्रकट करता है।

Yongrui Chen, Yangyang Ma, Xiaoying Huang, Shenyu Zhang, Huajun Chen, Haofen Wang, Guilin Qi2026-05-05
💬 NLP

Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization

यह शोध पत्र जज-R1 (Judge-R1) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो सटीक साक्ष्य प्राप्ति के लिए एक एजेंटिक कानूनी सूचना संग्रह प्रणाली को रूब्रिक-निर्देशित सुदृढीकरण शिक्षण (reinforcement learning) अनुकूलन चरण के साथ एकीकृत करके स्वचालित न्यायिक दस्तावेज़ निर्माण को बढ़ाता है, ताकि तार्किक कठोरता और न्यायिक मानकों के प्रति अनुपालन सुनिश्चित किया जा सके।

Weihang Su, Xuanyi Chen, Yueyue Wu, Qingyao Ai, Yiqun Liu2026-05-05
💬 NLP

Counting as a minimal probe of language model reliability

यह शोध पत्र प्रदर्शित करता है कि मानक बेंचमार्क पर मजबूत प्रदर्शन के बावजूद, बड़े भाषा मॉडल विश्वसनीय नियम-पालन के लिए सामान्य तार्किक सक्षमता की कमी रखते हैं, जैसा कि उंगली-गिनती की नकल करने वाले आंतरिक अवस्थाओं के एक सीमित सेट से आगे गिनने में उनकी विफलता से स्पष्ट होता है, न कि वास्तविक प्रक्रियात्मक निष्पादन से।

Tianxiang Dai, Jonathan Fan2026-05-05
💬 NLP

What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models

यह शोध पत्र तर्क देता है कि भाषा मॉडल की विश्वसनीयता का आकलन करने के लिए एकल-प्रॉम्ट सटीकता बेंचमार्क अपर्याप्त हैं, जो एक बहु-चरणीय ऑडिट के माध्यम से यह प्रदर्शित करता है कि मूल्यांकन डिजाइन के विकल्प, नाजुक आत्मविश्वास संकेत और असंगत प्रॉम्ट सुदृढ़ता निष्कर्षों को नाटकीय रूप से बदल सकते हैं और मॉडलों एवं मूल्यांकनकर्ताओं दोनों में महत्वपूर्ण विफलताओं को छिपा सकते हैं।

Ranit Karmakar, Jayita Chatterjee2026-05-05
💬 NLP

Methods, Data, and Conceptual Change: Reflections from Two Quantitative Diachronic Case Studies

यह शोध पत्र अर्ली मॉडर्न इंग्लिश डिस्कोर्स के क्वाड-आधारित कॉन्सेप्ट मॉडलिंग की वैज्ञानिक लेखन के सिनफ्लो (SynFlow) विश्लेषण के साथ तुलना करके ऐतिहासिक भाषाविज्ञान में मात्रात्मक विधियों और डेटासेट गुणों के बीच की अंतःक्रिया पर विचार करता है, और अंततः यह तर्क देता है कि पद्धतिगत विकल्प और डेटा संरचना अर्थ संबंधी परिवर्तन का पता लगाने और उसकी व्याख्या करने के स्वरूप को महत्वपूर्ण रूप से आकार देते हैं।

Catherine Wong, Bach Phan-Tat, Susan Fitzmaurice2026-05-05
💬 NLP

Pair2Score: Pairwise-to-Absolute Transfer for LLM-Based Essay Scoring

यह शोध पत्र Pair2Score को प्रस्तुत करता है, जो एक पैरामीटर-कुशल दो-चरणीय ढांचा है जो LLaMA अनुकूलन के माध्यम से युग्मवार तुलनाओं (pairwise comparisons) को पूर्ण निबंध स्कोरिंग में स्थानांतरित करता है, और यह प्रदर्शित करता है कि विशिष्ट स्थानांतरण कॉन्फ़िगरेशन और सीमित युग्मवार प्रशिक्षण चरण, केवल पूर्ण-आधारित बेसलाइन की तुलना में स्कोरिंग सटीकता में महत्वपूर्ण सुधार करते हैं।

İbrahim Rıza Hallaç, Hasan Oğul2026-05-05
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

यह शोध पत्र एक खोज-संचालित सुदृढीकरण अधिगम (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो स्वचालित पीढ़ी, सत्यापन और GRPO-आधारित स्क्रीनिंग के माध्यम से रिवॉर्ड फंक्शन विनिर्देशों को पुनरावृत्ति रूप से अनुकूलित करता है, यह प्रदर्शित करते हुए कि एक रैंक-फीडबैक लूप स्थिर या यादृच्छिक रिवॉर्ड एंसेम्बल्स की तुलना में GSM8K पर गणितीय तर्क प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad2026-05-05
💬 NLP

EditPropBench: Measuring Factual Edit Propagation in Scientific Manuscripts

यह शोधपत्र EditPropBench प्रस्तुत करता है, जो यह दर्शाता है कि वर्तमान LLM संपादक वैज्ञानिक पांडुलिपियों में निहित, गैर-स्थानीय दावों के माध्यम से तथ्यात्मक संपादनों को विश्वसनीय रूप से प्रसारित करने में संघर्ष करते हैं, जो तथ्यात्मक निरंतरता सुनिश्चित करने के लिए कैस्केड-जागरूक सत्यापन उपकरणों की आवश्यकता पर प्रकाश डालता है।

Garvin Kruthof2026-05-05
💬 NLP

CLaC at SemEval-2026 Task 6: Response Clarity Detection in Political Discourse

CLaC टीम का SemEval-2026 टास्क 6 के लिए सिस्टम यह प्रदर्शित करता है कि प्रॉम्प्ट-आधारित लार्ज लैंग्वेज मॉडल्स, राजनीतिक विमर्श में प्रतिक्रिया की स्पष्टता और टालमटोल का पता लगाने में फाइन-ट्यून्ड एनकोडर्स से बेहतर प्रदर्शन करते हैं, जो एक एंसेम्बल रणनीति और समृद्ध इनपुट संदर्भों के माध्यम से शीर्ष स्तर के परिणाम प्राप्त करते हैं और स्पष्ट तथा संदिग्ध उत्तरों के बीच अंतर करने की निरंतर चुनौती को रेखांकित करते हैं।

Nawar Turk, Lucas Miquet-Westphal, Leila Kosseim2026-05-05