💬 NLP

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

यह शोध पत्र HoWToBench, एक बड़े पैमाने के चीनी लेखन बेंचमार्क का परिचय देता है और Tree-of-Writing (ToW) का प्रस्ताव करता है, जो एक वृक्ष-संरचित मूल्यांकन ढांचा है जो मानव निर्णयों के साथ उच्च सहसंबंध और पाठ्य व्यवधानों के विरुद्ध मजबूती प्राप्त करने के लिए उप-विशेषता एकत्रीकरण को स्पष्ट रूप से मॉडल करता है, जिससे LLMs की मानव-स्तर की लेखन क्षमताओं का आकलन करने में मौजूदा मेट्रिक्स की सीमाओं को संबोधित किया जा सके।

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie (…)2026-04-22
💬 NLP

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

यह शोध पत्र आठ अत्याधुनिक लार्ज लैंग्वेज मॉडल्स में पुनरावृत्ति वाले मौखिक टिक (verbal tics) की व्यापकता का व्यवस्थित रूप से विश्लेषण करता है, जो महत्वपूर्ण अंतर-मॉडल विविधताओं, चापलूसी (sycophancy) और कथित स्वाभाविकता के बीच एक मजबूत विपरीत सहसंबंध, और वर्तमान अलाइनमेंट प्रशिक्षण प्रतिमानों के परिणाम के रूप में इन कृत्रिम पैटर्न के संचय को प्रकट करने के लिए एक 'वर्बल टिक इंडेक्स' प्रस्तुत करता है।

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang2026-04-22
💬 NLP

How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning

यह शोध पत्र इस बात की जांच करता है कि थिंकिंग (thinking) एलएलएम में उत्तर टोकन मात्रात्मक कार्यों के दौरान रीजनिंग ट्रेसेस (reasoning traces) पर कैसे ध्यान केंद्रित करते हैं, एक "बेनाइन सेल्फ-रीडिंग" (benign self-reading) पैटर्न की पहचान करता है जो शुद्धता से जुड़ा है, और इस अंतर्दृष्टि का लाभ उठाते हुए एक प्रशिक्षण-मुक्त स्टीयरिंग पद्धति प्रस्तावित करता है जो अनुमान को व्यवस्थित, साक्ष्य-केंद्रित अटेंशन (attention) की ओर निर्देशित करके सटीकता में सुधार करती है।

Haoyang Chen, Yi Liu, Jianzhi Shao, Tao Zhang, Chengfu Huo, Wei Hu2026-04-22
💬 NLP

SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization

यह शोध पत्र SCURank प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो सारांश सामग्री इकाइयों (Summary Content Units - SCUs) का लाभ उठाकर टेक्स्ट सारांशीकरण (text summarization) में सुधार करता है ताकि विविध LLM-जनित उम्मीदवारों को प्रभावी ढंग से रैंक किया जा सके, जिससे छोटे भाषा मॉडलों (small language models) में उच्च-गुणवत्ता वाले सारांशों को संकुचित करने के मामले में पारंपरिक मेट्रिक्स और अस्थिर LLM-आधारित रैंकिंग विधियों से बेहतर प्रदर्शन किया जा सके।

Bo-Jyun Wang, Ying-Jia Lin, Hung-Yu Kao2026-04-22
💬 NLP

Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs

यह शोध पत्र इस बात की जांच करता है कि बड़े भाषा मॉडल (large language models) बहु-चरणीय गणितीय संवादों में संवादात्मक सुधार (conversational repair) को कैसे संभालते हैं, जो यह प्रकट करता है कि विभिन्न मॉडल अविश्वसनीयता के विशिष्ट और अप्रत्याशित पैटर्न प्रदर्शित करते हैं, जो कठोर प्रतिरोध से लेकर उपयोगकर्ता के सुधार के प्रति अत्यधिक सुग्राह्यता तक विस्तृत हैं।

Clara Lachenmaier, Hannah Bultmann, Sina Zarrieß2026-04-22
💬 NLP

ShadowPEFT: Shadow Network for Parameter-Efficient Fine-Tuning

ShadowPEFT एक केंद्रीकृत पैरामीटर-कुशल फाइन-ट्यूनिंग फ्रेमवर्क पेश करता है जो लेयर-स्तरीय परिशोधन करने के लिए एक डेप्थ-शेयर्ड शैडो मॉड्यूल का उपयोग करता है, जो LoRA जैसे पारंपरिक लो-रैंक एडेप्टेशन विधियों के लिए एक लचीला और प्रतिस्पर्धी विकल्प प्रदान करता है।

Xianming Li, Zongxi Li, Tsz-fung Andrew Lee, Jing Li, Haoran Xie, Qing Li2026-04-22
💬 NLP

Towards a Linguistic Evaluation of Narratives: A Quantitative Stylistic Framework

यह शोध पत्र एक मात्रात्मक शैलीगत ढांचे का प्रस्ताव करता है जो नैरेटिव गुणवत्ता का स्वचालित रूप से मूल्यांकन करने के लिए 33 भाषाई विशेषताओं का उपयोग करता है, जो मानव एनोटेशन के विरुद्ध मान्य होने पर पारंपरिक मेट्रिक्स से बेहतर प्रदर्शन करते हुए पेशेवर और स्व-प्रकाशित ग्रंथों के बीच सफलतापूर्वक अंतर करता है।

Alessandro Maisto2026-04-22
💬 NLP

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

यह शोधपत्र CulturALL को प्रस्तुत करता है, जो 14 भाषाओं और 51 क्षेत्रों में 2,610 ग्राउंडेड कार्यों से बना एक व्यापक बेंचमार्क है, जिसे वास्तविक, संदर्भ-युक्त परिदृश्यों में लार्ज लैंग्वेज मॉडल्स की बहुभाषी और बहुसांस्कृतिक क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है जहाँ वर्तमान मॉडल्स में सुधार की काफी गुंजाइश है।

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng (…)2026-04-22
💬 NLP

Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications

यह शोध पत्र VB-Score प्रस्तुत करता है, जो एक घटक-वार (component-wise) मूल्यांकन ढांचा है जो वर्तमान मेडिकल LLMs में गंभीर प्रदर्शन विफलताओं और महत्वपूर्ण स्वास्थ्य समानता विषमताओं को उजागर करता है, यह प्रदर्शित करते हुए कि चिकित्सा सटीकता और सुरक्षा सुनिश्चित करने के लिए केवल अर्थ संबंधी समानता (semantic similarity) ही पर्याप्त नहीं है।

Abu Noman Md Sakib, Md. Main Oddin Chisty, Zijie Zhang2026-04-22
💬 NLP

Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs

यह शोधपत्र LocQA को प्रस्तुत करता है, जो एक बहुभाषी बेंचमार्क है जो यह प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) अमेरिकी-केंद्रित उत्तरों के प्रति अंतर्निहित वैश्विक पूर्वाग्रह और उच्च-जनसंख्या वाले स्थानों के पक्ष में अंतर्भाषी पूर्वाग्रह प्रदर्शित करते हैं, और ये संरचनात्मक पूर्वाग्रह इंस्ट्रक्शन ट्यूनिंग द्वारा और अधिक बढ़ जाते हैं।

Guy Mor-Lan, Omer Goldman, Matan Eyal, Adi Mayrav Gilady, Sivan Eiger, Idan Szpektor, Avinatan Hassidim, Yossi Matias, R (…)2026-04-22