💬 NLP

FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs

यह शोध पत्र FinAuditing प्रस्तुत करता है, जो वास्तविक XBRL फाइलिंग से प्राप्त एक बड़े पैमाने का, वर्गीकरण-संरेखित (taxonomy-aligned) बेंचमार्क है, जो तीन वित्तीय ऑडिटिंग कार्यों में 13 अत्याधुनिक LLMs की क्षमताओं का मूल्यांकन करता है, और संरचना-जागरूक अर्थ संबंधी मिलान (structure-aware semantic matching), संबंध निष्कर्षण (relationship extraction) और गणितीय तर्क (mathematical reasoning) करने की उनकी क्षमता में महत्वपूर्ण अंतराल को प्रकट करता है।

Yan Wang, Keyi Wang, Shanshan Yang, Jaisal Patel, Jeff Zhao, Fengran Mo, Xueqing Peng, Lingfei Qian, Jimin Huang, Guojun (…)2026-02-20
💬 NLP

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

यह शोध पत्र मल्टीमॉडल प्रॉम्प्ट ऑप्टिमाइज़ेशन (MPO) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो प्रॉम्प्ट ऑप्टिमाइज़ेशन को टेक्स्ट से आगे बढ़ाते हुए संरेखण-संरक्षण अपडेट (alignment-preserving updates) और बायेसियन चयन (Bayesian selection) का उपयोग करके टेक्स्ट और गैर-टेक्स्ट इनपुट (जैसे कि चित्र, वीडियो और अणु) को संयुक्त रूप से अनुकूलित करता है, जिससे यह मौजूदा टेक्स्ट-ओनली विधियों से बेहतर प्रदर्शन करता है और मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की पूर्ण क्षमता को उजागर करता है।

Yumin Choi, Dongki Kim, Jinheon Baek, Sung Ju Hwang2026-02-20
💬 NLP

Toward LLM-Supported Automated Assessment of Critical Thinking Subskills

यह शोध पत्र छात्रों के तर्कपूर्ण निबंधों में आलोचनात्मक सोच के उप-कौशलों का स्वचालित रूप से मूल्यांकन करने के लिए बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के उपयोग की व्यवहार्यता की जांच करता है, जिसमें यह पाया गया है कि Llama 3.1 8B का सुपरवाइज्ड फाइन-ट्यूनिंग सबसे अच्छे परिणाम देता है, विशेष रूप से स्पष्ट दक्षता अंतर और संतुलित डेटा वाले उप-कौशलों के लिए, जबकि सूक्ष्म बारीकियों का पता लगाने और असंतुलित लेबल को संभालने में चुनौतियों को भी रेखांकित करता है।

Marisa C. Peczuh, Nischal Ashok Kumar, Ryan Baker, Blair Lehman, Danielle Eisenberg, Caitlin Mills, Payu Wittawatolarn (…)2026-02-20
💬 NLP

Assessing Web Search Credibility and Response Groundedness in Chat Assistants

यह शोध पत्र प्रमुख चैट सहायकों की वेब खोज विश्वसनीयता और प्रतिक्रिया की आधारबद्धता (groundedness) का मूल्यांकन करने के लिए एक नवीन कार्यप्रणाली प्रस्तुत करता है, जो महत्वपूर्ण प्रदर्शन अंतरों को प्रकट करता है जहाँ Perplexity उच्चतम स्रोत विश्वसनीयता प्रदर्शित करता है जबकि GPT-4o संवेदनशील विषयों पर गैर-विश्वसनीय स्रोतों को उद्धृत करने की अधिक प्रवृत्ति दिखाता है।

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko2026-02-20
💬 NLP

QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models

यह शोध पत्र QSTN को प्रस्तुत करता है, जो एक नो-कोड इंटरफेस के साथ एक ओपन-सोर्स पायथन फ्रेमवर्क है जिसे बड़े पैमाने पर LLM-आधारित प्रश्नावली प्रतिक्रियाओं को व्यवस्थित रूप से उत्पन्न करने और मजबूती से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि प्रॉम्प्ट संरचना और पीढ़ी विधियाँ मानव उत्तरों के साथ संरेखण को महत्वपूर्ण रूप से प्रभावित करती हैं जबकि कंप्यूट लागत को कम करती हैं।

Maximilian Kreutner, Jens Rupprecht, Georg Ahnert, Ahmed Salem, Markus Strohmaier2026-02-20
💬 NLP

Explanation Bias is a Product: Revealing the Hidden Lexical and Position Preferences in Post-Hoc Feature Attribution

यह शोधपत्र पोस्ट-हॉक फीचर एट्रिब्यूशन विधियों में छिपे हुए लेक्सिकल (lexical) और पोजीशनल (positional) पूर्वाग्रहों को व्यवस्थित रूप से मूल्यांकन करने और प्रकट करने के लिए एक मॉडल- और मेथड-अग्नोस्टिक (model- and method-agnostic) ढांचे को प्रस्तुत करता है, जो विभिन्न मॉडलों में इन पूर्वाग्रहों के बीच एक ट्रेड-ऑफ प्रदर्शित करता है और यह पहचानता है कि विसंगत स्पष्टीकरणों (anomalous explanations) के पक्षपाती होने की संभावना अधिक होती है।

Jonathan Kamp, Roos Bakker, Dominique Blok2026-02-20
💬 NLP

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

यह शोधपत्र Proof-RM को प्रस्तुत करता है, जो एक स्केलेबल रिवॉर्ड मॉडल है जिसे गणितीय प्रमाणों को विश्वसनीय रूप से मूल्यांकित करने और उन स्थानों पर LLM तर्क क्षमताओं को बढ़ाने के लिए प्रश्न-प्रमाण-जांच (question-proof-check) ट्रिपलेट्स के एक विविध, LLM-जनरेटेड डेटासेट पर प्रशिक्षित किया गया है जहाँ पारंपरिक उत्तर-मिलान सत्यापन विफल हो जाता है।

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang2026-02-20
💬 NLP

RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution

RoPE-LIME एक कुशल, ओपन-सोर्स फ्रेमवर्क है जो क्लोज्ड-सोर्स LLM आउटपुट्स के लिए एट्रिब्यूशन करने हेतु RoPE-स्पेस लोकैलिटी कर्नेल्स और स्पार्स-K सैंपलिंग को जोड़ता है, जिससे मौजूदा तरीकों की तुलना में API लागतों को काफी कम करते हुए स्थिर, सूचनात्मक टोकन-स्तरीय स्पष्टीकरण उत्पन्न किए जा सकते हैं।

Isaac Picov, Ritesh Goru2026-02-20
💬 NLP

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

यह शोध पत्र प्रोपेला-1 (propella-1) का परिचय देता है, जो छोटे बहुभाषी एलएलएम (LLMs) का एक परिवार है जो एलएलएम प्रीट्रेनिंग के लिए लचीले, व्याख्या योग्य और बड़े पैमाने पर डेटा क्यूरेशन को सक्षम करने हेतु 18 आयामों में टेक्स्ट दस्तावेजों के लिए संरचित, बहु-गुण (multi-property) एनोटेशन उत्पन्न करता है, जो पारंपरिक एकल-स्कोर दृष्टिकोणों से बेहतर है।

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries2026-02-20
💬 NLP

Building Safe and Deployable Clinical Natural Language Processing under Temporal Leakage Constraints

यह शोध पत्र एक हल्के ऑडिटिंग पाइपलाइन का प्रस्ताव करता है जो नैदानिक एनएलपी (NLP) विकास में व्याख्यात्मकता (interpretability) को एकीकृत करता है ताकि टेम्पोरल (temporal) और लेक्सिकल (lexical) लीकेज का पता लगाया जा सके और उन्हें दबाया जा सके, यह प्रदर्शित करते हुए कि ऐसे उपाय डिस्चार्ज प्लानिंग के लिए सुरक्षित और बेहतर-कैलिब्रेटेड मॉडल प्रदान करते हैं जो मुद्रास्फीति वाले प्रदर्शन मेट्रिक्स के बजाय टेम्पोरल वैधता को प्राथमिकता देते हैं।

Ha Na Cho, Sairam Sutari, Alexander Lopez, Hansen Bow, Kai Zheng2026-02-20