🤖 AI

BEADs: Bias Evaluation Across Domains

यह शोध पत्र BEADs को प्रस्तुत करता है, जो एक व्यापक डेटासेट है जिसमें एक गोल्ड-स्टैंडर्ड एनोटेशन स्कीम दी गई है जिसे विविध NLP कार्यों में लार्ज लैंग्वेज मॉडल्स के मूल्यांकन और प्रशिक्षण के लिए डिज़ाइन किया गया है, जो अत्याधुनिक मॉडल्स में निरंतर और असंगत पूर्वाग्रहों को प्रकट करता है।

Shaina Raza, Mizanur Rahman, Michael R. Zhang2026-02-20
💬 NLP

Enhancing Multilingual LLM Pretraining with Model-Based Data Selection

यह शोध पत्र बहुभाषी डेटासेट के लिए एक पारदर्शी और कुशल मॉडल-आधारित फ़िल्टरिंग फ्रेमवर्क प्रस्तुत करता है जो, विविध और ज्ञान-समृद्ध नमूनों का चयन करने के लिए ट्रांसफॉर्मर और फास्टटेक्स्ट क्लासिफायर का लाभ उठाकर, 1 बिलियन-पैरामीटर वाले एलएलएम (LLM) को केवल 15% प्रशिक्षण टोकन के साथ बेसलाइन प्रदर्शन के बराबर सक्षम बनाता है और 20 भाषाओं में बहुभाषात्मकता के अभिशाप (curse of multilinguality) को कम करता है।

Bettina Messmer, Vinko Sabolčec, Martin Jaggi2026-02-20
💬 NLP

A Scalable Framework for Evaluating Health Language Models

यह शोध पत्र एडेप्टिव प्रिसाइज बोलियन रूब्रिक्स (Adaptive Precise Boolean rubrics) को प्रस्तुत करता है, जो एक स्केलेबल मूल्यांकन ढांचा है जो स्वास्थ्य-केंद्रित लार्ज लैंग्वेज मॉडल्स का अधिक कुशलता और विश्वसनीयता से आकलन करने के लिए लक्षित हाँ/नहीं प्रश्नों का उपयोग करता है, जिससे विशेषज्ञ और गैर-विशेषज्ञ दोनों रेटर्स के बीच सहमति में सुधार करते हुए मूल्यांकन के समय और लागत को कम किया जा सकता है।

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Spee (…)2026-02-20
💬 NLP

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

यह शोध पत्र FinTagging को प्रस्तुत करता है, जो पहला व्यापक बेंचमार्क है जो XBRL टैगिंग के जटिल कार्य को 'वित्तीय संख्यात्मक पहचान' (Financial Numeric Identification) और 'वित्तीय अवधारणा लिंकिंग' (Financial Concept Linking) में विभाजित करता है ताकि यह स्पष्ट किया जा सके कि जहाँ लार्ज लैंग्वेज मॉडल्स वित्तीय संस्थाओं को निकालने में उत्कृष्ट हैं, वहीं वे वास्तविक, संरचना-जागरूक स्थितियों के तहत उन्हें पूर्ण US GAAP टैक्सोनॉमी से मैप करने में काफी संघर्ष करते हैं।

Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhan (…)2026-02-20
💬 NLP

Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs

यह शोध पत्र एक स्वचालित प्रणाली प्रस्तुत करता है जो वेब एप्लिकेशन नेविगेशन और फॉर्म फिलिंग के लिए मजबूत एंड-टू-एंड टेस्ट केस उत्पन्न करने के लिए स्क्रीन ट्रांज़िशन और स्टेट ग्राफ के साथ बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) का लाभ उठाती है, जिससे टेस्ट कवरेज और विश्वसनीयता में वृद्धि होती है।

Nguyen-Khang Le, Quan Minh Bui, Minh Ngoc Nguyen, Hiep Nguyen, Trung Vo, Son T. Luu, Shoshin Nomura, Minh Le Nguyen2026-02-20
💬 NLP

Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स के साथ ज़ीरो-शॉट पर्सोना प्रॉम्प्टिंग, यूरोपीय संसद के सदस्यों के मतदान व्यवहार का उचित रूप से अनुकरण कर सकता है और राजनीतिक समूहों के रुख की सटीक भविष्यवाणी कर सकता है, जिससे लगभग 0.793 का वेटेड एफ1 (weighted F1) स्कोर प्राप्त होता है।

Maximilian Kreutner, Marlene Lutz, Markus Strohmaier2026-02-20
💬 NLP

SPECS\texttt{SPECS}: Faster Test-Time Scaling through Speculative Drafts

यह शोध पत्र SPECS\texttt{SPECS} को प्रस्तुत करता है, जो एक लेटेंसी-अवेयर (latency-aware) टेस्ट-टाइम स्केलिंग विधि है जो बीम सर्च-स्तर की सटीकता प्राप्त करने के लिए स्पेकुलेटिव ड्राफ्टिंग (speculative drafting) हेतु एक छोटे मॉडल और रिवॉर्ड-गाइडेड वेरिफिकेशन (reward-guided verification) का लाभ उठाता है, जिससे लेटेंसी में 19.1% तक की कमी आती है।

Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami (…)2026-02-20
💬 NLP

DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries

यह शोध पत्र DistillNote को प्रस्तुत करता है, जो एक कार्यात्मक मूल्यांकन ढांचा (functional evaluation framework) है जो डाउनस्ट्रीम प्रेडिक्शन कार्यों में नैदानिक संकेत (diagnostic signal) बनाए रखने की क्षमता को मापकर LLM-जनित सारांशों की नैदानिक उपयोगिता का आकलन करता है, और यह प्रदर्शित करता है कि अत्यधिक संकुचित (compressed) सारांश हार्ट फेल्योर डिटेक्शन के लिए मूल नैदानिक प्रदर्शन का 97% तक संरक्षित कर सकते हैं।

Heloisa Oss Boll, Antonio Oss Boll, Leticia Puttlitz Boll, Ameen Abu Hanna, Iacer Calixto2026-02-20
💬 NLP

ππ-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering

यह शोध पत्र π\pi-CoT को प्रस्तुत करता है, जो एक नवीन प्रॉम्प्टिंग रणनीति है जो जटिल मल्टी-हॉप प्रश्नों को क्रमिक सिंगल-हॉप सब-क्वेरीज़ में विघटित करने के लिए प्रोलॉग (Prolog) का लाभ उठाती है, जिससे चेन-ऑफ-थॉट (Chain-of-Thought) रीजनिंग को इनिशियलाइज़ किया जाता है ताकि मानक RAG और इन-कॉन्टेक्स्ट CoT विधियों की तुलना में मल्टी-हॉप प्रश्न-उत्तर बेंचमार्क पर प्रदर्शन में उल्लेखनीय सुधार किया जा सके।

Chao Wan, Albert Gong, Mihir Mishra, Carl-Leander Henneking, Claas Beger, Kilian Q. Weinberger2026-02-20
💬 NLP

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

यह शोधपत्र MCIF को प्रस्तुत करता है, जो वैज्ञानिक वार्ता (scientific talks) पर आधारित पहला क्रॉसलिंगुअल, मानव-एनोटेटेड बेंचमार्क है, जो निर्देश-अनुपालन क्षमताओं के मौजूदा मूल्यांकनों की कमियों को दूर करने के लिए चार भाषाओं, तीन मोडैलिटीज़ और विभिन्न इनपुट लंबाई के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का व्यवस्थित रूप से मूल्यांकन करता है।

Sara Papi, Maike Züfle, Marco Gaido, Beatrice Savoldi, Danni Liu, Ioannis Douros, Luisa Bentivogli, Jan Niehues2026-02-20