💬 NLP

KCLarity at SemEval-2026 Task 6: Encoder and Zero-Shot Approaches to Political Evasion Detection

KCLarity टीम के SemEval-2026 पेपर में राजनीतिक टालमटोल (political evasion) का पता लगाने के लिए एनकोडर-आधारित और ज़ीरो-शॉट डिकोडर-ओनली मॉडलों के उनके तुलनात्मक मूल्यांकन का विवरण दिया गया है, जिसमें यह पाया गया कि जहाँ RoBERTa-large ने सार्वजनिक परीक्षण सेट पर उत्कृष्ट प्रदर्शन किया, वहीं GPT-5.2 ने छिपे हुए मूल्यांकन सेट (hidden evaluation set) पर बेहतर सामान्यीकरण (generalization) प्रदर्शित किया।

Archie Sage, Salvatore Greco2026-03-09
💻 computer science

EHRSQL: A Practical Text-to-SQL Benchmark for Electronic Health Records

यह शोध पत्र EHRSQL को प्रस्तुत करता है, जो वास्तविक अस्पताल कर्मचारियों के प्रश्नों से निर्मित इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड के लिए एक व्यावहारिक टेक्स्ट-टू-एसक्यूएल (text-to-SQL) बेंचमार्क है, जो अनुसंधान और स्वास्थ्य सेवा परिनियोजन के बीच के अंतर को पाटने के लिए मॉडलों को विविध नैदानिक आवश्यकताओं, जटिल समय अभिव्यक्तियों और अनुत्तरित प्रश्नों को संभालने की चुनौती देता है।

Gyubok Lee, Hyeonji Hwang, Seongsu Bae, Yeonsu Kwon, Woncheol Shin, Seongjun Yang, Minjoon Seo, Jong-Yeup Kim, Edward Ch (…)2026-03-06
💻 computer science

INMS: Memory Sharing for Large Language Model based Agents

यह शोध पत्र INMS का प्रस्ताव करता है, जो एक एसिंक्रोनस मल्टी-एजेंट फ्रेमवर्क है जो रीयल-टाइम फ़िल्टरिंग और रिट्रीवल के माध्यम से एक साझा संवादात्मक मेमोरी पूल स्थापित करता है, जिससे डायनेमिक नॉलेज एक्सचेंज और सामूहिक स्व-संवर्धन सक्षम होता है ताकि ओपन-एंडेड परिदृश्यों में LLM-आधारित एजेंट के प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Hang Gao, Yongfeng Zhang2026-03-06
💻 computer science

Vector Retrieval with Similarity and Diversity: How Hard Is It?

यह शोध पत्र VRSD समस्या को औपचारिक रूप से परिभाषित करके और एक नवीन पैरामीटर-मुक्त ह्यूरिस्टिक प्रस्तावित करके, जो MMR और k-DPP जैसे मौजूदा तरीकों से बेहतर प्रदर्शन करता है, डेंस वेक्टर रिट्रीवल में समानता और विविधता के बीच संतुलन बनाने की सैद्धांतिक और व्यावहारिक चुनौतियों को संबोधित करता है।

Hang Gao, Dong Deng, Yongfeng Zhang2026-03-06
💻 computer science

Computational Fact-Checking of Online Discourse: Scoring scientific accuracy in climate change related news articles

यह शोध पत्र जलवायु परिवर्तन संबंधी समाचारों की वैज्ञानिक सटीकता को मापने के लिए एलएलएम (LLM) और नॉलेज ग्राफ का उपयोग करने वाले एक अर्ध-स्वचालित वर्कफ़्लो को प्रस्तुत करता है, जिसमें यह पाया गया है कि हालांकि विशेषज्ञ-सत्यापित उपकरण लाभकारी सत्यता संकेत प्रदान करते हैं, नॉलेज ग्राफ की पूर्णता और प्रसंस्करण पैमाने में वर्तमान सीमाएं व्यापक अनुप्रयोग में बाधा डालती हैं।

Tim Wittenborg, Constantin Sebastian Tremel, Markus Stocker, Sören Auer2026-03-06
💻 computer science

Ice Cream Doesn't Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inference

यह शोध पत्र CausalPitfalls को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसे प्रत्यक्ष और कोड-सहायता प्राप्त प्रॉम्प्टिंग प्रोटोकॉल के माध्यम से सिम्पसन के विरोधाभास (Simpson's paradox) जैसे सांख्यिकीय कारण संबंधी अनुमान (statistical causal inference) के दोषों को संभालने में लार्ज लैंग्वेज मॉडल्स की महत्वपूर्ण सीमाओं का कठोरता से मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

Jin Du, Li Chen, Xun Xian, An Luo, Fangqiao Tian, Ganghua Wang, Charles Doss, Xiaotong Shen, Jie Ding2026-03-06
💻 computer science

ShIOEnv: A Command Evaluation Environment for Grammar-Constrained Synthesis and Execution Behavior Modeling

यह शोध पत्र ShIOEnv प्रस्तुत करता है, जो एक व्याकरण-बद्ध (grammar-constrained), स्व-पर्यवेक्षित (self-supervised) बैश (Bash) वातावरण है जो पूर्ववर्ती निष्पादन-मुक्त (execution-free) दृष्टिकोणों की तुलना में जटिल कमांड-लाइन निष्पादन व्यवहारों को मॉडल करने की सटीकता में महत्वपूर्ण सुधार करने के लिए 2.1 मिलियन सिस्टम-ग्राउंडेड इनपुट-आउटपुट जोड़े उत्पन्न करता है।

Jarrod Ragsdale, Rajendra Boppana2026-03-06
💻 computer science

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

यह शोध पत्र EDINET-Bench प्रस्तुत करता है, जो दस वर्षों की जापानी वित्तीय रिपोर्टों से प्राप्त एक चुनौतीपूर्ण ओपन-सोर्स बेंचमार्क है, जिसका उद्देश्य धोखाधड़ी का पता लगाने और आय के पूर्वानुमान जैसे जटिल कार्यों पर LLMs का मूल्यांकन करना है, जो यह प्रकट करता है कि वर्तमान मॉडल विशेष स्कैफोल्डिंग के बिना काफी संघर्ष करते हैं और अधिक यथार्थवादी मूल्यांकन ढांचे की आवश्यकता पर प्रकाश डालता है।

Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha2026-03-06
💻 computer science

La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America

यह शोधपत्र ला लीडरबोर्ड (La Leaderboard) को प्रस्तुत करता है, जो मूल्यांकन मानक स्थापित करने और भाषाई विविधता को बढ़ावा देने के लिए स्पेन की विविधताओं और स्पेन एवं लैटिन अमेरिका की भाषाओं को कवर करने वाले 66 डेटासेट में 50 जनरेटिव एलएलएम (LLMs) का मूल्यांकन करने वाली पहली ओपन-सोर्स, समुदाय-संचालित पहल है।

María Grandury, Javier Aula-Blasco, Júlia Falcão, Clémentine Fourrier, Miguel González, Gonzalo Martínez, Gonzalo Santam (…)2026-03-06
💻 computer science

Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology

यह शोध पत्र ट्रेस करने योग्य विजुअल ग्राउंडेड रीजनिंग (traceable visual grounded reasoning) के मूल्यांकन के लिए एक डायग्नोस्टिक बेंचमार्क, TreeBench पेश करता है, और TreeVGR प्रस्तावित करता है जो एक सुदृढीकरण लर्निंग-आधारित (reinforcement learning-based) प्रशिक्षण प्रतिमान है जो लोकलाइजेशन (localization) और रीजनिंग (reasoning) को संयुक्त रूप से सुपरवाइज करके मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Haochen Wang, Xiangtai Li, Zilong Huang, Anran Wang, Jiacong Wang, Tao Zhang, Jiani Zheng, Sule Bai, Zijian Kang, Jiashi (…)2026-03-06