💬 NLP

AmbiSQL: Interactive Ambiguity Detection and Resolution for Text-to-SQL

AmbiSQL एक संवादात्मक प्रणाली है जो एक सूक्ष्म वर्गीकरण (fine-grained taxonomy) के माध्यम से क्वेरी की अस्पष्टताओं को स्वचालित रूप से पहचानकर और बहुविकल्पीय प्रश्नों के माध्यम से उपयोगकर्ताओं को उनके इरादे को स्पष्ट करने के लिए निर्देशित करके Text-to-SQL सटीकता को बढ़ाती है, जिससे XiYan-SQL बैकएंड के साथ एकीकृत होने पर SQL जनरेशन की गुणवत्ता में सुधार होता है।

Zhongjun Ding, Yin Lin, Tianjing Zeng, Rong Zhu, Bolin Ding, Jingren Zhou2026-03-24
💬 NLP

GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs

GAICo एक तैनात, ओपन-सोर्स पायथन फ्रेमवर्क है जो पुनरुत्पादकता और सिस्टम विश्वसनीयता को बढ़ाने के लिए मेट्रिक्स, विज़ुअलाइज़ेशन टूल्स और रिपोर्टिंग क्षमताओं के एक एकीकृत, विस्तार योग्य सुइट के माध्यम से विविध, मल्टीमॉडल जेनरेटिव एआई आउटपुट्स के मूल्यांकन को मानकीकृत और सुव्यवस्थित करता है।

Nitin Gupta, Pallav Koppisetti, Kausik Lakkaraju, Biplav Srivastava2026-03-24
💬 NLP

Hybrid Architectures for Language Models: Systematic Analysis and Design Insights

यह शोध पत्र उन हाइब्रिड भाषा मॉडल आर्किटेक्चर का एक समग्र मूल्यांकन प्रस्तुत करता है जो सेल्फ-अटेंशन को स्ट्रक्चर्ड स्टेट स्पेस मॉडल्स के साथ जोड़ते हैं, और भविष्य के विकास के लिए इष्टतम डिज़ाइन रेसिपी प्राप्त करने हेतु प्रदर्शन, दक्षता और स्केलिंग आयामों में इंटर-लेयर और इंट्रा-लेयर फ्यूजन रणनीतियों की व्यवस्थित रूप से तुलना करता है।

Sangmin Bae, Bilge Acun, Chien-Yu Lin, Haroun Habeeb, Seungyeon Kim, Liang Luo, Junjie Wang, Carole-Jean Wu2026-03-24
💬 NLP

Flipping the Dialogue: Training and Evaluating User Language Models

यह शोध पत्र बहु-चरण (multi-turn) बातचीत में मानवीय व्यवहार को अधिक सटीक रूप से सिम्युलेट करने के लिए विशेष रूप से निर्मित 'यूजर लैंग्वेज मॉडल्स' (User LMs) को प्रस्तुत करता है, जो यह प्रकट करता है कि मौजूदा असिस्टेंट-आधारित सिम्युलेटर त्रुटिपूर्ण हैं और यथार्थवादी यूजर सिमुलेशन शीर्ष स्तर के असिस्टेंट मॉडल्स की सीमाओं को भी महत्वपूर्ण रूप से उजागर करता है।

Tarek Naous, Philippe Laban, Wei Xu, Jennifer Neville2026-03-24
⚡ electrical engineering

TRI-DEP: A Trimodal Comparative Study for Depression Detection Using Speech, Text, and EEG

यह शोध पत्र TRI-DEP प्रस्तुत करता है, जो एक व्यवस्थित ट्राइमोडल अध्ययन है जो यह प्रदर्शित करता है कि प्रीट्रेंड एम्बेडिंग्स और सावधानीपूर्वक डिज़ाइन की गई फ्यूजन रणनीतियों के साथ EEG, स्पीच और टेक्स्ट मोडैलिटीज को संयोजित करने से विषय-स्वतंत्र अवसाद का पता लगाने में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Annisaa Fitri Nurfidausi, Eleonora Mancini, Paolo Torroni2026-03-24
💬 NLP

SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents

यह शोध पत्र सेफसर्च (SafeSearch) को प्रस्तुत करता है, जो एक मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो उच्च उपयोगिता बनाए रखते हुए असुरक्षित क्वेरीज़ को दंडित करके एलएलएम-आधारित (LLM-based) सर्च एजेंटों में हानिकारक आउटपुट को काफी कम कर देता है, जो इस महत्वपूर्ण निष्कर्ष को संबोधित करता है कि सर्च एजेंट बेस मॉडल्स की तुलना में सुरक्षा विफलताओं के प्रति अधिक संवेदनशील होते हैं।

Qiusi Zhan, Angeline Budiman-Chan, Abdelrahman Zayed, Xingzhi Guo, Daniel Kang, Joo-Kyung Kim2026-03-24
💬 NLP

Moneyball with LLMs: Analyzing Tabular Summarization in Sports Narratives

यह शोध पत्र SPORTABSET प्रस्तुत करता है, जो खेल वृत्तांतों में दीर्घ-संदर्भ वाली सारणीबद्ध सारांशीकरण (long-context tabular summarization) के लिए एक नैदानिक बेंचमार्क है, जो यह प्रकट करता है कि जबकि अपघटन रणनीतियाँ (decomposition strategies) मल्टी-एंटिटी इंटरफेरेंस को कम करके सटीकता में सुधार करती हैं, वर्तमान LLMs अभी भी खराब मल्टी-एंटिटी मेमोरी और सतही संकेतों (surface-level cues) के प्रति उच्च संवेदनशीलता के कारण मौलिक रूप से सीमित हैं।

Ritam Upadhyay, Naman Ahuja, Rishabh Baral, Aparna Garimella, Vivek Gupta2026-03-24
💬 NLP

Difficulty-Controllable Multiple-Choice Question Generation Using Large Language Models and Direct Preference Optimization

यह शोधपत्र सीधे बहुविकल्पीय प्रारूप बनाने और प्रश्न की कठिनाई को सटीक रूप से नियंत्रित करने में मौजूदा दृष्टिकोणों की सीमाओं को दूर करने के लिए डायरेक्ट प्रिफरेंस ऑप्टिमाइज़ेशन के साथ प्रशिक्षित एक लार्ज लैंग्वेज मॉडल का लाभ उठाकर कठिनाई-नियंत्रणीय बहुविकल्पीय पठन बोध प्रश्न उत्पन्न करने के लिए एक नवीन विधि प्रस्तावित करता है।

Yuto Tomikawa, Masaki Uto2026-03-24
💬 NLP

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

यह शोध पत्र PRDBench प्रस्तुत करता है, जो संरचित आवश्यकताओं वाले 50 वास्तविक-विश्व पायथन प्रोजेक्ट्स का एक स्केलेबल बेंचमार्क है, और PRDJudge, जो एक विशेष रूप से फाइन-ट्यून किया गया मूल्यांकन मॉडल है जो 90% से अधिक मानव संरेखण (human alignment) प्राप्त करता है, जो सामूहिक रूप से मौजूदा कोड एजेंट बेंचमार्क की उच्च एनोटेशन लागत और मूल्यांकन संबंधी अशुद्धियों को संबोधित करता है।

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu2026-03-24
💬 NLP

DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models

यह शोध पत्र DialectalArabicMMLU को प्रस्तुत करता है, जो पाँच प्रमुख अरबी बोलियों और 32 डोमेन में 15,000 हस्तनिर्मित बहुविकल्पीय प्रश्नों से युक्त एक व्यापक बेंचमार्क है, जिसे वर्तमान बड़े भाषा मॉडलों की बोली संबंधी तर्क क्षमताओं में महत्वपूर्ण प्रदर्शन अंतराल का मूल्यांकन करने और उन्हें प्रकट करने के लिए डिज़ाइन किया गया है।

Malik H. Altakrori, Nizar Habash, Abed Alhakim Freihat, Younes Samih, Kirill Chirkunov, Muhammed AbuOdeh, Radu Florian (…)2026-03-24