💬 NLP

IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation

यह शोध पत्र इंटररोगेटिव अनसर्टेन्टी क्वांटिफिकेशन (IUQ) को प्रस्तुत करता है, जो एक ऐसा नवीन ढांचा है जो लंबे, मुक्त-रूप वाले लार्ज लैंग्वेज मॉडल जनरेशन में क्लेम-लेवल अनसर्टेन्टी और फेथफुलनेस को प्रभावी ढंग से मापने के लिए 'इंटररोगेट-देन-रिस्पोंड' प्रतिमान का लाभ उठाता है, जो विविध मॉडलों और डेटासेट्स में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Haozhi Fan, Jinhao Duan, Kaidi Xu2026-04-17
💬 NLP

Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

एक ब्लाइंडेड मल्टी-रेटर्स मूल्यांकन में, एक रिट्रीवल-ग्राउंडेड लार्ज लैंग्वेज मॉडल ने सहानुभूतिपूर्ण, सुधारात्मक और सुरक्षित CGM-सूचित परामर्श प्रतिक्रियाएं उत्पन्न करने में वरिष्ठ चिकित्सकों को पीछे छोड़ दिया, जो रोगी शिक्षा के लिए एक सहायक उपकरण के रूप में इसकी क्षमता को दर्शाता है और साथ ही चिकित्सीय निर्णय लेने में मानवीय निरीक्षण की आवश्यकता को भी रेखांकित करता है।

Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy (…)2026-04-17
🤖 AI

IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning

IG-Search एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो खोज-संवर्धित तर्क (search-augmented reasoning) को बेहतर बनाने के लिए चरण-स्तरीय सूचना लाभ (step-level Information Gain) पुरस्कार पेश करता है ताकि खोज प्रश्नों के लिए सूक्ष्म-स्तरीय क्रेडिट असाइनमेंट प्रदान किया जा सके, जिससे प्रक्षेपवक्र-स्तरीय (trajectory-level) पुरस्कारों की सीमाओं को दूर करते हुए बिना किसी मध्यवर्ती एनोटेशन के QA बेंचमार्क पर बेहतर प्रदर्शन प्राप्त किया जा सके।

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou2026-04-17
💬 NLP

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

यह शोधपत्र QuantCode-Bench प्रस्तुत करता है, जो Backtrader फ्रेमवर्क के लिए निष्पादन योग्य एल्गोरिद्मिक ट्रेडिंग रणनीतियों को उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल मुख्य रूप से सिंटैक्टिक कोड शुद्धता के बजाय वित्तीय तर्क को सही ढंग से संचालित करने और कार्य अर्थविज्ञान (task semantics) का पालन करने में संघर्ष करते हैं।

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich2026-04-17
💬 NLP

Compressing Sequences in the Latent Embedding Space: KK-Token Merging for Large Language Models

यह शोध पत्र K-Token Merging को प्रस्तुत करता है, जो एक लेटेंट-स्पेस कंप्रेशन फ्रेमवर्क है जो विविध कार्यों में उच्च प्रदर्शन बनाए रखते हुए लार्ज लैंग्वेज मॉडल्स में इनपुट लंबाई और कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम करने के लिए एक लाइटवेट एनकोडर के माध्यम से निरंतर टोकन एम्बेडिंग्स को मर्ज करता है।

Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang2026-04-17
💬 NLP

Fabricator or dynamic translator?

यह शोध पत्र मशीन अनुवाद में लार्ज लैंग्वेज मॉडल्स के विविध ओवर-जनरेशन (overgenerations)—जो भ्रम (confabulations) से लेकर सहायक स्पष्टीकरणों (helpful explanations) तक विस्तृत हैं—का पता लगाने और उन्हें वर्गीकृत करने की रणनीतियों का अन्वेषण करता है और एक व्यावसायिक परिवेश में उनके कार्यान्वयन से प्राप्त परिणामों को प्रस्तुत करता है।

Lisa Vasileva, Karin Sim2026-04-17
🤖 machine learning

AdaSplash-2: Faster Differentiable Sparse Attention

AdaSplash-2 एक नवीन हिस्टोग्राम-आधारित इनिशियलाइज़ेशन और स्पैरसिटी-अवेयर (sparsity-aware) GPU कार्यान्वयन पेश करता है जो α\alpha-entmax स्पार्स अटेंशन को नाटकीय रूप से तेज़ करता है, जिससे मध्यम-से-उच्च स्पैरसिटी स्तरों पर FlashAttention-2 के तुलनीय प्रशिक्षण गति सक्षम होती है जबकि लॉन्ग-कॉन्टेक्स्ट सेटिंग्स में बेहतर प्रदर्शन प्राप्त होता है।

Nuno Gonçalves, Hugo Pitorro, Vlad Niculae, Edoardo Ponti, Lei Li, Andre Martins, Marcos Treviso2026-04-17
💬 NLP

MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events

यह शोध पत्र MADE को प्रस्तुत करता है, जो चिकित्सा उपकरण प्रतिकूल घटनाओं के मल्टी-लेबल टेक्स्ट वर्गीकरण के लिए एक निरंतर अपडेट होने वाला "लिविंग" बेंचमार्क है, जो डेटा संदूषण और लेबल जटिलता को संबोधित करता है साथ ही विविध आर्किटेक्चरों में मॉडल के प्रदर्शन और अनिश्चितता परिमाणीकरण का एक व्यापक मूल्यांकन प्रदान करता है।

Raunak Agarwal, Markus Wenzel, Simon Baur, Jonas Zimmer, George Harvey, Jackie Ma2026-04-17
🤖 AI

Learning to Think Like a Cartoon Captionist: Incongruity-Resolution Supervision for Multimodal Humor Understanding

यह शोध पत्र IRS (Incongruity-Resolution Supervision) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो दृश्य विसंगतियों (visual mismatches) की पहचान करने और उन्हें सुलझाने की संरचित तर्क प्रक्रिया को स्पष्ट रूप से सुपरवाइज़ करके मल्टीमॉडल ह्यूमर (multimodal humor) की समझ में सुधार करता है, जिससे यह न्यू यॉर्कर कार्टून कैप्शन कॉन्टेस्ट (New Yorker Cartoon Caption Contest) पर मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि तर्क संरचना संबंधी पर्यवेक्षण (reasoning structure supervision), मॉडल के पैमाने (model scale) की तुलना में अधिक महत्वपूर्ण है।

Hatice Merve Vural, Doga Kukul, Ege Erdem Ozlu, Demir Ekin Arikan, Bob Mankoff, Erkut Erdem, Aykut Erdem2026-04-17
💬 NLP

Deep Learning Based Amharic Chatbot for FAQs in Universities

यह शोध पत्र एक डीप लर्निंग-आधारित अम्हारिक चैटबॉट प्रस्तुत करता है जो प्राकृतिक भाषा प्रसंस्करण तकनीकों और एक न्यूरल नेटवर्क मॉडल का उपयोग करता है जिसने विश्वविद्यालय के अक्सर पूछे जाने वाले प्रश्नों (FAQs) का प्रभावी ढंग से उत्तर देने के लिए 91.55% सटीकता प्राप्त की है, जो रूपात्मक भिन्नता और शाब्दिक अंतराल जैसी भाषाई चुनौतियों को संबोधित करता है और 24 घंटे की सुलभता के लिए फेसबुक मैसेंजर पर तैनात है।

Goitom Ybrah Hailu, Hadush Hailu, Shishay Welay2026-04-16