💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

यह शोध पत्र DRAGON को पेश करता है, जो एक बेंचमार्क डेटासेट और मूल्यांकन ढांचा है जिसे विजन-लैंग्वेज मॉडल्स की आरेखों (डायग्राम्स) के भीतर विशिष्ट दृश्य साक्ष्यों में अपने उत्तरों को ग्राउंड करने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो विश्वसनीय तर्क औचित्य के बिना उच्च सटीकता की सीमा को संबोधित करता है।

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur (…)2026-04-29
💬 NLP

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

यह शोध पत्र यह प्रदर्शित करता है कि छोटे इंस्ट्रक्शन-ट्यून्ड एलएलएम (7-9 बिलियन पैरामीटर्स) को जानबूझकर खराब प्रदर्शन करने के लिए प्रॉम्प्ट देना अपेक्षित 'बिल्लो-चांस' (संभावना से कम) सटीकता प्राप्त करने में विफल रहता है क्योंकि मॉडल या तो निर्देश की अनदेखी करते हैं या मध्य-वर्ण के विकल्पों के प्रति एक स्थितिजन्य पूर्वाग्रह (पोजीशनल बायस) अपना लेते है, जो यह सुझाव देता है कि इस प्रकार के सैंडबैगिंग का पता लगाने के लिए वितरण परिवर्तनों (डिस्ट्रीब्यूशन शिफ्ट्स) की निगरानी करना आवश्यक है न कि 'बिल्लो-चांस' प्रदर्शन पर निर्भर रहना।

Jon-Paul Cacioli2026-04-29
💬 NLP

LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model

यह शोध पत्र LegalMidm को प्रस्तुत करता है, जो एक व्यवस्थित, उपयोग-मामला-संचालित प्रशिक्षण ढांचे के माध्यम से विकसित एक कोरियाई कानूनी-डोमेन लार्ज लैंग्वेज मॉडल है, जो वास्तविक दुनिया के कानूनी अनुप्रयोगों में सटीकता और व्यावहारिक उपयोगिता को बढ़ाने के लिए कानूनी पेशेवरों के साथ सहयोग और कठोर डेटा क्यूरेशन को प्राथमिकता देता है।

Youngjoon Jang, Chanhee Park, Hyeonseok Moon, Young-kyoung Ham, Jiwon Moon, Jinhyeon Kim, JuKyung Jung, Heuiseok Lim2026-04-29
💻 computer science

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

यह शोध पत्र डिफ्यूजन मॉडल्स में एकीकृत एक रिकर्सिव, स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क प्रस्तावित करता है जो विजुअल टोकन को पुनरावृत्ति से परिष्कृत करने के लिए एक गेटिंग नेटवर्क का उपयोग करता है, जिससे मल्टीमॉडल इमेज जनरेशन में स्ट्रक्चर्ड रीजनिंग और टेक्स्ट-फॉलोइंग क्षमताओं को बढ़ाया जा सके।

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu2026-04-29
💬 NLP

Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

यह शोधपत्र Faithfulness-QA को प्रस्तुत करता है, जो लगभग 100,000 काउंटरफैक्टुअली (counterfactually) संशोधित QA नमूनों का एक बड़े पैमाने का डेटासेट है, जिसे रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) मॉडलों को आंतरिक पैरामीट्रिक मेमोरी के बजाय रिट्रीव किए गए संदर्भ को प्राथमिकता देने के लिए प्रशिक्षित और मूल्यांकित करने हेतु डिज़ाइन किया गया है, जिससे अनफेथफुल (unfaithful) जनरेशन की महत्वपूर्ण समस्या का समाधान किया जा सके।

Li Ju, Junzhe Wang, Qi Zhang2026-04-29
💬 NLP

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

यह शोध पत्र Cutscene Agent को प्रस्तुत करता है, जो एक मल्टी-एजेंट LLM फ्रेमवर्क है जो द्वि-दिशीय गेम इंजन एकीकरण (bidirectional game engine integration), विजुअल फीडबैक वाले एक पदानुक्रमित ऑर्केस्ट्रेशन सिस्टम और जटिल, लॉन्ग-होरिजन टूल ऑर्केस्ट्रेशन का मूल्यांकन करने के लिए डिज़ाइन किए गए एक नए पदानुक्रमित बेंचमार्क (CutsceneBench) के माध्यम से एंड-टू-एंड 3D कटसीन जनरेशन को स्वचालित करता है।

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan (…)2026-04-29
💬 NLP

R3^3-SQL: Ranking Reward and Resampling for Text-to-SQL

R³-SQL एक नवीन Text-to-SQL फ्रेमवर्क है जो कार्यात्मक रूप से समान SQL समूहों की सुसंगत रैंकिंग के लिए एक एकीकृत रिवॉर्ड मैकेनिज्म और सही क्वेरीज़ को तब पुनः प्राप्त करने के लिए एक एजेंटिक रीसैंपलिंग रणनीति पेश करके निष्पादन सटीकता में सुधार करता है जब वे शुरू में कैंडिडेट पूल से गायब होती हैं, जिससे BIRD-dev बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Hojae Han, Yeonseok Jeong, Seung-won Hwang, Zhewei Yao, Yuxiong He2026-04-29
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

यह शोध पत्र AHASD को प्रस्तुत करता है, जो एक टास्क-लेवल एसिंक्रोनस हेट्रोजेनियस मोबाइल आर्किटेक्चर है जो मौजूदा बेसलाइन्स की तुलना में लार्ज लैंग्वेज मॉडल्स के स्पेक्युलेटिव डिकोडिंग के लिए 4.2×\times थ्रूपुट और 5.6×\times ऊर्जा दक्षता सुधार प्राप्त करने के लिए नवीन नियंत्रण तंत्रों के साथ NPU-PIM सहयोग का लाभ उठाता है।

Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming2026-04-29
💻 computer science

Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

यह शोध पत्र यह प्रदर्शित करता है कि जबकि CMBAgent जैसे एजेंटिक एआई (agentic AI) सिस्टम खगोलीय कार्यप्रवाह (astrophysical workflows) में डोमेन संदर्भ के साथ महत्वपूर्ण प्रदर्शन लाभ दिखाते हैं, उनकी सबसे महत्वपूर्ण विफलता मोड आत्मविश्वास के साथ सिंटैक्टिक रूप से वैध लेकिन भौतिक रूप से गलत परिणाम उत्पन्न करना है, जिसमें स्व-निदान (self-diagnosis) का अभाव होता है, विशेष रूप से जटिल तर्क कार्यों में।

Shivam Rawat, Lucie Flek2026-04-29
💻 computer science

A Faceted Proposal for Transparent Attribution of AI-Assisted Text Production

यह शोध पत्र वर्तमान प्रकटीकरण प्रथाओं की कमियों को दूर करने के लिए रूप, सृजन, मूल्यांकन, इरादा, नियंत्रण और ट्रैसेबिलिटी जैसे आयामों में योगदान को वर्गीकृत करके एआई-सहायता प्राप्त पाठ उत्पादन को पारदर्शी रूप से एट्रिब्यूट करने के लिए एक बहुआयामी, बहु-स्तरीय मॉडल प्रस्तावित करता है।

Geraldo Xexéo2026-04-29