💻 computer science

Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents

यह शोध पत्र एक क्षमता-उन्मुख परीक्षण ढांचे (capability-oriented testing framework) का प्रस्ताव करता है जो विजन-एंड-लैंग्वेज नेविगेशन एजेंटों में विफलताओं का प्रभावी ढंग से पता लगाने और उनके मूल कारणों का सटीक पता लगाने के लिए अनुकूली टेस्ट केस जनरेशन, क्षमता-विशिष्ट ओरैकल्स और फीडबैक-संचालित एट्रिब्यूशन को जोड़ता है, जो विफलता खोज और व्याख्यात्मकता दोनों में मौजूदा सिस्टम-स्तरीय विधियों से बेहतर प्रदर्शन करता है।

Jianming Chen, Yawen Wang, Junjie Wang, Xiaofei Xie, Shoubin Li, Qing Wang, Fanjiang Xu2026-04-29
💻 computer science

Training Transformers as a Universal Computer

यह शोध पत्र प्रदर्शित करता है कि यादृच्छिक रूप से उत्पन्न माइक्रोपाय (MicroPy) प्रोग्रामों पर प्रशिक्षित एक छोटा ट्रांसफार्मर जटिल, मानव-लिखित एल्गोरिदम को निष्पादित करने के लिए सामान्यीकरण कर सकता है, जो इस बात का अनुभवजन्य प्रमाण प्रदान करता है कि मानक ट्रांसफार्मर सार्वभौमिक कंप्यूटर के रूप में कार्य कर सकते हैं।

Ruize Xu, Chenxiao Yang, Yanhong Li, David McAllester2026-04-29
💻 computer science

From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models

यह शोध पत्र इंटरप्रिटेबिलिटी-गाइडेड डेटा सिलेक्शन (IGDS) का परिचय देता है, जो एक नवीन फ्रेमवर्क है जो फाइन-ट्यूनिंग के लिए "फीचर-रेजोनेंट डेटा" की पहचान करने और उसे चुनने के लिए मैकेनिस्टिक इंटरप्रिटेबिलिटी का लाभ उठाता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण फुल-डेटासेट ट्रेनिंग और मौजूदा बेसलाइन्स की तुलना में बेहतर डेटा दक्षता के साथ गणित और अनुवाद जैसे कार्यों पर लार्ज लैंग्वेज मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Ling Shi, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo2026-04-29
🤖 machine learning

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

यह शोध पत्र एक विश्वसनीय निष्पादन वातावरण (TEE) आधारित आर्किटेक्चर का प्रस्ताव करता है जो एआई-सहायता प्राप्त अनुदान समीक्षाओं के लिए ऑडिट करने योग्य, हस्ताक्षरित मूल्यांकन बंडलों को बनाने हेतु रिमोट अटैस्टेशन का उपयोग करता है, जो प्रोप्रायटरी मॉडल वेट्स या स्कोरिंग लॉजिक को उजागर किए बिना प्रक्रिया पारदर्शिता और प्रॉम्प्ट इंजेक्शन प्रतिरोध सुनिश्चित करता है।

Kemal Bicakci2026-04-29
💬 NLP

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED एक ऐसा फ्रेमवर्क है जो डोमेन डायमेंशन डिकंपोजिशन और मल्टी-एजेंट डिबेट के माध्यम से हाई-फिडेलिटी सिंथेटिक ट्रेनिंग डेटा जेनरेट करता है, जिससे छोटे लैंग्वेज मॉडल्स को व्यापक मानवीय एनोटेशन के बिना कस्टम पॉलिसियों को लागू करने में स्टेट-ऑफ-द-आर्ट प्रोप्रायटरी LLMs और समर्पित गार्डरेल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

Arnon Mazza, Elad Levi2026-04-29
💻 computer science

DATAREEL: Automated Data-Driven Video Story Generation with Animations

यह शोध पत्र DataReel प्रस्तुत करता है, जो 328 वास्तविक दुनिया के डेटा-संचालित वीडियो कहानियों वाला एक बेंचमार्क है, और एक मल्टी-एजेंट फ्रेमवर्क प्रस्तावित करता है जो सिंक्रोनाइज़्ड नैरेशन (तुल्यकालिक वर्णन) के साथ एनिमेटेड डेटा विज़ुअलाइज़ेशन के निर्माण को स्वचालित करने में डायरेक्ट प्रॉम्प्टिंग बेसलाइन्स से बेहतर प्रदर्शन करता है।

Ridwan Mahbub, Syem Aziz, Mahir Ahmed, Shadikur Rahman, Mizanur Rahman, Shafiq Joty, Enamul Hoque2026-04-29
💻 computer science

Value-Sensitive AI for Prayer: Balancing the Agencies Between Human and AI Agents in Spiritual Context

यह शोध पत्र प्रार्थना के लिए चार वैचारिक एआई (AI) प्रणालियों का प्रस्ताव करता है ताकि यह प्रदर्शित किया जा सके कि आध्यात्मिक अनुभवों की प्रमाणिकता बनाए रखने के लिए मानवीय एजेंसी और व्याख्यात्मक खुलेपन को संरक्षित करना आवश्यक है, क्योंकि अत्यधिक एआई हस्तक्षेप ईश्वरीय संबंध की कथित वास्तविकता को कम करने का जोखिम उत्पन्न करता है।

Soonho Kwon, Dong Whi Yoo, Shaowen Bardzell, Younah Kang2026-04-29
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

यह शोध पत्र DRAGON को पेश करता है, जो एक बेंचमार्क डेटासेट और मूल्यांकन ढांचा है जिसे विजन-लैंग्वेज मॉडल्स की आरेखों (डायग्राम्स) के भीतर विशिष्ट दृश्य साक्ष्यों में अपने उत्तरों को ग्राउंड करने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो विश्वसनीय तर्क औचित्य के बिना उच्च सटीकता की सीमा को संबोधित करता है।

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur (…)2026-04-29
💬 NLP

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

यह शोध पत्र यह प्रदर्शित करता है कि छोटे इंस्ट्रक्शन-ट्यून्ड एलएलएम (7-9 बिलियन पैरामीटर्स) को जानबूझकर खराब प्रदर्शन करने के लिए प्रॉम्प्ट देना अपेक्षित 'बिल्लो-चांस' (संभावना से कम) सटीकता प्राप्त करने में विफल रहता है क्योंकि मॉडल या तो निर्देश की अनदेखी करते हैं या मध्य-वर्ण के विकल्पों के प्रति एक स्थितिजन्य पूर्वाग्रह (पोजीशनल बायस) अपना लेते है, जो यह सुझाव देता है कि इस प्रकार के सैंडबैगिंग का पता लगाने के लिए वितरण परिवर्तनों (डिस्ट्रीब्यूशन शिफ्ट्स) की निगरानी करना आवश्यक है न कि 'बिल्लो-चांस' प्रदर्शन पर निर्भर रहना।

Jon-Paul Cacioli2026-04-29
💬 NLP

LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model

यह शोध पत्र LegalMidm को प्रस्तुत करता है, जो एक व्यवस्थित, उपयोग-मामला-संचालित प्रशिक्षण ढांचे के माध्यम से विकसित एक कोरियाई कानूनी-डोमेन लार्ज लैंग्वेज मॉडल है, जो वास्तविक दुनिया के कानूनी अनुप्रयोगों में सटीकता और व्यावहारिक उपयोगिता को बढ़ाने के लिए कानूनी पेशेवरों के साथ सहयोग और कठोर डेटा क्यूरेशन को प्राथमिकता देता है।

Youngjoon Jang, Chanhee Park, Hyeonseok Moon, Young-kyoung Ham, Jiwon Moon, Jinhyeon Kim, JuKyung Jung, Heuiseok Lim2026-04-29