💻 computer science

Structural Quality Gaps in Practitioner AI Governance Prompts: An Empirical Study Using a Five-Principle Evaluation Framework

यह शोध पत्र कंप्यूटेबिलिटी थ्योरी (computability theory), प्रूफ़ थ्योरी (proof theory) और बेयसियन एपिस्टेमोलॉजी (Bayesian epistemology) पर आधारित एक पांच-सिद्धांत मूल्यांकन ढांचे को प्रस्तुत करता है, जो AI गवर्नेंस प्रॉम्प्ट्स की संरचनात्मक पूर्णता का आकलन करता है, और 34 GitHub फाइलों के एक अनुभवजन्य अध्ययन के माध्यम से यह प्रकट करता है कि 37% में डेटा वर्गीकरण और मूल्यांकन रूब्रिक्स जैसे महत्वपूर्ण तत्वों का अभाव है, जिससे AI-सहायता प्राप्त विकास में स्वचालित स्टैटिक एनालिसिस टूल्स की आवश्यकता पर बल मिलता है।

Christo Zietsman2026-04-24
💻 computer science

Mind the Prompt: Self-adaptive Generation of Task Plan Explanations via LLMs

यह शोध पत्र COMPASS को प्रस्तुत करता है, जो एक स्व-अनुकूलन योग्य (self-adaptive) ढांचा है जो जटिल साइबर-फिजिकल सिस्टम में एआई टास्क प्लानिंग के उच्च-गुणवत्ता वाले, मानव-समझने योग्य स्पष्टीकरण उत्पन्न करने के लिए प्रॉम्प्ट्स को स्वचालित रूप से संश्लेषित और परिष्कृत करने हेतु उपयोगकर्ता की संज्ञानात्मक अवस्थाओं और इंटरेक्शन संकेतों को एक POMDP के रूप में मॉडल करता है।

Gricel Vázquez, Alexandros Evangelidis, Sepeedeh Shahbeigi, Radu Calinescu, Simos Gerasimou2026-04-24
🧬 biology

Trustworthy Clinical Decision Support Using Meta-Predicates and Domain-Specific Languages

यह शोधपत्र नैदानिक निर्णय नियमों पर ज्ञानमीमांसीय बाधाओं को लागू करने के लिए मेटा-प्रिडिकेट्स और एक डोमेन-विशिष्ट भाषा का उपयोग करने वाले एक ढांचे का प्रस्ताव करता है, जिससे यह सुनिश्चित होता है कि एआई-संचालित स्वास्थ्य सेवा निर्णय न केवल सटीक हों, बल्कि तैनाती से पहले ऑडिट योग्य और उपयुक्त साक्ष्यों पर आधारित भी हों।

Michael Bouzinier, Sergey Trifonov, Michael Chumack, Eugenia Lvova, Dmitry Etin2026-04-24
🤖 machine learning

mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code

SemEval-2026 टास्क 13 के लिए mcdok सिस्टम mdok टेक्स्ट डिटेक्शन दृष्टिकोण को अनुकूलित करता है, जो मशीन-जनित कोड डिटेक्शन, एट्रिब्यूशन और हाइब्रिड कोड पहचान को प्रतिस्पर्धी रूप से संबोधित करने के लिए कोड-विशिष्ट लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करता है, हालांकि शीर्ष सिस्टमों की तुलना में महत्वपूर्ण प्रदर्शन अंतराल बने हुए हैं।

Adam Skurla, Dominik Macko, Jakub Simko2026-04-24
💬 NLP

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

VLAA-GUI स्वायत्त GUI एजेंटों के लिए एक मॉड्यूलर फ्रेमवर्क है जो अनिवार्य पूर्णता सत्यापन (mandatory completeness verification), एक मल्टी-टियर लूप ब्रेकर और एक ऑन-डिमांड सर्च एजेंट को एकीकृत करके समयपूर्व समाप्ति और पुनरावृत्ति वाले लूपों की समस्या का समाधान करता है, जिससे OSWorld और WindowsAgentArena बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xion (…)2026-04-24
💻 computer science

Probabilistic Verification of Neural Networks via Efficient Probabilistic Hull Generation

यह शोध पत्र एक नवीन न्यूरल नेटवर्क संभाव्य सत्यापन ढांचा प्रस्तावित करता है जो रिग्रेशन ट्री-आधारित स्टेट स्पेस उपविभाजन, बाउंड्री-अवेयर सैंपलिंग, और संभाव्यता प्राथमिकता के साथ पुनरावृत्ति परिशोधन को जोड़कर सुरक्षित संभाव्यता के लिए गारंटीकृत श्रेणियों की कुशलतापूर्वक गणना करता है, जो ACAS Xu और एक रॉकेट लैंडर कंट्रोलर जैसे बेंचमार्क पर अत्याधुनिक विधियों की तुलना में बेहतर सटीकता और दक्षता प्रदर्शित करता है।

Jingyang Li, Xin Chen, Hongfei Fu, Guoqiang Li2026-04-24
💻 computer science

DryRUN: On the Role of Public Tests in LLM-Driven Code Generation

यह शोधपत्र DryRUN को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो मानव-प्रदत्त सार्वजनिक परीक्षण मामलों (public test cases) पर निर्भरता को समाप्त करता है, जिससे LLMs को स्व-सुधार के लिए इनपुट उत्पन्न करने और निष्पादन ट्रेस (execution traces) को स्वायत्त रूप से सिम्युलेट करने में सक्षम बनाया जाता है, जिससे टोकन की खपत को कम करते हुए और अति-आत्मविश्वास को कम करते हुए अत्याधुनिक प्रदर्शन (state-of-the-art performance) प्राप्त किया जा सके।

Kaushitha Silva, Srinath Perera2026-04-24
🤖 machine learning

Verifying Machine Learning Interpretability Requirements through Provenance

यह शोध पत्र मॉडल और डेटा वंशावली (lineage) की व्यवस्थित रिकॉर्डिंग के माध्यम से मशीन लर्निंग मॉडल में व्याख्यात्मकता (interpretability) की गैर-कार्यात्मक आवश्यकता को मापने योग्य कार्यात्मक आवश्यकताओं में बदलने के लिए मशीन लर्निंग प्रोवेनेंस (provenance) का लाभ उठाकर इस अन्यथा अकिंचन (immeasurable) आवश्यकता को सत्यापित करने की एक विधि प्रस्तावित करता है।

Lynn Vonderhaar, Juan Couder, Daryela Cisneros, Omar Ochoa2026-04-24
💻 computer science

Can Large Language Models Assist the Comprehension of ROS2 Software Architectures?

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) डेवलपर्स को जटिल ROS2 सॉफ्टवेयर आर्किटेक्चर को समझने में प्रभावी ढंग से सहायता कर सकते हैं, जो विभिन्न मॉडल्स के बीच उच्च तथ्यात्मक सटीकता प्राप्त करते हुए महत्वपूर्ण प्रदर्शन अंतर और सावधानीपूर्वक मॉडल चयन की आवश्यकता को रेखांकित करते हैं।

Laura Duits, Bouazza El Moutaouakil, Ivano Malavolta2026-04-24
💻 computer science

Automated LTL Specification Generation from Industrial Aerospace Requirements

यह शोध पत्र AeroReq2LTL का परिचय देता है, जो एक LLM-आधारित ढांचा है जो शब्दावली सामान्यीकरण के लिए डेटा डिक्शनरी और टेम्पलेट-आधारित भाषा का उपयोग करके जटिल औद्योगिक एयरोस्पेस प्राकृतिक भाषा आवश्यकताओं को औपचारिक लीनियर टेम्पोरल लॉजिक (LTL) विनिर्देशों में अनुवादित करने को स्वचालित करता है, जिससे वास्तविक दुनिया के डेटासेट पर उच्च परिशुद्धता (precision) और रिकॉल (recall) प्राप्त होता है।

Zhi Ma, Xiao Liang, Cheng Wen, Rui Chen, Bin Gu, Shengchao Qin, Cong Tian, Mengfei Yang2026-04-24