💻 computer science

ReproScore: Separating Readiness from Outcome in Research Software Reproducibility Assessment

यह शोध पत्र ReproScore प्रस्तुत करता है, जो एक द्वि-स्तरीय ढांचा है जो अनुसंधान सॉफ्टवेयर मूल्यांकन में "तैयारी-परिणाम संलयन" (readiness-outcome conflation) को संबोधित करने के लिए स्थिर रिपॉजिटरी तत्परता को वास्तविक निष्पादन परिणामों से अलग करता है, और बड़े पैमाने पर मूल्यांकन के माध्यम से यह प्रदर्शित करता है कि जबकि स्थिर संकेत संरचनात्मक अंतरों को पकड़ते हैं, वे निष्पादन सफलता की भविष्यवाणी करने में विफल रहते हैं, जिससे डिजिटल लाइब्रेरी क्यूरेशन में इस वास्तुशिल्प पृथक्करण की आवश्यकता की पुष्टि होती है।

Sheeba Samuel, Daniel Mietchen, Jungsan Kim, Waqas Ahmed, Martin Gaedke2026-05-14
💻 computer science

Robust Mutation Analysis of Quantum Programs Under Noise

यह शोध पत्र एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि क्वांटम हार्डवेयर शोर व्यवहार संबंधी दूरियों को बदलकर और दोषों का पता लगाने की प्रक्रिया को जटिल बनाकर म्यूटेशन विश्लेषण को महत्वपूर्ण रूप से प्रभावित करता है, जिससे सुदृढ़ क्वांटम सॉफ्टवेयर परीक्षण सुनिश्चित करने के लिए शोर-जागरूक मेट्रिक्स और डिवाइस-विशिष्ट थ्रेसहोल्ड को अपनाना आवश्यक हो जाता है।

Sophie Fortz, Eñaut Mendiluze Usandizaga, Shaukat Ali, Paolo Arcaini, Mohammad Reza Mousavi2026-05-14
🤖 AI

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

यह शोध पत्र "एआई हार्नेस इंजीनियरिंग" (AI Harness Engineering) का प्रस्ताव करता है, जो एक रनटाइम सबस्ट्रेट फ्रेमवर्क है जो स्वायत्त सॉफ्टवेयर इंजीनियरिंग के केंद्र को केवल मॉडल क्षमता से हटाकर एकीकृत मॉडल-हार्नेस-एनवायरनमेंट सिस्टम पर स्थानांतरित करता है, जो सत्यापन योग्य, ऑडिट करने योग्य और रखरखाव योग्य सॉफ्टवेयर परिवर्तनों को उत्पन्न करने के लिए ग्यारह घटक जिम्मेदारियों और एक चार-स्तरीय सीढ़ी को परिभाषित करता है।

Hailin Zhong, Shengxin Zhu2026-05-14
💻 computer science

Scalable Deductive Verification of Data-Level Parallel Programs

यह शोध पत्र डेटा-स्तर के समानांतर कार्यक्रमों (data-level parallel programs) के निगमनात्मक सत्यापन (deductively verifying) के लिए VerCors वेरीफायर में क्वांटिफायर रीराइटिंग (quantifier rewriting) और बेहतर एलियास हैंडलिंग (alias handling) सहित स्केलेबल तकनीकों को प्रस्तुत और कार्यान्वित करता है, जो सामूहिक रूप से सत्यापन समय को औसतन 9 गुना कम करते हैं और पहले अप्राप्य प्रमाणों को सक्षम करते हैं।

Lars B. van den Haak, Anton Wijs, Marieke Huisman2026-05-14
💻 computer science

SkillOps: Managing LLM Agent Skill Libraries as Self-Maintaining Software Ecosystems

यह शोधपत्र SkillOps को प्रस्तुत करता है, जो एक लो-ओवरहेड (low-overhead), मेथड-अग्नोस्टिक (method-agnostic) फ्रेमवर्क है जो LLM एजेंट स्किल लाइब्रेरीज़ को टाइप किए गए कॉन्ट्रैक्ट्स (typed contracts) के रूप में दर्शाकर और लाइब्रेरी के स्वास्थ्य का निदान करके उन्हें स्व-रखरखाव वाले सॉफ्टवेयर इकोसिस्टम के रूप में मानता है, जिससे बिना किसी अतिरिक्त टास्क-टाइम मॉडल कॉल की आवश्यकता के कार्य सफलता दर में उल्लेखनीय सुधार होता है।

Hongji Pu, Xinyuan Song, Liang Zhao2026-05-14
🤖 AI

(How) Do Large Language Models Understand High-Level Message Sequence Charts?

यह शोध पत्र तीन लार्ज लैंग्वेज मॉडल्स की हाई-लेवल मैसेज सीक्वेंस चार्ट्स (HMSCs) के औपचारिक अर्थ विज्ञान (formal semantics) को समझने की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि वे बुनियादी अवधारणाओं पर मजबूत पकड़ प्रदर्शित करते हैं, लेकिन एब्स्ट्रैक्शन (abstraction), कंपोजिशन (composition) और कारण संबंधी निर्भरताओं (causal dependencies) से जुड़े जटिल सिमेंटिक तर्क में महत्वपूर्ण संघर्षों के कारण उनकी समग्र सटीकता मामूली (लगभग 52%) है।

Mohammad Reza Mousavi2026-05-14
🤖 AI

Neurosymbolic Auditing of Natural-Language Software Requirements

यह शोध पत्र VERIMED को प्रस्तुत करता है, जो एक न्यूरोसिम्बोलिक पाइपलाइन है जो प्राकृतिक-भाषा सॉफ्टवेयर आवश्यकताओं के ऑडिट के लिए लार्ज लैंग्वेज मॉडल्स और SMT सॉल्वर का लाभ उठाता है, जो स्टोकेस्टिक फॉर्मलाइजेशन वेरिएशन्स के माध्यम से अस्पष्टता का पता लगाकर और काउंटरएग्जांपल-गाइडेड रिपेयर के माध्यम से निरंतरता और सुरक्षाता को सत्यापित करके, मेडिकल-डिवाइस सुरक्षा आवश्यकताओं में एक महत्वपूर्ण सटीकता वृद्धि प्राप्त करता है।

Bethel Hall, William Eiers2026-05-14
💻 computer science

Comparative Analysis of Technical and Legal Frameworks of Various National Digial Identity Solutions

यह स्थिति पत्र विभिन्न राष्ट्रीय डिजिटल पहचान प्रणालियों के तकनीकी और कानूनी ढांचों का विश्लेषण करता है ताकि हितधारकों को कार्यान्वयन चुनौतियों और संप्रभुता संबंधी चिंताओं को संबोधित करने में मार्गदर्शन किया जा सके, और अंततः ब्लॉकचेन-आधारित स्व-संप्रभु पहचान समाधानों को इष्टतम मॉडल के रूप में वकालत की जा सके।

Montassar Naghmouchi, Maryline Laurent, Claire Levallois-Barth, Nesrine Kaaniche2026-05-13
💬 NLP

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

यह शोध पत्र AutoMonitor-Bench प्रस्तुत करता है, जो विविध कार्यों में LLM-आधारित दुर्व्यवहार मॉनिटरों (misbehavior monitors) के व्यवस्थित मूल्यांकन के लिए पहला बेंचमार्क है, जो महत्वपूर्ण प्रदर्शन परिवर्तनशीलता और एक मौलिक सुरक्षा-उपयोगिता ट्रेड-ऑफ (safety-utility trade-off) को प्रकट करता है और यह प्रदर्शित करता है कि ज्ञात दुर्व्यवहार डेटा पर फाइन-ट्यूनिंग करना अनदेखे या अंतर्निहित विफलताओं का पता लगाने की चुनौतियों को पूरी तरह से हल नहीं करता है।

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang2026-05-13
💬 NLP

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

यह शोध पत्र एक डेटा फ़िल्टरिंग रणनीति और HE-SNR मीट्रिक को पेश करके SWE-bench के लिए प्रभावी मिड-ट्रेनिंग मीट्रिक्स की कमी को संबोधित करता है, जो जटिल सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए लार्ज लैंग्वेज मॉडल अनुकूलन को बेहतर ढंग से निर्देशित करने के लिए एंट्रॉपी कम्प्रेशन हाइपोथीसिसिस (Entropy Compression Hypothesis) पर आधारित है।

Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu2026-05-13