💻 computer science

Gamified Requirement Elicitation for a Multi-Modal Decision Support System. The Case of SYNCHROMODE

यह शोध पत्र SYNCHROMODE मल्टीमॉडलल निर्णय समर्थन प्रणाली की आवश्यकताओं को परिभाषित करने के लिए उपयोग की जाने वाली पारंपरिक और गेमिफाइड (gamified) आवश्यकता निष्कर्षण विधियों का एक तुलनात्मक विश्लेषण प्रस्तुत करता है, जो यह दर्शाता है कि कैसे एक सीरियस गेम ने एक भौतिक कार्यशाला में विविध हितधारकों को कोर सिस्टम आवश्यकताओं की पहचान करने और उन्हें मान्य करने में संलग्न किया।

Dimitris Tzanis, Alexandros Dolianitis, Viktoria Petkani, Areti Kotsi, Evangelos Mitsakis2026-05-27
💻 computer science

Tool-Schema Compression Enables Agentic RAG Under Constrained Context Budgets

यह शोध पत्र यह प्रदर्शित करता है कि टूल-स्कीमा संपीड़न (tool-schema compression) एजेंटिक RAG सिस्टम के लिए एक महत्वपूर्ण बुनियादी ढांचा है, जो टूल परिभाषाओं को कॉन्टेक्स्ट विंडो से बाहर होने से रोककर और अनकंप्रेस्ड स्कीमा की तुलना में सटीक-मैच स्कोर में महत्वपूर्ण सुधार करके, सीमित कॉन्टेक्स्ट बजट के तहत कार्यात्मक प्रदर्शन को सक्षम बनाता है।

Furkan Sakizli2026-05-27
💻 computer science

ESBMC: A Survey of Its Evolution, Integration, and Future Directions in Formal Software Verification

यह सर्वेक्षण ESBMC मॉडल चेकर के 2009 की उत्पत्ति से लेकर 2025-2026 की स्थिति तक के विकास का पता लगाता है, जो AI एजेंटों और औद्योगिक ढांचों के साथ एकीकृत एक बहुमुखी, पुरस्कार विजेता और मूल रूप से स्वायत्त सत्यापन प्लेटफॉर्म है, जबकि इसके आर्थिक प्रभाव का विश्लेषण करता है और औपचारिक सॉफ्टवेयर सत्यापन में भविष्य की चुनौतियों को रेखांकित करता है।

Pierre Dantas, Lucas Cordeiro, Waldir Junior2026-05-27
💻 computer science

A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

यह शोध पत्र प्रकट करता है कि कई एजेंटों के माध्यम से भाषा मॉडलों को व्यवस्थित करने से एक सार्वभौमिक "डिटेक्शन क्लिफ" (पहचान की ढलान) उत्पन्न होती है जहाँ मॉडल के पैमाने या संरेखण की परवाह किए बिना क्रॉस-सेक्शन दस्तावेज़ दोषों को पहचानने की क्षमता दो-तिहाई से अधिक गिर जाती है, और साथ ही रिपोर्टिंग मानदंडों में एक विशिष्ट डेवलपर-निर्भर बदलाव और इन संरचनात्मक विफलताओं का पता लगाने में स्वचालित न्यायाधीशों की अविश्वसनीयता को भी उजागर करता है।

Hiroki Fukui2026-05-27
💬 NLP

Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks

Conv-to-Bench एक स्केलेबल, मल्टी-स्टेज फ्रेमवर्क है जो वास्तविक मल्टी-टर्न यूजर-असिस्टेंट संवादों को कोड कार्यों के लिए संरचित, सत्यापन योग्य मूल्यांकन बेंचमार्क में स्वचालित रूप से परिवर्तित करता है, जो श्रम-गहन विशेषज्ञ क्यूरेशन पर निर्भरता को काफी कम करते हुए मानव-निर्मित मानकों के साथ लगभग पूर्ण संरेखण प्राप्त करता है।

Victor M. dos Santos, Andre C. Castro, Samuel L. de S. Toledo, Bruno M. L. Calura, Lisandra C. de M. Menezes, Raul C. R. (…)2026-05-27
💬 NLP

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

यह शोध पत्र Verus-SpecGym प्रस्तुत करता है, जो Rust सत्यापन के लिए अनौपचारिक प्रोग्रामिंग समस्याओं को निष्ठावान औपचारिक विनिर्देशों (formal specifications) में अनुवादित करने की LLMs की क्षमता का मूल्यांकन करने के लिए एक एजेंटिक वातावरण और बेंचमार्क है, जो यह प्रकट करता है कि जहाँ फ्रंटियर मॉडल आशाजनक दिखते हैं, वहीं उनके आउटपुट अभी भी नाजुक हैं और सूक्ष्म त्रुटियों के प्रति संवेदनशील हैं जिन्हें मानक LLM जज अक्सर अनदेखा कर देते हैं।

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parn (…)2026-05-27
💻 computer science

Testing Agentic Workflows with Structural Coverage Criteria

यह शोध पत्र मल्टी-एजेंट वर्कफ़्लो के लिए एक स्ट्रक्चरल टेस्टिंग दृष्टिकोण प्रस्तुत करता है जो उन्हें कोऑर्डिनेशन ग्राफ्स के रूप में मॉडल करता है ताकि कवरेज दायित्वों (coverage obligations) को प्राप्त किया जा सके, जिन्हें फिर DSPy के माध्यम से निष्पादन योग्य परीक्षणों के रूप में साकार किया जाता है ताकि यह सत्यापित किया जा सके कि घोषित एजेंट, टूल-एक्सेस नियम, प्रतिबंध और डेलीगेशन पाथ वास्तव में उपयोग किए गए हैं।

Nafiseh Kahani, Mojtaba Bagherzadeh2026-05-27
💻 computer science

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

यह शोधपत्र TrajAudit प्रस्तुत करता है, जो एक नया ढांचा (framework) है जिसे शोरयुक्त, लंबी ट्रैजेक्टरीज को फ़िल्टर करने और पूर्व ज्ञान का लाभ उठाने के माध्यम से रिपॉजिटरी-स्तरीय एजेंटिक कोडिंग सिस्टम में विफलता निदान (failure diagnosis) में सुधार करने के लिए डिज़ाइन किया गया है, जो मौजूदा बेसलाइनों की तुलना में नए RootSE बेंचमार्क पर काफी उच्च लोकलाइजेशन सटीकता और टोकन दक्षता प्राप्त करता है।

Minxing Wang, Xiaofei Xie, Yintong Huo2026-05-27
💬 NLP

Evidence Absence Is Not Evidence Insufficiency: Diagnosing NEI Construction Artifacts in Fact Verification

यह शोध पत्र NEI-CAP प्रस्तुत करता है, जो एक नैदानिक प्रोटोकॉल है जो यह प्रकट करता है कि तथ्य सत्यापन मॉडल अक्सर विभिन्न साक्ष्य निर्माण विधियों के बीच "अपर्याप्त जानकारी" (Not Enough Information) की सक्षमता को सामान्यीकृत करने में विफल रहते हैं क्योंकि समग्र स्कोर अंतर्निहित शॉर्टकट संकेतों और निर्माण-विशिष्ट आर्टिफैक्ट्स पर निर्भरता को छिपा सकते हैं।

Jingxi Qiu, Zeyu Han, Cheng Huang2026-05-27
💻 computer science

Software Engineering Podcasts: An Empirical Study of Their Potential as a Research Resource

यह अनुभवजन्य अध्ययन सॉफ्टवेयर इंजीनियरिंग पॉडकास्ट की सामग्री का व्यवस्थित रूप से विश्लेषण करता है और शोधकर्ताओं का सर्वेक्षण करता है ताकि अनुभवजन्य सॉफ्टवेयर इंजीनियरिंग अनुसंधान को आगे बढ़ाने के लिए एक मूल्यवान संसाधन के रूप में उनकी क्षमता का मूल्यांकन किया जा सके।

Marvin Wyrich, Marcos Kalinowski, Adolfo Neto, Sven Apel2026-05-27