💻 computer science

LLM-Based Robustness Testing of Microservice Applications: An Empirical Study

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि प्रॉम्प्ट रणनीति माइक्रोसर्विस API के लिए LLM-जनित मजबूती परीक्षणों (robustness tests) की विविधता और कवरेज को महत्वपूर्ण रूप से प्रभावित करती है, जो यह प्रकट करता है कि एक वर्गीकरण-निर्देशित फ्यू-शॉट (taxonomy-guided few-shot) दृष्टिकोण विशिष्ट विफलता मोड (failure modes) को उजागर करने में बड़े मॉडल एन्सेम्बल्स और निश्चित प्रॉम्प्ट्स दोनों से बेहतर प्रदर्शन करता है।

Hrushitha Goud Tigulla, Marco Vieira2026-05-15
💬 NLP

Web Agents Should Adopt the Plan-Then-Execute Paradigm

यह शोध पत्र तर्क देता है कि वेब एजेंटों को प्रॉम्प्ट इंजेक्शन जोखिमों को कम करने के लिए डिफ़ॉल्ट ReAct दृष्टिकोण के बजाय "योजना-फिर-निष्पादन" (plan-then-execute) प्रतिमान को अपनाना चाहिए, और यह दावा करता है कि इस बदलाव में प्राथमिक बाधा एआई मॉडलिंग की सीमाएं नहीं बल्कि टाइप किए गए, सिमेंटिक वेबसाइट एपीआई का अभाव है।

Julien Piet, Annabella Chow, Yiwei Hou, Muxi Lyu, Sylvie Venuto, Jinhao Zhu, Raluca Ada Popa, David Wagner2026-05-15
💬 NLP

Mining Subscenario Refactoring Opportunities in Behaviour-Driven Software Test Suites: ML Classifiers and LLM-Judge Baselines

यह शोध पत्र एक स्वचालित पाइपलाइन प्रस्तुत करता है जो बीहेवियर-ड्रिवन डेवलपमेंट (BDD) टेस्ट सूट्स में रिफैक्टरिंग अवसरों की पहचान करने, उन्हें रैंक करने और वर्गीकृत करने के लिए पैराफ्रेस-रोबस्ट क्लस्टरिंग और एक XGBoost क्लासिफायर का उपयोग करता है, जो यह प्रदर्शित करता है कि क्लासिफायर गेरकिन (Gherkin) फाइलों के एक बड़े संग्रह में एक्सट्रैक्ट करने योग्य स्टेप सबसीक्वेंसेस का पता लगाने में नियम-आधारित और लार्ज लैंग्वेज मॉडल (LLM) दोनों बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Ali Hassaan Mughal, Noor Fatima, Muhammad Bilal2026-05-15
💻 computer science

In-IDE Toolkit for Developers of AI-Based Features

यह शोध पत्र जेटब्रेंस (JetBrains) IDEs के लिए एक AI टूलकिट प्लगइन पेश करता है जो ट्रेसिंग और मूल्यांकन को सीधे विकास वर्कफ़्लो में एकीकृत करता है, जिससे गैर-एमएल (non-ML) सॉफ्टवेयर इंजीनियरों को एक उपयोगकर्ता-केंद्रित, IDE-नेटिव दृष्टिकोण के माध्यम से AI-आधारित फीचर्स का प्रभावी ढंग से परीक्षण, डिबग और पुनरुत्पादन करने में सक्षम बनाया जा सके।

Yaroslav Sokolov, Yury Khudyakov, Lenar Sharipov, Andrei Gasparian, Parth Tiwary, Artem Trofimov2026-05-15
💻 computer science

Documentation-Guided Agentic Codebase Migration from C to Rust

RustPrint एक डॉक्यूमेंटेशन-गाइडेड एजेंटिक फ्रेमवर्क है जो सोर्स कोड को आर्किटेक्चरल ब्लूप्रिंट में बदलकर C से Rust में स्केलेबल, रिपॉजिटरी-लेवल माइग्रेशन को सक्षम बनाता है ताकि इटरेटिव एजेंट प्लानिंग, वेरिफिकेशन और रिपेयर को निर्देशित किया जा सके, जिससे मौजूदा LLM-आधारित ट्रांसलेटर्स की तुलना में बेहतर कंपाइलेशन सफलता और फीचर प्रिजर्वेशन प्राप्त होता है।

Minh Le-Anh, Anh Nguyen Hoang, Bach Le, Nghi D. Q. Bui2026-05-15
💻 computer science

Veritas: A Semantically Grounded Agentic Framework for Memory Corruption Vulnerability Detection in Binaries

वेरिटास (Veritas) एक सिमेंटिक रूप से ग्राउंडेड, मल्टी-एजेंट फ्रेमवर्क है जो स्ट्रिप्ड बाइनरीज़ में मेमोरी करप्शन कमजोरियों का हाई-रिकॉल और लो-फॉल्स-पॉजिटिव डिटेक्शन प्राप्त करने के लिए लिफ़्टेड LLVM IR के स्टैटिक एनालिसिस, ड्यूल-व्यू LLM रीजनिंग और रनटाइम वैलिडेशन को जोड़ता है, जिसने सफलतापूर्वक एप्पल की एक पूर्व अज्ञात भेद्यता (vulnerability) की पहचान की है।

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro2026-05-15
💻 computer science

PoC-Gym: Towards More Reliable LLM-Assisted Proof-of-Concept Exploit Generation

यह शोध पत्र PoC-Gym को प्रस्तुत करता है, जो एक पुनरावृत्ति पाइपलाइन (iterative pipeline) है जो जावा एक्सप्लॉइट प्रूफ-ऑफ-कांसेप्ट (PoC) उत्पन्न करने और उन्हें मान्य करने के लिए स्थिर (static) और गतिशील (dynamic) जानकारी को संयोजित करता है, जो मौजूदा विधियों की तुलना में बेहतर विश्वसनीयता प्रदर्शित करता है और साथ ही रनटाइम सफलता और वास्तविक भेद्यता शोषण (vulnerability exploitation) के बीच अंतर करने की निरंतर चुनौतियों को रेखांकित करता है।

Derin Gezgin, Amartya Das, Shinhae Kim, Zhengdong Huang, Nevena Stojkovic, Claire Wang2026-05-14
🤖 machine learning

EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering

यह शोध पत्र एंट्रॉपी-गाइडेड स्टेपवाइज स्केलिंग (EGSS) को प्रस्तुत करता है, जो एक नवीन टेस्ट-टाइम स्केलिंग फ्रेमवर्क है जो एंट्रॉपी-गाइडेड एडेप्टिव सर्च और टेस्ट-सूट ऑग्मेंटेशन के माध्यम से दक्षता और प्रभावशीलता को गतिशील रूप से संतुलित करता है, जिससे मौजूदा विधियों की तुलना में कम्प्यूटेशनल ओवरहेड को काफी कम करते हुए सॉफ्टवेयर इंजीनियरिंग कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Chenhui Mao, Yuanting Lei, Zhixiang Wei, Ming Liang, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang, Yong Li2026-05-14
💻 computer science

Formal Verification of Imperative First-Class Functions in Move

यह शोध पत्र मूव प्रोवर (Move Prover) का एक विस्तार प्रस्तुत करता है जो व्यवहारिक विधेयकों (behavioral predicates), अवस्था लेबल (state labels) और एक एसएमटी एनकोडिंग रणनीति (SMT encoding strategy) को पेश करके मूव भाषा में इम्पैरेटिव फर्स्ट-क्लास फंक्शन्स के औपचारिक सत्यापन को सक्षम बनाता है, जो कुशल सत्यापन और स्वचालित विनिर्देश अनुमान (automated specification inference) के लिए मूव के स्टैटिक मेमोरी सेपरेशन का लाभ उठाता है।

Wolfgang Grieskamp, Teng Zhang, Vineeth Kashyap, Jake Silverman2026-05-14
💻 computer science

Divergent Multi-Version Execution (DME): Canonical Instruction-Trace Fault Detection via Structural Address-Space Decorrelation

यह शोध पत्र डाइवर्जेंट मल्टी-वर्जन एक्जीक्यूशन (DME) को प्रस्तुत करता है, जो एक रनटाइम फॉल्ट डिटेक्शन तकनीक है जो सहसंबद्ध दोषों (correlated faults) को बेअसर करने के लिए स्वतंत्र मेमोरी लेआउट के साथ रेप्लिका संकलित करती है और एड्रेस-डिपेंडेंट वैल्यूज़ को अनदेखा करते हुए कैनोनिकल इंस्ट्रक्शन ट्रेसेस की तुलना करके निष्पादन की शुद्धता को सत्यापित करती है।

Petro Baran Yrievich2026-05-14