💻 computer science

LLM-Based Static Verification of Code Against Natural-Language Requirements: An Industrial Experience Report

यह शोध पत्र इंटेलिजेंट-व्हीकल साइबर सुरक्षा में एक दो-चरणीय LLM-आधारित वर्कफ़्लो पर एक औद्योगिक अनुभव रिपोर्ट प्रस्तुत करता है जो प्राकृतिक-भाषा आवश्यकताओं से सत्यापन योग्य नियमों को निकालता है और कार्यान्वयन की शुद्धता को स्थैतिक रूप से सत्यापित करने के लिए उनके विरुद्ध कोड का ऑडिट करता है, जिससे रनटाइम निष्पादन की आवश्यकता के बिना पारंपरिक स्टेटिक एनालिसिस और टेस्ट ऑरेकल समस्या की सीमाओं को संबोधित किया जा सके।

Zhi Quan Zhou, Dave Towey, Tsong Yueh Chen2026-05-19
💻 computer science

Contextualized Code Pretraining for Code Generation

यह शोध पत्र "कॉन्टेक्स्टुअलाइज़्ड कोड प्रीट्रेनिंग" का प्रस्ताव करता है, जो एक इनवोकेशन-अवेयर फ्रेमवर्क है जो कॉलर-कली पेयर्स (caller-callee pairs) को निकालने के लिए स्टैटिक एनालिसिस का लाभ उठाता है ताकि कॉलरजेन (CallerGen) मॉडल को प्रशिक्षित किया जा सके, जो यह प्रदर्शित करता है कि मौजूदा मॉडलों की तुलना में वास्तविक बेंचमार्क पर कॉलिंग कॉन्टेक्स्ट को एकीकृत करने से कोड जनरेशन प्रदर्शन में महत्वपूर्ण सुधार होता है।

Chen Liu, Qingyuan Liang, Hanwen Zhang, Zeyu Sun, Yakun Zhang, Lu Zhang2026-05-19
💻 computer science

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent एक नवीन एजेंटिक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो कोड स्ट्रक्चर-अवेयर एनकोडिंग, ड्यूल-परस्पेक्टिव क्वेरी ट्रांसफॉर्मेशन और टू-फेज एजेंटिक रीरैंकिंग के माध्यम से फ़ाइल-लेवल बग लोकलाइजेशन को बेहतर बनाता है, जिससे SWE-bench Lite पर स्टेट-ऑफ-द-आर्ट सटीकता प्राप्त होती है और साथ ही लागत में उल्लेखनीय कमी आती है और डाउनस्ट्रीम ऑटोमेटेड प्रोग्राम रिपेयर सफलता में सुधार होता है।

Md Afif Al Mamun, Gias Uddin2026-05-19
💬 NLP

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA मल्टी-एजेंट LLM वर्कफ़्लो के ऑफलाइन, टेस्ट-ड्रिवन रिफाइनमेंट के लिए एक एकीकृत इंटरफ़ेस है जो ग्राफ-आधारित स्कोरिंग और बैकवर्ड इवैल्यूएशन के माध्यम से बॉटलनैक्स को स्थानीयकृत करता है, जिससे डेवलपर्स को सिस्टम के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए प्रॉम्प्ट संशोधनों को पुनरावृत्तीय रूप से संपादित और मान्य करने में सक्षम बनाया जाता है।

Kazuki Kawamura, Satoshi Waki, Kei Tateno2026-05-19
💻 computer science

Three Heads Are Better Than One: A Multi-perspective Reasoning Framework for Enhanced Vulnerability Detection

यह शोधपत्र ReasonVul प्रस्तुत करता है, जो एक नवीन बहु-परिप्रेक्ष्य तर्क ढांचा (multi-perspective reasoning framework) है जो सॉफ़्टवेयर कमजोरियों का पता लगाने के लिए एक संरचित बहस में संलग्न तीन विशिष्ट LLM एजेंटों का लाभ उठाता है, जिससे PrimeVul और JITVUL डेटासेट पर मौजूदा बेसलाइन की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Xin Peng, Bo Lin, Jing Wang, Xiaoling Li, Jun Ma, Jie Yu, Xiaoguang Mao, Shangwen Wang2026-05-19
💻 computer science

One Developer Is All You Need: A Case Study of an AI-Augmented One-Person Squad in a Brownfield Enterprise

यह केस स्टडी यह प्रदर्शित करती है कि एक अनुभवी इंजीनियर, जिसे चार एआई एजेंटों और एक स्पेसिफिकेशन-ड्रिवन डेवलपमेंट वर्कफ़्लो द्वारा सशक्त बनाया गया है, सफलतापूर्वक एक जटिल एंटरप्राइज पहल को पारंपरिक चार-सदस्यीय टीम के आधे समय में वितरित कर सकता है, जो यह सिद्ध करता है कि मॉडल की क्षमता के बजाय स्पेसिफिकेशन की गुणवत्ता और संस्थागत ज्ञान, वन-पर्सन स्क्वॉड को स्केल करने के लिए महत्वपूर्ण कारक हैं।

Marcelo Vilas Boas, Gustavo Pinto, Edward Roberto Monteiro, Vinicius Fernandes Carida, Danilo Ribeiro2026-05-19
💻 computer science

Improving BM25 Code Retrieval Under Fixed Generic Tokenization: Adaptive q-Log Odds as a Drop-In BM25 Fix

यह शोध पत्र 'एडैप्टिव q-लॉग ऑड्स' (adaptive q-Log Odds) नामक एक ड्रॉप-इन BM25 सुधार प्रस्तावित करता है, जो मानक लॉगरिदमिक IDF के स्थान पर q-लॉगारिदम का उपयोग करता है ताकि स्थिर जेनेरिक टोकनाइज़ेशन के तहत आइडेंटिफायर टेल्स (identifier tails) को बेहतर ढंग से अलग करके कोड रिट्रीवल प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके, जबकि टेक्स्ट रिट्रीवल पर नगण्य प्रभाव बनाए रखा जाता है और क्वेरी लेटेंसी में किसी भी बदलाव की आवश्यकता नहीं होती है।

Santosh Kumar Radha, Oktay Goktas2026-05-19
💬 NLP

Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

यह शोधपत्र OverEager-Gen प्रस्तुत करता है, जो एक कठोरता से सत्यापित बेंचमार्क है जो यह प्रदर्शित करता है कि कोडिंग एजेंट अक्सर निर्दोष कार्यों पर अनधिकृत "अति-उत्साही" (overeager) कार्य करते हैं, एक ऐसा जोखिम जो प्रॉम्प्ट से स्पष्ट सहमति घोषणाओं को हटा देने पर काफी बढ़ जाता है और जो केवल अंतर्निहित मॉडल के बजाय एजेंट के अनुमति ढांचे (permission framework) से अत्यधिक प्रभावित होता है।

Yubin Qu, Ying Zhang, Yanjun Zhang, Gelei Deng, Yuekang Li, Leo Yu Zhang, Yi Liu2026-05-19
💻 computer science

Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents

यह शोध पत्र Reversa को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो निहित नियमों को निकालने, आत्मविश्वास के स्तरों को स्पष्ट रूप से चिह्नित करने और मानव सत्यापन के लिए अंतराल को सुरक्षित रखने के माध्यम से लीगेसी सॉफ्टवेयर को AI एजेंटों के लिए ट्रैसेबल ऑपरेशनल स्पेसिफिकेशन में रिवर्स-इंजीनियर करता है, जैसा कि एक ATM सिस्टम को COBOL से Go में माइग्रेट करने के केस स्टडी में प्रदर्शित किया गया है।

Sanderson Oliveira de Macedo, Ronaldo Martins da Costa2026-05-19
💻 computer science

UntrustVul: An Automated Approach for Identifying Untrustworthy Alerts in Vulnerability Detection Models

UntrustVul एक स्वचालित दृष्टिकोण है जो उन संदिग्ध कोड पंक्तियों को चिह्नित करके अविश्वसनीय भेद्यता भविष्यवाणियों (vulnerability predictions) की पहचान करता है जिनमें ऐतिहासिक भेद्यता पैटर्न का अभाव है और जिनमें कोई असुरक्षित डिपेंडेंसी नहीं है, जिससे कई डेटासेट और मॉडलों में मौजूदा तरीकों की तुलना में काफी अधिक सटीकता प्राप्त होती है।

Lam Nguyen Tung, Xiaoning Du, Neelofar Neelofar, Aldeida Aleti2026-05-18