💻 computer science

Do Code LLMs Do Static Analysis?

यह शोध पत्र इस बात की जांच करता है कि क्या कोड LLMs कोड जनरेशन और समराइजेशन जैसे कार्यों के दौरान स्टैटिक एनालिसिस (static analysis) करते हैं, जिसमें यह पाया गया है कि ये मॉडल स्टैटिक एनालिसिस कार्यों पर खराब प्रदर्शन करते हैं और ऐसे कार्यों पर प्रीट्रेनिंग करने से बेहतर कोड इंटेलिजेंस क्षमताओं में सुधार के लिए सामान्यीकरण (generalize) नहीं होता है।

Chia-Yi Su, Collin McMillan2026-03-27
💻 computer science

Hallucination to Consensus: Multi-Agent LLMs for End-to-End JUnit Test Generation

यह शोधपत्र CANDOR को प्रस्तुत करता है, जो एक नवीन प्रॉम्प्ट इंजीनियरिंग-आधारित मल्टी-एजेंट LLM फ्रेमवर्क है जो जावा में उच्च-गुणवत्ता वाले, मतिभ्रम-प्रतिरोधी (hallucination-resistant) JUnit टेस्ट उत्पन्न करने के लिए सर्वसम्मति-संचालित तर्क और एक ड्यूल-LLM पाइपलाइन का लाभ उठाता है, जो ओरेकल शुद्धता और म्यूटेशन स्कोर में मौजूदा फाइन-ट्यूनिंग और खोज-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Qinghua Xu, Guancheng Wang, Lionel Briand, Kui Liu2026-03-27
💻 computer science

IssueGuard: Real-Time Secret Leak Prevention Tool for GitHub Issue Reports

यह शोध पत्र IssueGuard को प्रस्तुत करता है, जो एक क्रोम एक्सटेंशन है जो रिगैक्स (regex)-आधारित निष्कर्षण को एक फाइन-ट्यून्ड CodeBERT मॉडल के साथ जोड़कर GitHub और GitLab इश्यू रिपोर्ट्स में अनजाने में होने वाले सीक्रेट लीक को रोकता है, जिससे 92.70% F1-स्कोर के साथ रीयल-टाइम डिटेक्शन और विजुअल चेतावनियाँ प्रदान की जाती हैं।

Md Nafiu Rahman, Sadif Ahmed, Zahin Wahab, Gias Uddin, Rifat Shahriyar2026-03-27
💻 computer science

TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis

यह शोधपत्र TRAJEVAL को पेश करता है, जो एक नैदानिक ढांचा (diagnostic framework) है जो कोड एजेंट के प्रक्षेप पथों (trajectories) को खोज (search), पढ़ने (read) और संपादन (edit) चरणों में विभाजित करता है ताकि सूक्ष्म-स्तरीय विफलता विश्लेषण प्रदान किया जा सके, जिससे सार्वभौमिक अक्षमताओं और विशिष्ट मॉडल-विशिष्ट कमजोरियों का खुलासा होता है और साथ ही ऐसा सुधारात्मक फीडबैक सक्षम होता है जो एजेंट के प्रदर्शन में उल्लेखनीय सुधार करता है और लागत को कम करता है।

Myeongsoo Kim, Dingmin Wang, Siwei Cui, Farima Farmahinifarahani, Shweta Garg, Baishakhi Ray, Terry Yue Zhuo, Rajdeep Mu (…)2026-03-27
💻 computer science

IndustriConnect: MCP Adapters and Mock-First Evaluation for AI-Assisted Industrial Operations

यह शोध पत्र IndustriConnect को प्रस्तुत करता है, जो मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) एडेप्टर का एक प्रोटोटाइप सूट है जो AI सहायकों को एक मॉक-फर्स्ट मूल्यांकन वर्कफ़्लो के माध्यम से Modbus, MQTT/Sparkplug B और OPC UA जैसे औद्योगिक प्रोटोकॉल के साथ सुरक्षित रूप से इंटरैक्ट करने में सक्षम बनाता है, जो सामान्य संचालन, फॉल्ट इंजेक्शन, स्ट्रेस टेस्टिंग और रिकवरी परिदृश्यों को कवर करने वाले 870 रन में मजबूत प्रदर्शन का प्रदर्शन करता है।

Melwin Xavier, Melveena Jolly, Vaisakh M A, Midhun Xavier2026-03-27
💬 NLP

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

यह शोधपत्र SlopCodeBench प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह दर्शाता है कि वर्तमान कोडिंग एजेंट लंबी अवधि के पुनरावृत्ति कार्यों (long-horizon iterative tasks) में व्यवस्थित रूप से विफल होते हैं, क्योंकि वे बढ़ती हुई शब्द-बहुलता (verbosity) और संरचनात्मक क्षरण (structural erosion) के माध्यम से कोड की गुणवत्ता में निरंतर गिरावट प्रदर्शित करते हैं, एक ऐसी समस्या जिसे पास-रेट बेंचमार्क पकड़ने में विफल रहते हैं।

Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghou (…)2026-03-27
💻 computer science

Bridging the Gap Between Agility and Planning

यह शोध पत्र माइलस्टोन ड्रिवन एजिल एक्जीक्यूशन (MDAX) को प्रस्तुत करता है, जो एक मेथड-अग्नोस्टिक हाइब्रिड फ्रेमवर्क है जो एजिल के एम्पिरिकल कंट्रोल को बनाए रखते हुए बैकलॉग प्रायोरिटाइजेशन को रणनीतिक माइलस्टोन योजनाओं के साथ संरेखित करता है ताकि चपलता (एजिलिटी) और दीर्घकालिक योजना के बीच के अंतर को पाटा जा सके।

Eduardo Miranda2026-03-27
💻 computer science

From Untestable to Testable: Metamorphic Testing in the Age of LLMs

यह शोध पत्र स्केलेबल ग्राउंड ट्रुथ (scalable ground truth) की अनुपस्थिति में अविश्वसनीय LLM-एकीकृत प्रणालियों के परीक्षण की चुनौती को संबोधित करने के लिए मेटामॉर्फिक टेस्टिंग (Metamorphic Testing) का प्रस्ताव करता है, जो निष्पादन योग्य टेस्ट ओरेकल (executable test oracles) बनाने के लिए कई परीक्षण निष्पादनों के बीच संबंधों का उपयोग करता है।

Valerio Terragni2026-03-27
💻 computer science

Governance in Practice: How Open Source Projects Define and Document Roles

यह शोध पत्र संस्थागत व्याकरण (इन्स्टीट्यूशनल ग्रामर) का उपयोग करते हुए इस बात का अनुभवजन्य विश्लेषण करता है कि ओपन सोर्स प्रोजेक्ट्स लिखित कलाकृतियों में शासन भूमिकाओं को कैसे संहिताबद्ध करते हैं, जो भूमिका परिभाषाओं में विसंगतियों ("रोल ड्रिफ्ट") और कुछ ही व्यक्तियों में विविध जिम्मेदारियों के संकेंद्रण ("मेंटेनर पैराडॉक्स") को प्रकट करता है ताकि स्पष्ट भूमिका डिजाइन और सामुदायिक स्थिरता के लिए वितरित नेतृत्व की वकालत की जा सके।

Pedro Oliveira, Tayana Conte, Marco Gerosa, Igor Steinmacher2026-03-27
🤖 machine learning

MobileDev-Bench: A Comprehensive Benchmark for Evaluating Language Models on Mobile Application Development

MobileDev-Bench एक व्यापक बेंचमार्क है जिसमें Android Native, React Native और Flutter प्लेटफॉर्म्स के 384 वास्तविक दुनिया के समस्या-समाधान कार्य शामिल हैं जो अत्याधुनिक LLMs में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है, जहाँ एंड-टू-एंड समाधान दर 3.39%–5.21% जितनी कम है, जिसका मुख्य कारण मल्टी-फाइल और मल्टी-आर्टिफैक्ट परिवर्तनों में फॉल्ट लोकलाइजेशन (दोष स्थानीयकरण) की चुनौतियाँ हैं।

Moshood A. Fakorede, Krishna Upadhyay, A. B. Siddique, Umar Farooq2026-03-27