💻 computer science

Reliability of Large Language Models for Design Synthesis: An Empirical Study of Variance, Prompt Sensitivity, and Method Scaffolding

यह अनुभवजन्य अध्ययन प्राकृतिक भाषा से ऑब्जेक्ट-ओरिएंटेड UML डिज़ाइनों को संश्लेषित करने में तीन लार्ज लैंग्वेज मॉडल्स की विश्वसनीयता का मूल्यांकन करता है, जिसमें यह पाया गया कि हालांकि प्राथमिकता-आधारित प्रॉम्प्टिंग डिज़ाइन सिद्धांतों के पालन में सुधार करती है, लेकिन यह गैर-नियतता (non-determinism) को पूरी तरह से समाप्त नहीं कर सकती या डिज़ाइन गुणवत्ता में महत्वपूर्ण मॉडल-निर्भर विविधताओं को दूर नहीं कर सकती।

Rabia Iftikhar, Andreas Rausch2026-04-07
💻 computer science

KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents

KAIJU एक सिस्टम-लेवल फ्रेमवर्क पेश करता है जो एक एक्जीक्यूटिव कर्नल और इंटेंट-गेटेड एक्जीक्यूशन (IGX) प्रतिमान के माध्यम से LLM रीजनिंग को निष्पादन (execution) से अलग करता है, जो पारंपरिक ReAct एजेंटों की तुलना में समानांतर टूल शेड्यूलिंग, मल्टी-वेरिएबल ऑथोराइजेशन के माध्यम से उन्नत सुरक्षा, और जटिल, डेटा-गहन कार्यों पर बेहतर प्रदर्शन सक्षम करता है।

Cormac Guerin, Frank Guerin2026-04-07
💻 computer science

Beyond Resolution Rates: Behavioral Drivers of Coding Agent Success and Failure

9,374 कोडिंग एजेंट प्रक्षेप पथों (trajectories) का यह बड़े पैमाने पर अनुभवजन्य अध्ययन यह प्रकट करता है कि जबकि पैच जटिलता कार्य की कठिनाई को समझाने में विफल रहती है, सफलता मुख्य रूप से अंतर्निहित LLM की क्षमताओं और प्री-एडिटिंग संदर्भ संग्रह एवं सत्यापन जैसी विशिष्ट व्यवहार संबंधी रणनीतियों द्वारा संचालित होती है, न कि फ्रेमवर्क डिज़ाइन या सरल प्रक्षेप पथ लंबाई द्वारा।

Tural Mehtiyev, Wesley Assunção2026-04-07
💻 computer science

AgentSZZ: Teaching the LLM Agent to Play Detective with Bug-Inducing Commits

AgentSZZ एक LLM-संचालित एजेंट फ्रेमवर्क है जो एक ReAct-शैली के लूप, डोमेन-विशिष्ट टूल्स और एक संरचित संपीड़न मॉड्यूल का उपयोग करके मौजूदा SZZ एल्गोरिदम से बेहतर प्रदर्शन करता है ताकि बग-प्रेरित कमिट्स को प्रभावी ढंग से ट्रैक किया जा सके, विशेष रूप से क्रॉस-फाइल और घोस्ट मामलों जैसे चुनौतीपूर्ण परिदृश्यों में जहाँ पारंपरिक तरीके विफल हो जाते हैं।

Yunbo Lyu, Jieke Shi, Hong Jin Kang, Ratnadira Widyasari, Junda He, Yuqing Niu, Chengran Yang, Junkai Chen, Zhou Yang, J (…)2026-04-07
💻 computer science

An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models

यह अनुभवजन्य अध्ययन प्रॉम्प्ट-संचालित यूनिट-टेस्ट जनरेशन में लघु भाषा मॉडलों (2B-8B पैरामीटर) के पर्यावरणीय प्रभाव और प्रदर्शन संबंधी ट्रेड-ऑफ्स की जांच करता है, जो यह प्रकट करता है कि मॉडल का चयन और प्रॉम्प्ट संरचना ऊर्जा खपत, कार्बन उत्सर्जन और टेस्ट कवरेज को महत्वपूर्ण रूप से प्रभावित करती है।

Pragati Kumari, Novarun Deb2026-04-07
💻 computer science

Sustainability Analysis of Prompt Strategies for SLM-based Automated Test Generation

यह शोध पत्र स्मॉल लैंग्वेज मॉडल्स का उपयोग करके स्वचालित परीक्षण जनरेशन के लिए प्रॉम्प्ट इंजीनियरिंग रणनीतियों का पहला व्यवस्थित स्थिरता मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि तर्क-गहन (reasoning-intensive) प्रॉम्प्ट परीक्षण कवरेज में सुधार करते हैं, सरल रणनीतियाँ गुणवत्ता और संसाधन खपत के बीच अधिक पर्यावरण के अनुकूल टिकाऊ संतुलन प्रदान करती हैं।

Pragati Kumari, Novarun Deb2026-04-07
💻 computer science

Evaluating the Environmental Impact of using SLMs and Prompt Engineering for Code Generation

यह शोध पत्र पहला व्यवस्थित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि विशिष्ट प्रॉम्प्ट इंजीनियरिंग रणनीतियाँ, विशेष रूप से चेन-ऑफ-थॉट (Chain-of-Thought), स्मॉल लैंग्वेज मॉडल्स (Small Language Models) में कोड जनरेशन सटीकता और पर्यावरणीय स्थिरता के बीच के संतुलन को अनुकूलित कर सकती हैं, जबकि यह भी रेखांकित करता है कि क्षेत्रीय ग्रिड कार्बन तीव्रता परिनियोजन उत्सर्जन का प्रमुख कारक है।

Md Afif Al Mamun, Sayan Nath, Gias Uddin, Novarun Deb2026-04-07
💻 computer science

Combining Static Code Analysis and Large Language Models Improves Correctness and Performance of Algorithm Recognition

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडलों (large language models) को हल्के स्टेटिक कोड विश्लेषण (lightweight static code analysis) के साथ संयोजित करने से एल्गोरिदम पहचान की सटीकता और रनटाइम दक्षता में उल्लेखनीय सुधार होता है और एलएलएम (LLM) पर निर्भरता कम होती है, भले ही वेरिएबल के नाम अस्पष्ट (obfuscated) क्यों न हों।

Denis Neumüller, Sebastian Boll, David Schüler, Matthias Tichy2026-04-07
💻 computer science

Proceedings of the 7th Workshop on Models for Formal Analysis of Real Systems

यह शोधपत्र ट्यूरिन, इटली में आयोजित 7वें 'मॉडेल्स फॉर फॉर्मल एनालिसिस ऑफ रियल सिस्टम्स' (MARS 2026) के कार्यवाही विवरण को प्रस्तुत करता है, जिसका उद्देश्य मानक अनुसंधान में अक्सर छोड़े जाने वाले बहुमूल्य सबक साझा करने के लिए सत्यापन परिणामों के बजाय जटिल प्रणालियों के विस्तृत मॉडलिंग को प्राथमिकता देकर सैद्धांतिक औपचारिकताओं और वास्तविक दुनिया के अनुप्रयोगों के बीच के अंतर को पाटना है।

Maurice H. ter Beek (CNR-ISTI, Pisa, Italy), Gregor Gössler (INRIA,Univ. Grenoble Alpes, Grenoble, France)2026-04-07
💻 computer science

From Industry Claims to Empirical Reality: An Empirical Study of Code Review Agents in Pull Requests

19,450 पुल रिक्वेस्ट का यह अनुभवजन्य अध्ययन प्रकट करता है कि कोड रिव्यू एजेंट (CRAs), कम-संकेत वाले फीडबैक के कारण, मानव समीक्षकों की तुलना में काफी कम मर्ज दर और उच्च परित्याग दर प्राप्त करते हैं, जो यह दर्शाता है कि CRAs को विकास वर्कफ़्लो में मानवीय निरीक्षण को बदलने के बजाय उसका पूरक बनना चाहिए।

Kowshik Chowdhury, Dipayan Banik, K M Ferdous, Shazibul Islam Shamim2026-04-07