💻 computer science

Beyond the Prompt: Assessing Domain Knowledge Strategies for High-Dimensional LLM Optimization in Software Engineering

यह शोध पत्र इस बात की जांच करता है कि कैसे चार विशिष्ट आर्किटेक्चर के माध्यम से डोमेन ज्ञान को एकीकृत करना—जिसमें 'ह्यूमन-इन-द-लूप प्रॉम्प्टिंग' से लेकर हाइब्रिड सांख्यिकीय-RAG दृष्टिकोण तक शामिल हैं—लार्ज लैंग्वेज मॉडल्स को उन उच्च-आयामी सॉफ्टवेयर इंजीनियरिंग अनुकूलन कार्यों के लिए प्रभावी ढंग से 'वॉर्म स्टार्ट' उत्पन्न करने में सक्षम बना सकता है जहाँ वे वर्तमान में बेयसियन विधियों की तुलना में कम प्रदर्शन करते हैं।

Srinath Srinivasan, Tim Menzies2026-02-04
💻 computer science

Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework

25 GitHub प्रोजेक्ट्स के एक अनुभवजन्य अध्ययन के माध्यम से, यह शोध पत्र प्रकट करता है कि LLM कोड जनरेशन संवर्धन रणनीतियों की प्रभावशीलता विफलता के प्रकार के आधार पर काफी भिन्न होती है, जिससे एक प्रस्तावित निर्णय ढांचा सामने आता है जो चिकित्सकों को कार्य पूर्णता को अधिकतम करने के लिए विशिष्ट विफलता विशेषताओं के आधार पर इष्टतम विधि—जैसे कि RAG या सेल्फ-क्रिटिक—चुनने में मार्गदर्शन करता है।

Jianru Shen, Zedong Peng, Lucy Owen2026-02-04
💻 computer science

Testing Framework Migration with Large Language Models

यह शोध पत्र वास्तविक दुनिया के उदाहरणों के एक क्यूरेटेड डेटासेट का उपयोग करके, पायथन टेस्ट सूट्स को \texttt{unittest} से \texttt{Pytest} में माइग्रेट करने को स्वचालित करने में लार्ज लैंग्वेज मॉडल्स (GPT-4o और Claude Sonnet 4) की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि LLMs इस प्रक्रिया को तेज कर सकते हैं, लेकिन लगभग आधे जनरेट किए गए माइग्रेशन विफल हो जाते हैं और मॉडल एवं प्रॉम्पटिंग रणनीति के आधार पर विशिष्ट व्यवहारिक अंतर प्रदर्शित करते हैं।

Altino Alves, João Eduardo Montandon, Andre Hora2026-02-04
💻 computer science

Understanding Bug-Reproducing Tests: A First Empirical Study

यह शोध पत्र 15 पायथन सिस्टम्स के 642 बग-पुनरुत्पादक (bug-reproducing) परीक्षणों का एक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वे आकार और जटिलता में अन्य परीक्षणों के सांख्यिकीय रूप से समान हैं, लेकिन उनमें अधिक अपवाद हैंडलिंग (exception handling) और कमजोर एसेर्शन (weak assertions) होने की प्रवृत्ति होती है, जिसमें विशाल बहुमत एक ही बग को लक्षित करता है।

Andre Hora, Gordon Fraser2026-02-04
💻 computer science

What Do Contribution Guidelines Say About Software Testing?

यह अनुभवजन्य अध्ययन 200 पायथन और जावास्क्रिप्ट ओपन-सोर्स प्रोजेक्ट्स के योगदान दिशानिर्देशों का विश्लेषण करता है जिससे यह पता चलता है कि हालांकि अधिकांश प्रोजेक्ट टेस्ट डॉक्यूमेंटेशन प्रदान करते हैं, लेकिन वे व्यापक मार्गदर्शन देने के बजाय मुख्य रूप से इस बात पर ध्यान केंद्रित करते हैं कि यूनिट टेस्ट कैसे चलाए जाएं, जैसे कि टेस्ट लिखने, कवरेज, या इंटीग्रेशन और एंड-टू-एंड टेस्टिंग रणनीतियों पर विस्तृत मार्गदर्शन प्रदान करना।

Bruna Falcucci, Felipe Gomide, Andre Hora2026-02-04
💻 computer science

Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging

यह शोध पत्र एक नवीन स्व-डीबगिंग डेटा-डिस्टिलेशन दृष्टिकोण प्रस्तावित करता है जो विश्वसनीय चेन-ऑफ-थॉट स्पष्टीकरणों के साथ उच्च-गुणवत्ता वाले यूनिट टेस्ट प्रशिक्षण उदाहरण उत्पन्न करता है, जिसके परिणामस्वरूप एक फाइन-ट्यून्ड मॉडल प्राप्त होता है जो टेस्ट असांशन पास दरों, ब्रांच कवरेज और म्यूटेशन स्कोर में अत्याधुनिक वाणिज्यिक मॉडलों से काफी बेहतर प्रदर्शन करता है।

Ziyue Hua, Tianyu Chen, Yeyun Gong, Shuai Lu, Peng Cheng, Qinglin Zhu, Yibo He, Yingjie Fu, Wenpin Jiao, Wei Yang, Tao X (…)2026-02-04
💻 computer science

Multi-Level Testing of Conversational AI Systems

यह पीएचडी थीसिस कन्वर्सेशनल एआई सिस्टम के लिए एक नए बहु-स्तरीय परीक्षण ढांचे का प्रस्ताव करती है ताकि व्यक्तिगत एआई घटकों से लेकर जटिल मल्टी-एजेंट कार्यान्वयनों तक विभिन्न स्तरों पर घटक तत्वों को मान्य करके मौजूदा समाधानों की सीमाओं को संबोधित किया जा सके।

Elena Masserini2026-02-04
💻 computer science

Reading Between the Code Lines: On the Use of Self-Admitted Technical Debt for Security Analysis

यह शोध पत्र यह प्रदर्शित करता है कि स्व-स्वीकृत तकनीकी ऋण (SATD) टिप्पणियों को स्टेटिक एनालिसिस टूल्स (SATs) के साथ संयोजित करना कवरेज अंतराल को भरकर, अनदेखी भेद्यता श्रेणियों के लिए फॉल्स नेगेटिव को कम करके, और अभ्यासकर्ताओं को सुरक्षा कमजोरियों में गहरे प्रासंगिक अंतर्दृष्टि प्रदान करके स्वचालित सुरक्षा विश्लेषण का प्रभावी ढंग से पूरक बनता है।

Nicolás E. Díaz Ferreyra, Moritz Mock, Max Kretschmann, Barbara Russo, Mojtaba Shahin, Mansooreh Zahedi, Riccardo Scanda (…)2026-02-04
💻 computer science

Flaky Tests in a Large Industrial Database Management System: An Empirical Study of Fixed Issue Reports for SAP HANA

यह शोध पत्र SAP HANA डेटाबेस सिस्टम में फ्लैकी टेस्ट्स (flaky tests) के मूल कारणों को स्वचालित रूप से वर्गीकृत करने के लिए एक LLM-आधारित दृष्टिकोण प्रस्तुत करता है, जिससे यह पता चलता है कि कंकरेंसी (concurrency) संबंधी मुद्दे सबसे प्रचलित कारण हैं और विभिन्न प्रकार के टेस्ट्स के लिए अनुकूलित शमन रणनीतियों (mitigation strategies) की आवश्यकता पर प्रकाश डालता है।

Alexander Berndt, Thomas Bach, Sebastian Baltes2026-02-04
💻 computer science

Beyond the Commit: Developer Perspectives on Productivity with AI Coding Assistants

BNY Mellon में किए गए इस मिश्रित-विधि अध्ययन में, जिसमें 2,989 सर्वेक्षण प्रतिक्रियाएं और 11 साक्षात्कार शामिल हैं, यह तर्क दिया गया है कि AI कोडिंग सहायकों का मूल्यांकन करने के लिए एक समग्र, बहुआयामी दृष्टिकोण की आवश्यकता है जो केवल पारंपरिक अल्पकालिक उत्पादकता मेट्रिक्स पर निर्भर रहने के बजाय तकनीकी विशेषज्ञता और कार्य स्वामित्व जैसे दीर्घकालिक मानव-केंद्रित कारकों को सम्मिलित करता है।

Valerie Chen, Jasmyn He, Behnjamin Williams, Jason Valentino, Ameet Talwalkar2026-02-04