💻 computer science

Testing Framework Migration with Large Language Models

यह शोध पत्र वास्तविक दुनिया के उदाहरणों के एक क्यूरेटेड डेटासेट का उपयोग करके, पायथन टेस्ट सूट्स को \texttt{unittest} से \texttt{Pytest} में माइग्रेट करने को स्वचालित करने में लार्ज लैंग्वेज मॉडल्स (GPT-4o और Claude Sonnet 4) की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि LLMs इस प्रक्रिया को तेज कर सकते हैं, लेकिन लगभग आधे जनरेट किए गए माइग्रेशन विफल हो जाते हैं और मॉडल एवं प्रॉम्पटिंग रणनीति के आधार पर विशिष्ट व्यवहारिक अंतर प्रदर्शित करते हैं।

Altino Alves, João Eduardo Montandon, Andre Hora2026-02-04
💻 computer science

Understanding Bug-Reproducing Tests: A First Empirical Study

यह शोध पत्र 15 पायथन सिस्टम्स के 642 बग-पुनरुत्पादक (bug-reproducing) परीक्षणों का एक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वे आकार और जटिलता में अन्य परीक्षणों के सांख्यिकीय रूप से समान हैं, लेकिन उनमें अधिक अपवाद हैंडलिंग (exception handling) और कमजोर एसेर्शन (weak assertions) होने की प्रवृत्ति होती है, जिसमें विशाल बहुमत एक ही बग को लक्षित करता है।

Andre Hora, Gordon Fraser2026-02-04
💻 computer science

What Do Contribution Guidelines Say About Software Testing?

यह अनुभवजन्य अध्ययन 200 पायथन और जावास्क्रिप्ट ओपन-सोर्स प्रोजेक्ट्स के योगदान दिशानिर्देशों का विश्लेषण करता है जिससे यह पता चलता है कि हालांकि अधिकांश प्रोजेक्ट टेस्ट डॉक्यूमेंटेशन प्रदान करते हैं, लेकिन वे व्यापक मार्गदर्शन देने के बजाय मुख्य रूप से इस बात पर ध्यान केंद्रित करते हैं कि यूनिट टेस्ट कैसे चलाए जाएं, जैसे कि टेस्ट लिखने, कवरेज, या इंटीग्रेशन और एंड-टू-एंड टेस्टिंग रणनीतियों पर विस्तृत मार्गदर्शन प्रदान करना।

Bruna Falcucci, Felipe Gomide, Andre Hora2026-02-04
💻 computer science

Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging

यह शोध पत्र एक नवीन स्व-डीबगिंग डेटा-डिस्टिलेशन दृष्टिकोण प्रस्तावित करता है जो विश्वसनीय चेन-ऑफ-थॉट स्पष्टीकरणों के साथ उच्च-गुणवत्ता वाले यूनिट टेस्ट प्रशिक्षण उदाहरण उत्पन्न करता है, जिसके परिणामस्वरूप एक फाइन-ट्यून्ड मॉडल प्राप्त होता है जो टेस्ट असांशन पास दरों, ब्रांच कवरेज और म्यूटेशन स्कोर में अत्याधुनिक वाणिज्यिक मॉडलों से काफी बेहतर प्रदर्शन करता है।

Ziyue Hua, Tianyu Chen, Yeyun Gong, Shuai Lu, Peng Cheng, Qinglin Zhu, Yibo He, Yingjie Fu, Wenpin Jiao, Wei Yang, Tao X (…)2026-02-04
💻 computer science

Multi-Level Testing of Conversational AI Systems

यह पीएचडी थीसिस कन्वर्सेशनल एआई सिस्टम के लिए एक नए बहु-स्तरीय परीक्षण ढांचे का प्रस्ताव करती है ताकि व्यक्तिगत एआई घटकों से लेकर जटिल मल्टी-एजेंट कार्यान्वयनों तक विभिन्न स्तरों पर घटक तत्वों को मान्य करके मौजूदा समाधानों की सीमाओं को संबोधित किया जा सके।

Elena Masserini2026-02-04
💻 computer science

Reading Between the Code Lines: On the Use of Self-Admitted Technical Debt for Security Analysis

यह शोध पत्र यह प्रदर्शित करता है कि स्व-स्वीकृत तकनीकी ऋण (SATD) टिप्पणियों को स्टेटिक एनालिसिस टूल्स (SATs) के साथ संयोजित करना कवरेज अंतराल को भरकर, अनदेखी भेद्यता श्रेणियों के लिए फॉल्स नेगेटिव को कम करके, और अभ्यासकर्ताओं को सुरक्षा कमजोरियों में गहरे प्रासंगिक अंतर्दृष्टि प्रदान करके स्वचालित सुरक्षा विश्लेषण का प्रभावी ढंग से पूरक बनता है।

Nicolás E. Díaz Ferreyra, Moritz Mock, Max Kretschmann, Barbara Russo, Mojtaba Shahin, Mansooreh Zahedi, Riccardo Scanda (…)2026-02-04
💻 computer science

Flaky Tests in a Large Industrial Database Management System: An Empirical Study of Fixed Issue Reports for SAP HANA

यह शोध पत्र SAP HANA डेटाबेस सिस्टम में फ्लैकी टेस्ट्स (flaky tests) के मूल कारणों को स्वचालित रूप से वर्गीकृत करने के लिए एक LLM-आधारित दृष्टिकोण प्रस्तुत करता है, जिससे यह पता चलता है कि कंकरेंसी (concurrency) संबंधी मुद्दे सबसे प्रचलित कारण हैं और विभिन्न प्रकार के टेस्ट्स के लिए अनुकूलित शमन रणनीतियों (mitigation strategies) की आवश्यकता पर प्रकाश डालता है।

Alexander Berndt, Thomas Bach, Sebastian Baltes2026-02-04
💻 computer science

Beyond the Commit: Developer Perspectives on Productivity with AI Coding Assistants

BNY Mellon में किए गए इस मिश्रित-विधि अध्ययन में, जिसमें 2,989 सर्वेक्षण प्रतिक्रियाएं और 11 साक्षात्कार शामिल हैं, यह तर्क दिया गया है कि AI कोडिंग सहायकों का मूल्यांकन करने के लिए एक समग्र, बहुआयामी दृष्टिकोण की आवश्यकता है जो केवल पारंपरिक अल्पकालिक उत्पादकता मेट्रिक्स पर निर्भर रहने के बजाय तकनीकी विशेषज्ञता और कार्य स्वामित्व जैसे दीर्घकालिक मानव-केंद्रित कारकों को सम्मिलित करता है।

Valerie Chen, Jasmyn He, Behnjamin Williams, Jason Valentino, Ameet Talwalkar2026-02-04
💻 computer science

CALM: A Self-Adaptive Orchestration Approach for QoS-Aware Routing in Small Language Model based Systems

यह शोध पत्र CALM को प्रस्तुत करता है, जो MAPE-K लूप पर आधारित एक स्व-अनुकूली ऑर्केस्ट्रेशन फ्रेमवर्क है, जो सिंगल-LLM बेसलाइन की तुलना में विलंबता (latency) को 40% और ऊर्जा खपत को 50% तक कम करने के लिए कैशिंग और शेड्यूलिंग का लाभ उठाते हुए, उपयोगकर्ता प्रश्नों को विशिष्ट लघु भाषा मॉडलों (SLMs) के एक समन्वित बेड़े की ओर गतिशील रूप से रूट करता है।

Hemang Jain, Divyansh Pandey, Karthik Vaidhyanathan2026-02-04
💻 computer science

SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring

यह शोध पत्र SWE-Refactor को प्रस्तुत करता है, जो 1,099 सत्यापित जावा रिफैक्टरिंग (refactorings) से युक्त एक व्यापक रिपॉजिटरी-स्तरीय बेंचमार्क है, जिसे मौजूदा डेटासेट की सीमाओं को दूर करने और नौ LLMs की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे यह पता चलता है कि वर्तमान मॉडल जटिल, संयुक्त रिफैक्टरिंग कार्यों के साथ काफी संघर्ष करते हैं।

Yisen Xu, Jinqiu Yang, Tse-Hsun, Chen2026-02-04