💻 computer science

Scenario-based System Testing for Distributed Robotics Applications

यह शोध पत्र सिनैरियो स्पेसिफिकेशन लैंग्वेज (SCSL) को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जिसे जटिल, गतिशील वितरित रोबोटिक्स के लिए सिस्टम-स्तरीय परीक्षण को स्वचालित करने के लिए डिज़ाइन किया गया है, ताकि ऑनलाइन निष्पादन के माध्यम से उच्च जटिलता, अनिश्चितता और रनटाइम पुनर्गठन को संभालने के लिए मौलिक परिदृश्यों (एलिमेंट्री सिनैरियोज़) को संयोजित किया जा सके।

Jan Peleska, Felix Brüning, Wen-Ling Huang, Anne E. Haxthausen2026-04-29
💻 computer science

Can Code Evaluation Metrics Detect Code Plagiarism?

यह शोध पत्र अनुभवजन्य रूप से प्रदर्शित करता है कि कोड मूल्यांकन मेट्रिक्स, विशेष रूप से क्रिस्टलब्लू (CrystalBLEU), विभिन्न संशोधन स्तरों में सोर्स कोड प्लेजरिज्म (साहित्यिक चोरी) का प्रभावी ढंग से पता लगा सकते हैं और अक्सर प्रीप्रोसेसिंग लागू होने पर डोलोस (Dolos) और जेप्लैग (JPlag) जैसे समर्पित प्लेजरिज्म डिटेक्शन टूल्स से बेहतर या उनके बराबर प्रदर्शन करते हैं।

Fahad Ebrahim (The University of Warwick), Mike Joy (The University of Warwick)2026-04-29
💻 computer science

RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements

यह शोधपत्र RESTestBench प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसमें सटीक और अस्पष्ट प्राकृतिक भाषा संबंधी आवश्यकताओं वाले REST सेवाएँ शामिल हैं ताकि एक नए आवश्यकता-आधारित उत्परिवर्तन मीट्रिक (mutation metric) का उपयोग करके LLM-जनित परीक्षण मामलों का मूल्यांकन किया जा सके, जो यह प्रकट करता है कि दोषपूर्ण सिस्टम कार्यान्वयन द्वारा निर्देशित परिशोधन (refinement), विशेष रूप से अस्पष्ट आवश्यकताओं के लिए, परीक्षण प्रभावशीलता को महत्वपूर्ण रूप से कम कर सकता है।

Leon Kogler, Stefan Hangler, Maximilian Ehrhart, Benedikt Dornauer, Roland Wuersching, Peter Schrammel2026-04-29
🤖 machine learning

Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models

यह शोध पत्र कार्बन-टैक्स्ड ट्रांसफॉर्मर्स (CTT) को प्रस्तुत करता है, जो आर्थिक कार्बन कराधान सिद्धांतों से प्रेरित एक व्यवस्थित मल्टी-आर्किटेक्चरल संपीड़न पाइपलाइन है, जो उच्च सटीकता को बनाए रखते हुए सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए लार्ज लैंग्वेज मॉडल्स की मेमोरी, अनुमान समय और कार्बन उत्सर्जन को महत्वपूर्ण रूप से कम करता है।

Ajmain Inqiad Alam, Palash Roy, Chanchal K. Roy, Banani Roy, Kevin A. Schneider2026-04-29
💻 computer science

Ranking Plausible Patches by Historic Feature Frequencies

यह शोध पत्र PrevaRank प्रस्तुत करता है, जो एक स्केलेबल तकनीक है जो सही ऑटोमेटेड प्रोग्राम रिपेयर पैच की रैंकिंग में सुधार करती है, ऐतिहासिक रूप से प्रोग्रामर द्वारा लिखे गए फिक्सेस के साथ उनकी फीचर समानता के आधार पर उन्हें प्राथमिकता देकर, जिससे शीर्ष स्थानों के भीतर सही समाधान दिखने की संभावना काफी बढ़ जाती है।

Shifat Sahariar Bhuiyan, Abhishek Tiwari, Yu Pei, Carlo A. Furia2026-04-28
💻 computer science

CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging

यह शोधपत्र CodeSim को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट फ्रेमवर्क है जो सात चुनौतीपूर्ण बेंचमार्क में योजना सत्यापन (plan verification) और आंतरिक डिबगिंग के लिए एक मानव-समान, सिमुलेशन-संचालित दृष्टिकोण का उपयोग करके अत्याधुनिक कोड जनरेशन प्रदर्शन प्राप्त करता है।

Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez2026-04-28
💻 computer science

What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts

यह शोध पत्र LLMs में प्रॉम्प्ट अंडरस्पेसिफिकेशन (prompt underspecification) की नाजुकता का विश्लेषण करता है, यह प्रदर्शित करते हुए कि हालांकि मॉडल अक्सर लुप्त आवश्यकताओं का अनुमान लगा लेते हैं, लेकिन इससे अस्थिर प्रदर्शन होता है जिसे सरल विशिष्टता या मानक ऑप्टिमाइज़र द्वारा विश्वसनीय रूप से ठीक नहीं किया जा सकता है, जो लेखकों को आवश्यकताओं-जागरूक अनुकूलन तंत्र (requirements-aware optimization mechanisms) और सक्रिय आवश्यकता प्रबंधन के लिए एक व्यवस्थित प्रक्रिया प्रस्तावित करने के लिए प्रेरित करता है।

Chenyang Yang, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu2026-04-28
💻 computer science

SWE-QA: Can Language Models Answer Repository-level Code Questions?

यह शोध पत्र SWE-QA को प्रस्तुत करता है, जो 77,100 GitHub इश्यूज से व्युत्पन्न एक रिपॉजिटरी-स्तरीय कोड प्रश्न उत्तर बेंचमार्क है, जो 576 प्रश्नों के एक क्यूरेटेड सेट और एक संबद्ध एजेंटिक फ्रेमवर्क के माध्यम से जटिल, बहु-फ़ाइल तर्क कार्यों पर LLMs का मूल्यांकन करके मौजूदा स्निपेट-आधारित डेटासेट्स की सीमाओं को संबोधित करता है।

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu2026-04-28
💻 computer science

CoRaCMG: Contextual Retrieval-Augmented Framework for Commit Message Generation

यह शोधपत्र CoRaCMG को प्रस्तुत करता है, जो एक प्रासंगिक रिट्रीवल-ऑगमेंटेड फ्रेमवर्क है जो समान डिफ-मैसेज (diff-message) युग्मों को पुनः प्राप्त करके और उन्हें एकीकृत करके बड़े भाषा मॉडल (large language models) को प्रोजेक्ट-विशिष्ट शब्दावली अपनाने और लेखन शैली अपनाने के लिए निर्देशित करके, स्वचालित रूप से जनरेट किए गए कमिट संदेशों की गुणवत्ता में महत्वपूर्ण सुधार करता है।

Bo Xiong, Linghao Zhang, Zongen Ren, Chong Wang, Peng Liang2026-04-28
🤖 machine learning

MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation

यह शोधपत्र MermaidSeqभेंच (MermaidSeqBench) को प्रस्तुत करता है, जो 132 मानव-सत्यापित और सिंथेटिक रूप से विस्तारित नमूनों से बना एक नया बेंचमार्क है, जिसे सूक्ष्म (fine-grained), LLM-एज़-अ-जज मेट्रिक्स का उपयोग करके प्राकृतिक भाषा विवरणों से सटीक रूप से मर्मेड (Mermaid) अनुक्रम आरेख उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Basel Shbita, Farhan Ahmed, Chad DeLuca2026-04-28