💻 computer science

BashCoder-R1: Towards Robust and Explainable Bash Code Generation with Robustness-Aware Group Relative Policy Optimization

BashCoder-R1 एक नवीन फ्रेमवर्क है जो निरंतर पूर्व-प्रशिक्षण (continual pre-training), लंबी श्रृंखला-सोच (long chain-of-thought) आधारित सुपरवाइज्ड फाइन-ट्यूनिंग और एक मजबूती-जागरूक सुदृढीकरण लर्निंग (robustness-aware reinforcement learning) रणनीति को जोड़कर बाश (Bash) स्क्रिप्ट जनरेशन की मजबूती और व्याख्यात्मकता को बढ़ाता है, जिससे नए BashBench बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Lei Yu, Peng Wang, Jia Xu, Jingyuan Zhang, Xin Wang, Jiajia Ma, Li Yang, Changzhi Deng, Zenghua Wang, Fengjun Zhang2026-06-29
💻 computer science

The ARDoCo Tool Landscape: REST API, TraceView, and TraceViz for Architecture Traceability

यह शोध पत्र ARDoCo टूल लैंडस्केप प्रस्तुत करता है, जो एक REST API, एक ब्राउज़र-आधारित फ्रंटएंड (TraceView), और एक VS Code एक्सटेंशन (TraceViz) से युक्त एक सार्वजनिक रूप से उपलब्ध सुइट है, जो अत्याधुनिक ट्रेसबिलिटी लिंक रिकवरी को डेवलपर्स और आर्किटेक्ट्स के लिए सुलभ बनाता है और इन-IDE विज़ुअलाइज़ेशन के माध्यम से बेहतर समझ प्रदर्शित करता है।

Jan Keim, Dominik Fuchß, Sophie Corallo, Tobias Hey, Julian Winter, Kevin Feichtinger2026-06-29
💻 computer science

How Humans, Bots, and Agents Communicate About Vulnerabilities in Pull Requests

यह पंजीकृत रिपोर्ट एक बड़े पैमाने के अनुभवजन्य अध्ययन की रूपरेखा प्रस्तुत करती है जो विभिन्न प्रोजेक्ट आर्टिफैक्ट्स में स्पष्ट पहचानकर्ताओं और अंतर्निहित सुरक्षा भाषा दोनों का विश्लेषण करके यह जांचती है कि मानव, बॉट्स और कोडिंग एजेंट पुल रिक्वेस्ट में कमजोरियों के बारे में कैसे संवाद करते हैं ताकि समीक्षा परिणामों पर उनके प्रभाव को समझा जा सके।

Pien Rooijendijk, Christoph Treude, Mairieli Wessel2026-06-29
💻 computer science

CrossLangFuzzer: Differential Testing of Cross-Language JVM Compilers

यह शोध पत्र CrossLangFuzzer को प्रस्तुत करता है, जो पहला डिफरेंशियल टेस्टिंग फ्रेमवर्क है जो क्रॉस-लैंग्वेज टेस्ट प्रोग्रामों को संश्लेषित करने के लिए कोटलिन कंपाइलर के यूनिफाइड इंटरमीडिएट रिप्रेजेंटेशन और म्यूटेशन ऑपरेटर्स का लाभ उठाता है, जिसने पांच प्रमुख JVM कंपाइलरों में 32 पुष्ट बग्स को सफलतापूर्वक उजागर किया है।

Xiaotian Ma, Qiong Feng, Yongqiang Tian, Wei Song, Peng Liang2026-06-29
💻 computer science

Large Language Models for Mobile GUI Text Input Generation: An Empirical Study

यह शोध पत्र 115 वास्तविक दुनिया के एंड्रॉइड ऐप्स पर नौ अत्याधुनिक एलएलएम (LLMs) का मूल्यांकन करने वाला एक बड़े पैमाने का अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि निकाले गए टेक्स्ट और एक्सएमएल (XML)-आधारित यूआई (UI) संदर्भ, कम लागत पर विजन-आधारित इनपुट के समान टेक्स्ट-इनपुट जनरेशन सफलता दर प्राप्त करते हैं, जबकि फीडबैक तंत्र और मानवीय हस्तक्षेप दोनों ही पेज-पास-थ्रू दरों और बग-डिटेक्शन क्षमताओं को महत्वपूर्ण रूप से बढ़ाते हैं।

Chenhui Cui, Tao Li, Junjie Wang, Chunyang Chen, Dave Towey, Rubing Huang2026-06-26
💻 computer science

LLMCFG-TGen: Using LLM-Generated Control Flow Graphs to Automatically Create Test Cases from Use Cases

यह शोध पत्र LLMCFG-TGen का प्रस्ताव करता है, जो एक एंड-टू-एंड दृष्टिकोण है जो प्राकृतिक भाषा उपयोग-मामला विवरणों (use-case descriptions) को संरचित कंट्रोल फ्लो ग्राफ (Control Flow Graphs) में बदलने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे मौजूदा एलएलएम-आधारित परीक्षण पीढ़ी विधियों की सीमाओं को दूर करने के लिए व्यापक और तार्किक रूप से सुसंगत परीक्षण मामले स्वतः निकाले जा सकें।

Zhenzhen Yang, Chenhui Cui, Tao Li, Rubing Huang, Nan Niu, Dave Towey, Shikai Guo2026-06-26
💻 computer science

Towards Safety-Aware Mutation Testing for Autonomous Driving Systems

यह विज़न पेपर सेफ्टी-अवेयर म्यूटेशन टेस्टिंग (SAMT) का प्रस्ताव करता है, जो स्वायत्त ड्राइविंग सिस्टम (Autonomous Driving Systems) के लिए एक प्रतिमान परिवर्तन (paradigm shift) है, जो पारंपरिक घटक-स्तरीय उत्परिवर्तनों (component-level mutations) पर निर्भर रहने के बजाय STPA जैसे सुरक्षा इंजीनियरिंग फ्रेमवर्क के आधार पर इंटर-मॉड्यूल संदेशों में व्यवस्थित रूप से टेम्पोरली बाउंडेड फॉल्ट्स (temporally bounded faults) इंजेक्ट करके टेस्ट पर्याप्तता को बढ़ाता है।

Donghwan Shin2026-06-26
🤖 AI

An Empirical Study of LLM-Generated Specifications for VeriFast

यह शोध पत्र 303 C फलनों (functions) के लिए VeriFast विनिर्देशों (specifications) को उत्पन्न करने में आठ प्रॉम्प्टिंग रणनीतियों के माध्यम से दस लार्ज लैंग्वेज मॉडल्स की प्रभावशीलता का अनुभवजन्य मूल्यांकन करता है, जिससे यह स्पष्ट होता है कि जबकि LLMs कार्यात्मक व्यवहार को बनाए रखते हैं, वे मुख्य रूप से डोमेन-विशिष्ट सेपरेशन लॉजिक ज्ञान में त्रुटियों के कारण केवल मामूली सत्यापन सफलता (31.4%) ही प्राप्त करते हैं।

Wen Fan, Minh Tran, Sanya Dod, Xin Hu, Marilyn Rego, Danning Xie, Jenna DiVincenzo, Lin Tan2026-06-26
🤖 machine learning

Evaluation-Strategy Gap in Fault Diagnosis of Deep Learning Programs

यह शोध पत्र 5,542 ट्रेसेस के एक विशाल संग्रह का उपयोग करते हुए 'विदिन-प्रोग्राम' और 'अनसीन-प्रोग्राम' सेटिंग्स के बीच डीप लर्निंग फॉल्ट डायग्नोसिस में प्रदर्शन अंतराल की जांच करता है, जो यह प्रकट करता है कि जहाँ मौजूदा तकनीकें प्रोग्राम-स्तरीय फीचर संरचनाओं के कारण नए प्रोग्रामों पर सटीकता में महत्वपूर्ण गिरावट का सामना करती हैं, वहीं कर्वेचर फीचर्स विशेष रूप से अनसीन परिदृश्यों के लिए प्रभावी अस्थिरता का पता लगाने की क्षमता प्रदान करते हैं।

Sigma Jahan2026-06-26