💻 computer science

Leveraging Large Language Models to Obscure Code Stylometry: A Comparative Study of GPT-3.5 and GPT-4

यह अध्ययन लेखकत्व निर्धारण (authorship attribution) क्लासिफायर से बचने के लिए कोड शैलीमिति (code stylometry) को छिपाने में GPT-3.5 और GPT-4 की प्रभावशीलता का मूल्यांकन करता है, जो यह प्रकट करता है कि मल्टी-शॉट प्रॉम्प्टिंग और विस्तृत निर्देश शैलीगत अस्पष्टता (stylistic obfuscation) को महत्वपूर्ण रूप से बढ़ाते हैं, जबकि ऐसे संशोधनों के दौरान कोड की कार्यक्षमता को बनाए रखने में अंतर्निहित चुनौतियों को भी उजागर करते हैं।

Saman Pordanesh, Benjamin Tan2026-06-23
💻 computer science

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

यह शोध पत्र Forge को प्रस्तुत करता है, जो एक क्लोज्ड-लूप पाइपलाइन है जो मॉडल-ड्रिवन इंजीनियरिंग को औपचारिक सत्यापन (formal verification) उपकरणों के साथ एकीकृत करता है ताकि सुरक्षा-महत्वपूर्ण प्रणालियों के लिए LLM-जनित "वाइब कोडेड" जावा सॉफ्टवेयर को बार-बार परिष्कृत और प्रमाणित किया जा सके, जिसमें डेवलपर्स के लिए औपचारिक मॉडलों का मैन्युअल निरीक्षण करने की आवश्यकता नहीं होती है।

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji2026-06-23
💻 computer science

WebCQ: Cooperative Multi-Agent Deep Reinforcement Learning for Scalable Web GUI Testing

WebCQ एक नवीन सहकारी मल्टी-एजेंट डीप रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो QTRAN समन्वय और डायनेमिक एक्शन स्पेस हैंडलिंग को एकीकृत करके मौजूदा टेबुलर दृष्टिकोणों की स्केलेबिलिटी सीमाओं को दूर करता है, जिससे बड़े पैमाने पर वाणिज्यिक वेब GUI टेस्टिंग में स्टेट एक्सप्लोरेशन, एक्शन डाइवर्सिटी और फेलियर डिटेक्शन में महत्वपूर्ण सुधार होता है।

Yujia Fan, Sinan Wang, Zebang Fei, Yao Qin, Huaxuan Li, Yepang Liu2026-06-23
💻 computer science

Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents

यह शोध पत्र PORTICO को प्रस्तुत करता है, जो एक संदर्भ मॉनिटर (reference monitor) है जो एक प्रतिसंहरणीय (revocable), जीवनचक्र-आधारित क्षमता प्रणाली को लागू करके कोडिंग एजेंटों में "बची हुई सत्ता" (lingering authority) को कम करता है, जो कार्य की सफलता से समझौता किए बिना, संसाधनों तक पहुँच को गतिशील रूप से प्रदान और वापस लेता है, जिससे पोस्ट-एपिसोड (post-episode) वर्जित प्रभावों को रोका जा सके।

Igor Santos-Grueiro2026-06-23
💻 computer science

What Characterizes Pairwise Modular Smells?

यह अध्ययन 19 युग्म संबंध विशेषताओं (pair relationship features) की पहचान करके पेयरवाइज़ मॉड्यूलर स्मेल्स (Pairwise Modular Smells) को अभिलक्षणित करता है, इनएप्ट सेपरेटेड (inapt separated) और कोलोकेटेड (collocated) युग्मों की भविष्यवाणी करने के लिए 11 जावा प्रोजेक्ट्स से 6 मिलियन से अधिक इकाई युग्मों पर मशीन लर्निंग मॉडल को प्रशिक्षित करता है, जिससे महत्वपूर्ण सटीकता सुधार प्राप्त होते हैं, और परिणामों की व्याख्या करके उन विशिष्ट प्रभावशाली कारकों जैसे कि निर्भरता (dependencies) और अर्थ संबंधी समानता (semantic similarity) को प्रकट करता है जो इन आर्किटेक्चरल दोषों को संचालित करते हैं।

Chenxing Zhong, Daniel Feitosa, Paris Avgeriou, Huang Huang, Wei Song, He Zhang2026-06-23
💻 computer science

On Good Authority: Release-Authority Measurement for Registry-Mediated Package Ecosystems

यह शोध पत्र प्रमुख पैकेज पारिस्थितिक तंत्रों (ecosystems) में सार्वजनिक रिलीज़-पाथ विच्छेदन (discontinuities) का पता लगाने के लिए एक पूर्ववर्ती-जागरूक रिलीज़-अथॉरिटी रिकॉर्ड प्रस्तुत करता है, जो एक ऑडिटेड कोहॉर्ट के माध्यम से यह प्रदर्शित करता है कि सिमेंटिक-डिस्टेंस नियम विशेषज्ञ समीक्षा की आवश्यकता वाले नीति-ट्रिगरिंग विसंगतियों की प्रभावी ढंग से पहचान करते हैं और उन्हें ज्ञात दुर्भावनापूर्ण संस्करणों से अलग करते हैं।

Igor Santos-Grueiro2026-06-23
💻 computer science

Identifying Quality Indicators in Student Self-Reflections in Software Engineering

यह अध्ययन सॉफ्टवेयर इंजीनियरिंग में छात्र आत्म-चिंतन (self-reflections) का आकलन करने के लिए एक आठ-सूचक ढांचे का प्रस्ताव करता है और एक फाइन-ट्यून्ड RoBERTa मॉडल को मान्य करता है जो इन प्रतिबिंबों को स्वचालित रूप से वर्गीकृत करने में मानव-स्तर की सहमति प्राप्त करता है ताकि स्केलेबल, समय पर और संरचित फीडबैक प्रदान किया जा सके।

Matthew Minish, Matthias Galster, Fabian Gilson2026-06-23
🤖 AI

GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation

GroundEval एक नियत (deterministic), जज-मुक्त ढांचा है जो स्टेटफुल एजेंटों का मूल्यांकन उनके टूल उपयोग और साक्ष्य पहुंच को विशिष्ट विफलता मोड (साइलेंस, पर्सपेक्टिव, और काउंटरफैक्चुअल) के विरुद्ध सत्यापित करके करता है, जिससे तर्क में उन महत्वपूर्ण अंतरालों को उजागर किया जा जाता है जिन्हें पारंपरिक LLM-as-Judge मेट्रिक्स अक्सर चूक जाते हैं।

Jeffrey Flynt2026-06-23
💻 computer science

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

यह शोध पत्र DeepDiscovery को प्रस्तुत करता है, जो एक दो-चरणीय "लोकेशन-इन्फरेंस" (स्थान-अनुमान) ढांचा है जो स्थानीय अंशों से आगे बढ़कर बड़े औद्योगिक कोडबेस से कार्य-प्रासंगिक संदर्भ को प्रभावी ढंग से पुनर्प्राप्त करता है, जिससे जटिल सॉफ्टवेयर इंजीनियरिंग कार्यों पर फ़ाइल पुनर्प्राप्ति और कोडिंग एजेंट के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun2026-06-23
🤖 AI

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

यह शोध पत्र AFTER को प्रस्तुत करता है, जो विविध एंटरप्राइज कार्यों में LLM एजेंटों में प्रक्रियात्मक स्मृति (procedural memory) के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो यह प्रदर्शित करता है कि परिष्कृत कौशल प्रदर्शन को महत्वपूर्ण रूप से बढ़ाते हैं और प्रभावी क्रॉस-मॉडल एवं क्रॉस-रोल ट्रांसफर को सक्षम करते हैं, जबकि विभिन्न कौशलों के बीच सामान्यीकरण की अलग-अलग डिग्री को भी उजागर करते हैं।

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko2026-06-23