💻 computer science

Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance

यह अनुभवजन्य अध्ययन 7,156 पुल रिक्वेस्ट का विश्लेषण करता है यह प्रकट करने के लिए कि जहाँ Devin स्वीकृति में एक अद्वितीय सकारात्मक अस्थायी रुझान दिखाता है, वहीं कार्य का प्रकार सफलता दरों को प्रभावित करने वाला प्रमुख कारक है, जिसमें OpenAI Codex विविध श्रेणियों में सबसे सुसंगत उच्च प्रदर्शन प्रदर्शित करता है, बावजूद इसके कि कोई भी एकल एजेंट सभी कार्य प्रकारों में उत्कृष्ट नहीं है।

Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro2026-05-08
🤖 AI

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code

यह शोध पत्र 114 अध्ययनों की एक व्यवस्थित समीक्षा प्रस्तुत करता है ताकि एलएलएम (LLMs) में दोषपूर्ण कोड जनरेशन से जुड़े प्रशिक्षण डेटा गुणवत्ता संबंधी मुद्दों के लिए एक एकीकृत वर्गीकरण और कारण ढांचा स्थापित किया जा सके, साथ ही शमन तकनीकों को संश्लेषित किया जा सके और विश्वसनीय कोड मॉडल के लिए सक्रिय, डेटा-केंद्रित शासन की ओर एक प्रतिमान बदलाव की रूपरेखा तैयार की जा सके।

Kaifeng He, Xiaojun Zhang, Peiliang Cai, Mingwei Liu, Yanlin Wang, Chong Wang, Kaifeng Huang, Bihuan Chen, Xin Peng, Zib (…)2026-05-08
🤖 AI

Securing the Agent: Vendor-Neutral, Multitenant Enterprise Retrieval and Tool Use

यह शोध पत्र ओपन-सोर्स OGX फ्रेमवर्क के भीतर एक सर्वर-साइड, लेयर्ड आइसोलेशन आर्किटेक्चर प्रस्तावित और मान्य करके मल्टीटेनेंट एंटरप्राइज एआई सिस्टम में उस महत्वपूर्ण सुरक्षा अंतराल को संबोधित करता है जहाँ रिट्रीवल रिलेवेंस (प्राप्ति प्रासंगिकता) ऑथोराइजेशन (प्राधिकरण) पर हावी हो जाती है, जो क्रॉस-टेनेंट डेटा लीकेज को रोकने के लिए पॉलिसी-अवेयर इनजेशन और रिट्रीवल गेटिंग को लागू करता है और इसमें प्रदर्शन का नगण्य ओवरहेड होता है।

Francisco Javier Arceo, Varsha Prasad Narsing2026-05-08
🤖 AI

Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology

यह शोध पत्र "मिज़ एन प्लेस" (MEP) का प्रस्ताव करता है, जो एक तीन-चरणीय तैयारी पद्धति है जो डोमेन ज्ञान को बाह्य रूप में प्रस्तुत करके और विनिर्देशों (specifications) को व्यवस्थित करके तीव्र "वाइब कोडिंग" की अक्षमताओं का मुकाबला करती है ताकि प्रभावी, समानांतर एजेंटिक कोडिंग सक्षम हो सके, जिससे "संदर्भ प्रवाह" (context fluency) को एक महत्वपूर्ण डेवलपर कौशल के रूप में पेश किया जा सके।

Andrew Zigler2026-05-08
💻 computer science

Is this Build Failure Related to my Patch? An Empirical Study of Unrelated Build Failures in Continuous Integration

यह अनुभवजन्य अध्ययन सात अपाचे (Apache) परियोजनाओं में 77,354 सीआई (CI) बिल्ड विफलताओं का विश्लेषण करता है ताकि असंबंधित विफलताओं पर बर्बाद किए गए डेवलपर के प्रयास को मापा जा सके और यह प्रदर्शित किया जा सके कि अर्ध-पर्यवेक्षित पॉजिटिव एंड अनलेबल (PU) लर्निंग मॉडल, सीआई (CI) विलंबता और त्रुटि पैटर्न जैसे फीचर्स का उपयोग करते हुए, ऐसे गैर-कार्रवाई योग्य विफलताओं की प्रभावी ढंग से भविष्यवाणी कर सकते हैं ताकि डेवलपर्स को उनके डिबगिंग प्रयासों को प्राथमिकता देने में मदद मिल सके।

Andie Huang, Daniel Alencar da Costa, Grant Dick, Mariam El Mezouar2026-05-08
💻 computer science

Operationalizing Ethics for AI Agents: How Developers Encode Values into Repository Context Files

यह विजन पेपर इस बात की जांच करता है कि कैसे डेवलपर्स एआई एजेंटों को निर्देशित करने के लिए रिपॉजिटरी संदर्भ फाइलों (जैसे AGENTS.md) में व्यवहार संबंधी नियमों को एनकोड करके नैतिक सिद्धांतों को कार्यान्वित कर रहे हैं, और इन उभरते डेवलपर-लिखित निर्देशों की भिन्नता, शासन और अनुपालन का अध्ययन करने के लिए एक शोध एजेंडा प्रस्तावित करता है।

Christoph Treude, Sebastian Baltes, Marc Cheong2026-05-08
💻 computer science

On Fixing Insecure AI-Generated Code through Model Fine-Tuning and Prompting Strategies

यह शोध पत्र एआई-जनरेटेड कोड को कॉमन वीकनेस एन्यूमरेशन (CWE) कमजोरियों के विरुद्ध सुरक्षित करने में फाइन-ट्यूनिंग और प्रॉम्प्टिंग रणनीतियों की प्रभावशीलता की व्यवस्थित जांच करता है, जिससे यह पता चलता है कि हालांकि ये विधियां विशिष्ट कमजोरियों को कम कर सकती हैं, लेकिन वे अक्सर नई कमजोरियां भी उत्पन्न करती हैं और विभिन्न मॉडलों एवं परिदृश्यों में एक सार्वभौमिक रूप से प्रभावी समाधान का अभाव रखती हैं।

Ali Soltanian Fard Jahromi, Amjed Tahir, Peng Liang, Foutse Khomh2026-05-08
💻 computer science

Exploring the Effectiveness of Abstract Syntax Tree Patterns for Algorithm Recognition

यह शोध पत्र एक प्रोटोटाइप सिस्टम प्रस्तुत और मूल्यांकित करता है जो एल्गोरिदम कार्यान्वयन (implementations) को स्वचालित रूप से पहचानने के लिए एक डोमेन-विशिष्ट भाषा में परिभाषित एब्स्ट्रैक्ट सिंटैक्स ट्री (Abstract Syntax Tree) पैटर्न का उपयोग करता है, जो बड़े भाषा मॉडलों (large language models) और मौजूदा कोड क्लोन डिटेक्शन टूल्स दोनों की तुलना में 0.74 के औसत F1-स्कोर के साथ बेहतर प्रदर्शन प्रदर्शित करता है।

Denis Neumüller, Florian Sihler, Raphael Straub, Matthias Tichy2026-05-08
🤖 AI

Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

ASTOR एक यूटिलिटी-ड्रिवन मल्टी-टास्क रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो कोड LLMs के लिए है, जो टास्क लर्निंग को गतिशील रूप से समन्वित करने के लिए पदानुक्रमित डेटा शेड्यूलिंग और एडेप्टिव पॉलिसी ऑप्टिमाइज़ेशन का उपयोग करता है, जो टास्क-विशिष्ट विशेषज्ञों और मौजूदा मल्टी-टास्क बेसलाइन्स दोनों से काफी बेहतर प्रदर्शन करता है।

Yujia Chen, Yang Ye, Xiao Chu, Yuchi Ma, Cuiyun Gao2026-05-08
🤖 AI

BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

यह शोध पत्र BUILD-AND-FIND को प्रस्तुत करता है, जो एक प्रयास-जागरूक (effort-aware) मूल्यांकन प्रोटोकॉल है जो न केवल कोडबेस की व्यवहारिक शुद्धता का आकलन करता है, बल्कि यह भी मापता है कि डाउनस्ट्रीम एजेंटों के लिए मूल डिज़ाइन इरादे और विशिष्टताओं को पुनः प्राप्त करने हेतु कितनी सटीकता और निरीक्षण प्रयास की आवश्यकता होती है।

Jhen-Ke Lin2026-05-08