💻 computer science

ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java

यह शोधपत्र ScarfBench पेश करता है, जो एंटरप्राइज़ जावा एप्लिकेशन्स को Spring, Jakarta EE और Quarkus के बीच व्यवहार-संरक्षण वाले क्रॉस-फ्रेमवर्क माइग्रेशन करने की AI कोडिंग एजेंट्स की क्षमता का मूल्यांकन करने के लिए एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल इस जटिल रिफैक्टरिंग कार्य के साथ काफी संघर्ष करते हैं।

Advait Pavuluri, Bridget McGinn, Ashita Saxena, George Safta, Srikanth Tamilselvam, Raju Pavuluri, Michele Merler, Baish (…)2026-05-12
💻 computer science

RepoZero: Can LLMs Generate a Code Repository from Scratch?

यह शोध पत्र RepoZero प्रस्तुत करता है, जो API विनिर्देशों के माध्यम से शून्य से पूर्ण सॉफ़्टवेयर रिपॉजिटरी बनाने वाले LLMs के पूर्णतः स्वचालित, निष्पादन-आधारित सत्यापन के लिए पहला बेंचमार्क है, और इसके साथ ही एजेंटिक कोड-टेस्ट इवोल्यूशन (ACE) फ्रेमवर्क को भी पेश करता है, जो यह प्रकट करता है कि इस जटिल कार्य में उच्च सफलता दर प्राप्त करने के लिए अत्याधुनिक एजेंट भी संघर्ष करते हैं।

Zhaoxi Zhang, Yiming Xu, Weikang Li, Jiahui Liang, Yunfang Wu2026-05-12
💻 computer science

Low-code and no-code with BESSER to create and deploy smart web applications

यह शोध पत्र BESSER को प्रस्तुत करता है, जो एक ओपन-सोर्स लो-कोड फ्रेमवर्क है जिसे एक पारदर्शी, विस्तार योग्य और वेंडर-लॉक-इन-मुक्त वेब-आधारित संपादक के माध्यम से AI एजेंटों के साथ स्मार्ट वेब एप्लिकेशन के निर्माण और परिनियोजन को सुगम बनाने के लिए डिज़ाइन किया गया है।

Iván Alfonso, Armen Sulejmani, Aaron Conrardy, Jordi Cabot2026-05-12
💻 computer science

Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation

यह शोध पत्र Q-SAGE को प्रस्तुत करता है, जो एक पुनरावृत्ति मूल्यांकन पद्धति है जो यह प्रदर्शित करती है कि जबकि लार्ज लैंग्वेज मॉडल्स (Large Language Models) परिशोधन के माध्यम से बेहतर सफलता दर वाले क्वांटम सॉल्वर उत्पन्न कर सकते हैं, वे अभी भी संख्यात्मक सटीकता में संघर्ष करते हैं और महत्वपूर्ण कम्प्यूटेशनल ओवरहेड उत्पन्न करते हैं, जो वैज्ञानिक क्वांटम सॉफ्टवेयर विकास को पूरी तरह से स्वचालित करने में वर्तमान सीमाओं को प्रकट करता है।

Luciano Baresi, Domenico Bianculli, Maryse Ernzer, Livia Lestingi, Fabrizio Pastore, Seung Yeob Shin2026-05-12
💻 computer science

Search-based Robustness Testing of Laptop Refurbishing Robotic Software

यह शोध पत्र PROBE का प्रस्ताव करता है, जो लैपटॉप रिफर्बिशिंग रोबोट्स के लिए ऑब्जेक्ट डिटेक्शन मॉडल्स में विफलताओं को उजागर करने वाले न्यूनतम, स्थानीयकृत व्यवधानों (perturbations) को कुशलतापूर्वक पहचानने के लिए मल्टी-ऑब्जेक्टिव ऑप्टिमाइज़ेशन का उपयोग करने वाला एक सर्च-आधारित रोबस्टनेस टेस्टिंग दृष्टिकोण है, जो रैंडम सर्च की तुलना में काफी उच्च प्रभावशीलता और ट्रांसफ़रेबिलिटी प्रदर्शित करता है।

Erblin Isaku, Hassan Sartaj, Shaukat Ali, Malaika Din Hashmi, Francois Picard2026-05-12
💻 computer science

SafeTune: Search-based Harmfulness Minimisation for Large Language Models

यह शोध पत्र SafeTune प्रस्तुत करता है, जो एक बहु-उद्देश्यीय खोज-आधारित ढांचा है जो बड़े भाषा मॉडलों (Large Language Models) में हानिकारक प्रतिक्रियाओं को काफी कम करने और प्रासंगिकता बढ़ाने के लिए हाइपरपैरामीटर ट्यूनिंग और सिस्टम प्रॉम्प्ट इंजीनियरिंग का उपयोग करता है, जिसमें एक विशिष्ट निष्कर्ष यह है कि अधिक प्रतिक्रिया पुनरावृत्ति (response repetition) को प्रोत्साहित करना सबसे प्रभावशाली रणनीति है।

Giordano d'Aloisio, David Williams, Giusy Annunziata, Zhiwei Fei, Antinisca Di Marco, Federica Sarro2026-05-12
💻 computer science

SARC: A Governance-by-Architecture Framework for Agentic AI Systems

यह शोध पत्र SARC को प्रस्तुत करता है, जो एक रनटाइम गवर्नेंस फ्रेमवर्क है जो बाधाओं (constraints) को प्रथम-श्रेणी के स्पेसिफिकेशन ऑब्जेक्ट्स के रूप में मानता है ताकि एजेंट लूप के भीतर कई बिंदुओं पर दायित्वों को लागू किया जा सके, जिससे पारंपरिक पोस्ट-होक या पॉलिसी-एज़-कोड दृष्टिकोणों की तुलना में हार्ड-कंस्ट्रेंट उल्लंघनों को समाप्त किया जा सके और सॉफ्ट-विंडो ओवरेज को काफी कम किया जा सके।

Gaston Besanson2026-05-12
💻 computer science

Coding Agents Don't Know When to Act

यह शोधपत्र FixedBench को यह प्रदर्शित करने के लिए प्रस्तुत करता है कि अत्याधुनिक कोडिंग एजेंट "एक्शन बायस" (action bias) से ग्रस्त हैं, जो अक्सर पहले से हल हो चुके मुद्दों के लिए अनावश्यक कोड परिवर्तन प्रस्तावित करते हैं क्योंकि वे यह पहचानने में विफल रहते हैं कि कब कोई कार्रवाई न करना ही उचित प्रतिक्रिया है।

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev2026-05-12
💻 computer science

Similar Pattern Annotation via Retrieval Knowledge for LLM-Based Test Code Fault Localization

यह शोधपत्र SPARK प्रस्तुत करता है, जो एक ऐसा ढांचा है जो निरंतर एकीकरण (continuous integration) ज्ञान कोष से समान ऐतिहासिक दोष पैटर्न को पुनर्प्राप्त और एनोटेट करके लार्ज लैंग्वेज मॉडल-आधारित टेस्ट कोड फॉल्ट लोकलाइजेशन को बढ़ाता है, जिससे बिना अनुमान लागत (inference costs) में महत्वपूर्ण वृद्धि किए जटिल टेस्ट मामलों में दोषपूर्ण लाइनों की पहचान करने में सटीकता में सुधार होता है।

Golnaz Gharachorlu, Mahsa Panahandeh, Lionel C. Briand, Ruifeng Gao, Ruiyuan Wan2026-05-12
💻 computer science

Collaborator or Assistnat? How AI Coding Agents Partition Work Across Pull Request Lifecycles

यह शोध पत्र पाँच AI कोडिंग टूल्स के 29,585 पुल रिक्वेस्ट लाइफसाइकिल का विश्लेषण करता है ताकि एक "सहयोगी-सहायक" (Collaborator-Assistant) वर्गीकरण स्थापित किया जा सके जो यह प्रकट करता है कि कैसे परिचालन एजेंसी (operational agency) तेजी से एजेंटों को सौंपी जा रही है जबकि मर्ज गवर्नेंस मुख्य रूप से मानव-केंद्रित बनी हुई है, जो स्वचालित सॉफ्टवेयर विकास में निष्पादन और निरीक्षण के बीच एक महत्वपूर्ण अलगाव को रेखांकित करता है।

Young Jo (seph), Chung, Safwat Hassan2026-05-12