💻 computer science

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

यह अध्ययन प्रदर्शित करता है कि फ्लोचार्ट को समस्या कथनों (problem statements) के साथ एकीकृत करने से GPT-4o जैसे मल्टीमॉडल LLMs के कोड जनरेशन प्रदर्शन में महत्वपूर्ण सुधार होता है, जिसमें 10% तक का सुधार और फ्लोचार्ट की विस्तृतता तथा सटीकता के बीच एक सकारात्मक सहसंबंध देखा गया है, जो कुछ फ्यू-शॉट लर्निंग दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei2026-07-13
💻 computer science

How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection

यह शोध पत्र तर्क देता है कि वर्तमान कोड-आधारित फ्लैकी टेस्ट डिटेक्टर दोषपूर्ण बेंचमार्क और मूल्यांकन प्रोटोकॉल द्वारा सीमित हैं जो वास्तविक कोड विश्लेषण के बजाय डेटा शॉर्टकट पर निर्भर करते हैं, और इसके बजाय निष्पादन साक्ष्य (execution evidence) और पर्यावरणीय संदर्भ से फ्लैकीनेस का पता लगाने पर केंद्रित एक पुनर्गठित दृष्टिकोण का प्रस्ताव करता है।

Ömer Oktay Gültekin, Alexander Berndt, Jonathan Bell, Thomas Bach, Sebastian Baltes2026-07-13
🤖 AI

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

यह शोध पत्र Diversify2Verify पेश करता है, जो एक LLM-आधारित पाइपलाइन है जो यह प्रदर्शित करती है कि कैसे विविध, कार्य-तुल्य प्रोग्राम कार्यान्वयन उत्पन्न करना स्वचालित सत्यापन सफलता दरों में महत्वपूर्ण सुधार करता है, उन वेरिएंट्स की पहचान करके जो औपचारिक प्रमाण (formal proof) के लिए अधिक अनुकूल हैं।

Shirley Yu, Ruben Martins2026-07-13
💻 computer science

How Do Software Professionals Evaluate AI-Generated Code? (Registered Report)

यह एक पंजीकृत रिपोर्ट है जो एक कंस्ट्रक्टिविस्ट ग्राउंडेड थ्योरी अध्ययन की रूपरेखा प्रस्तुत करती है जो एक पूर्ण सर्वेक्षण को पुनरावृत्ति साक्षात्कार के साथ जोड़कर इस सिद्धांत को विकसित करने के लिए है कि सॉफ्टवेयर पेशेवर एआई-जनित कोड का मूल्यांकन कैसे करते हैं।

Samuli Määttä, Hera Arif, Burak Turhan, Paul Ralph, Markus Kelanti2026-07-13
🤖 AI

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

यह शोध पत्र CLI कोडिंग-एजेंट विफलता प्रक्षेपवक्रों (failure trajectories) का पहला बड़े पैमाने पर अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि विफलताएं मुख्य रूप से प्रारंभिक ज्ञान संबंधी त्रुटियों (epistemic errors) द्वारा संचालित होती हैं जो अपरिवर्तनीय अवस्थाओं में विकसित हो जाती हैं, जिससे अंतिम-परिणाम मूल्यांकन से प्रक्रिया-उन्मुख हस्तक्षेप रणनीतियों की ओर बदलाव का समर्थन मिलता है।

Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye2026-07-13
💻 computer science

Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments

यह शोध पत्र दो LLM-आधारित क्यूरेशन पाइपलाइनों, जिसमें CuREV डेटासेट और एक एक्सेम्पलर-गाइडेड दृष्टिकोण शामिल है, का प्रस्ताव करता है, ताकि कोड समीक्षा टिप्पणियों की गुणवत्ता, स्पष्टता और यथार्थता को व्यवस्थित रूप से सुधारा जा सके, जिससे कमेंट जनरेशन और कोड रिफाइनमेंट जैसे डाउनस्ट्रीम ऑटोमेशन कार्यों के प्रदर्शन को बढ़ाया जा सके।

Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui2026-07-13
💻 computer science

Writing Bug Reports for Software Repair Agents: What Information Matters Most?

यह शोध पत्र वास्तविक दुनिया की समस्याओं का विश्लेषण करके यह जांच करता है कि एआई सॉफ्टवेयर रिपेयर एजेंटों के लिए बग रिपोर्ट को कैसे अनुकूलित किया जाए और यह पाता है कि स्थानीयकरण संकेतों (localization cues) और सुझाए गए समाधानों वाले रिपोर्ट एजेंटों की सफलता दर में काफी सुधार करते हैं, जबकि पुनरुत्पादन चरणों (reproduction steps) जैसे पारंपरिक मानव-केंद्रित विवरण कम लाभ प्रदान करते हैं।

Vincenzo Luigi Bruno, Alessandro Giagnorio, Daniele Bifolco, Leon Wienges, Massimiliano Di Penta, Gabriele Bavota2026-07-13
💻 computer science

Simulator Ensembles for Trustworthy Autonomous Driving Systems Testing

यह शोध पत्र MultiSim को प्रस्तुत करता है, जो स्वायत्त ड्राइविंग प्रणालियों के लिए सिम्युलेटर-अज्ञेय (simulator-agnostic) विफलता परिदृश्यों को प्राथमिकता देने और पहचानने के लिए सिम्युलेटर के एक समूह (ensemble) का लाभ उठाने वाला एक खोज-आधारित परीक्षण दृष्टिकोण है, जो एकल-सिम्युलेटर या स्वतंत्र बहु-सिम्युलेटर परीक्षण विधियों की तुलना में काफी उच्च प्रभावशीलता और दक्षता प्रदर्शित करता है।

Lev Sorokin, Matteo Biagiola, Andrea Stocco2026-07-10
🤖 AI

Specification and Detection of LLM Code Smells

यह शोध पत्र LLM इन्फरेंस (inference) के लिए पांच आवर्ती समस्याग्रस्त कोडिंग अभ्यासों को औपचारिक रूप देकर 'LLM कोड स्मेल्स' (code smells) की अवधारणा प्रस्तुत करता है, उन्हें पहचानने के लिए SpecDetect4AI टूल का विस्तार करता है, और 200 ओपन-सोर्स सिस्टम के अध्ययन के माध्यम से यह प्रदर्शित करता है कि ये स्मेल्स उच्च पहचान सटीकता के साथ ऐसे 60% से अधिक सिस्टम को प्रभावित करते हैं।

Brahim Mahmoudi, Zacharie Chenail-Larcher, Naouel Moha, Quentin Stiévenart, Florent Avellaneda2026-07-10
💻 computer science

Carnap Ten Years Later: Lessons Learned and Next Steps

यह शोध पत्र कार्नाप (Carnap) प्रूफ़ असिस्टेंट फ्रेमवर्क पर एक दशक लंबे अनुभव की रिपोर्ट प्रस्तुत करता है जिसका उपयोग 45,000 से अधिक छात्रों द्वारा किया गया है, जो उन प्रमुख सफलताओं और चुनौतियों की पहचान करता है जिन्होंने एक उच्च-प्रदर्शन वाले mm0-zig सत्यापन कर्नेल (verifier kernel) और बेहतर वेब-आधारित प्रूफ़ लेखन के लिए ऑफ़बौ (Aufbau) बाइटकोड कंपाइलर वाले बॉटम-अप पुनर्गठन को प्रेरित किया।

Graham Leach-Krouse2026-07-10