💻 computer science

When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation

यह शोध पत्र एक व्यवस्थित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि रिट्रीवल-ऑगमेंटेड जनरेशन और संरचित दस्तावेज़ीकरण के उपयोग के बावजूद, लार्ज लैंग्वेज मॉडल्स अक्सर अपने पुराने पैरामीट्रिक ज्ञान की तुलना में बाहरी API अपडेट को प्राथमिकता देने में विफल रहते हैं, जिसके परिणामस्वरूप कोड निष्पादन दर (code executability rates) कम हो जाती है जिसे केवल बड़े मॉडल स्केल और सेल्फ-रिफ्लेक्शन जैसी रीजनिंग-आधारित रणनीतियों द्वारा आंशिक रूप से ही कम किया जा सकता है।

Ahmed Nusayer Ashik, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman, Yuan Tian2026-04-13
💻 computer science

Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios

यह शोध पत्र SWE-Bench बेंचमार्क पर शीर्ष 8 सॉफ्टवेयर विकास एजेंटों का एक प्रक्रिया-उन्मुख अनुभवजन्य विश्लेषण प्रस्तुत करता है, जो यह प्रकट करता है कि पायथन निष्पादन त्रुटियां समाधान सफलता के साथ कैसे सह-संबंधित हैं, प्रचलित और चुनौतीपूर्ण त्रुटि प्रकारों की पहचान करता है, और स्वयं बेंचमार्क प्लेटफॉर्म में तीन पहले से अज्ञात बगों को उजागर करता है।

Zhi Chen, Wei Ma, Lingxiao Jiang2026-04-10
💻 computer science

OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research

OpenClassGen 324,843 वास्तविक-विश्व पायथन क्लासों के एक बड़े पैमाने के कॉर्पस को समृद्ध स्टैटिक मेट्रिक्स और सेल्फ-कंटेन्ड स्केलेटन के साथ पेश करता है, जो क्लास-लेवल कोड जनरेशन पर लार्ज लैंग्वेज मॉडल्स के मूल्यांकन और प्रशिक्षण के लिए उच्च-गुणवत्ता वाले डेटासेट्स की कमी को संबोधित करता है।

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab2026-04-10
💻 computer science

Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि जबकि लार्ज लैंग्वेज मॉडल्स वास्तविक दुनिया के जावा सिस्टम में जटिल प्रदर्शन अनुकूलन कार्यों को हल कर सकते हैं, उनके समाधान अत्यधिक अस्थिर और आम तौर पर मानव डेवलपर्स की तुलना में निम्न स्तर के बने रहते हैं क्योंकि वे स्वायत्त रूप से हॉटस्पॉट्स की पहचान करने और इष्टतम एल्गोरिदम को संश्लेषित करने में संघर्ष करते हैं, जो यह प्रकट करता है कि वर्तमान एल्गोरिद्मिक बेंचमार्क उनकी वास्तविक क्षमताओं का अतिरंजित आकलन करते हैं।

Lirong Yi, Gregory Gay, Philipp Leitner2026-04-10
💻 computer science

SPEAR: An Engineering Case Study of Multi-Agent Coordination for Smart Contract Auditing

यह शोध पत्र SPEAR प्रस्तुत करता है, जो स्मार्ट कॉन्ट्रैक्ट ऑडिटिंग के लिए एक मल्टी-एजेंट समन्वय ढांचा है जो केंद्रीकृत या पाइपलाइन-आधारित विकल्पों की तुलना में योजना, कार्य आवंटन और स्वायत्त रिकवरी को बढ़ाने के लिए विशिष्ट एजेंटों, बातचीत प्रोटोकॉल और विश्वास संशोधन (belief revision) का लाभ उठाता है।

Arnab Mallick, Indraveni Chebolu, Harmesh Rana, Seema Pangal2026-04-10
💻 computer science

Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents

यह शोध पत्र एजेंट-जनित परीक्षणों के LLM-आधारित सॉफ्टवेयर इंजीनियरिंग में अनुमानित मूल्य को चुनौती देता है, यह प्रदर्शित करते हुए कि हालांकि ऐसे परीक्षण अक्सर लिखे जाते हैं, वे मुख्य रूप से कठोर सत्यापन के बजाय केवल अवलोकन संबंधी फीडबैक के रूप में कार्य करते हैं, और प्रॉम्प्ट हस्तक्षेपों के माध्यम से उनके वॉल्यूम में हेरफेर करने से अंतिम समस्या-समाधान परिणामों पर महत्वपूर्ण प्रभाव नहीं पड़ता है।

Zhi Chen, Zhensu Sun, Yuling Shi, Chao Peng, Xiaodong Gu, David Lo, Lingxiao Jiang2026-04-10
💻 computer science

Breaking the Illusion of Identity in LLM Tooling

यह शोध पत्र एक तैनात करने योग्य, सात-नियमों वाली कॉन्फ़िगरेशन प्रणाली का प्रस्ताव देता है और उसका अनुभवजन्य रूप से सत्यापन करता है जो मॉडल संशोधनों की आवश्यकता के बिना, LLM टूलिंग आउटपुट में मानवशास्त्रीय मार्करों (anthropomorphic markers) को 97% से अधिक कम करके एजेंसी के संज्ञानात्मक भ्रम (cognitive illusion of agency) को प्रभावी ढंग से तोड़ देता है, हालांकि यह समग्र आउटपुट गुणवत्ता पर पड़ने वाले प्रभाव का मूल्यांकन नहीं करता है।

Marek Miller2026-04-10
💻 computer science

Formally Guaranteed Control Adaptation for ODD-Resilient Autonomous Systems

यह शोध पत्र स्वायत्त प्रणालियों के लिए एक नियंत्रण अनुकूलन दृष्टिकोण प्रस्तुत करता है जो उनकी परिचालन क्षमताओं को आउट-ऑफ-ओडीडी (out-of-ODD) परिदृश्यों को संभालने के लिए गतिशील रूप से विस्तारित करता है और साथ ही अप्रत्याशित परिस्थितियों में विश्वसनीय प्रदर्शन सुनिश्चित करने के लिए औपचारिक मात्रात्मक गारंटी प्रदान करता है।

Gricel Vázquez, Calum Imrie, Sepeedeh Shahbeigi, Nawshin Mannan Proma, Tian Gan, Victoria J Hodge, John Molloy, Simos Ge (…)2026-04-10
💻 computer science

Beyond Single Reports: Evaluating Automated ATT&CK Technique Extraction in Multi-Report Campaign Settings

यह अध्ययन तीन प्रमुख साइबर अभियानों की 90 रिपोर्टों में से ATT&CK तकनीकों को निकालने के लिए 29 स्वचालित विधियों का अनुभवजन्य मूल्यांकन करता है, जो यह प्रदर्शित करता है कि एकल-रिपोर्ट विश्लेषण की तुलना में कई रिपोर्टों को एकत्रित करना निष्कर्षण प्रदर्शन और नियंत्रण कवरेज में महत्वपूर्ण सुधार करता है, हालांकि संतृप्ति सीमाओं और समान अर्थ वाले तकनीकों के गलत वर्गीकरण के संबंध में चुनौतियां बनी हुई हैं।

Md Nazmul Haque, Sivana Hamer, Brandon Wroblewski, Md Rayhanur Rahman, Laurie Williams2026-04-10
💻 computer science

Beyond Human-Readable: Rethinking Software Engineering Conventions for the Agentic Development Era

यह शोध पत्र तर्क देता है कि सॉफ्टवेयर इंजीनियरिंग परंपराओं को मानव-केंद्रित पठनीयता से बदलकर एजेंटिक एआई (agentic AI) के लिए "सिमेंटिक डेंसिटी ऑप्टिमाइज़ेशन" (semantic density optimization) की ओर विकसित होना चाहिए, जो प्रयोगों के माध्यम से यह प्रदर्शित करता है कि आक्रामक टोकन संपीड़न (token compression) मॉडल पर व्याख्यात्मक बोझ डालकर लागत बढ़ा सकता है और प्रोग्राम कंकालों (program skeletons) तथा स्वायत्त एजेंटों की बेहतर सेवा के लिए शास्त्रीय एंटी-पैटर्न के पुनर्वास जैसे नए प्रतिमानों का प्रस्ताव करता है।

Dmytro Ustynov2026-04-10