🤖 AI

ProxyWar: Dynamic Assessment of LLM Code Generation in Game Arenas

यह शोधपत्र ProxyWar प्रस्तुत करता है, जो एक नवीन ढांचा है जो एजेंटों को प्रतिस्पर्धी गेम वातावरण में स्थापित करके लार्ज लैंग्वेज मॉडल कोड जनरेशन का मूल्यांकन करता है ताकि स्थिर बेंचमार्क स्कोर और वास्तविक गतिशील प्रदर्शन के बीच महत्वपूर्ण विसंगतियों को उजागर किया जा सके, जिससे यह समृद्ध, प्रतियोगिता-आधारित मूल्यांकन विधियों का समर्थन करता है।

Wenjun Peng, Xinyu Wang, Qi Wu2026-02-05
💻 computer science

Generative AI in Systems Engineering: A Framework for Risk Assessment of Large Language Models

यह शोध पत्र एलएलएम रिस्क असेसमेंट फ्रेमवर्क (LRF) प्रस्तुत करता है, जो निरंतर जोखिम मूल्यांकन, उपयुक्त सत्यापन रणनीतियों और एआई प्रौद्योगिकियों के सुरक्षित एकीकरण को सक्षम करने के लिए स्वायत्तता और प्रभाव के आधार पर सिस्टम इंजीनियरिंग में लार्ज लैंग्वेज मॉडल अनुप्रयोगों को वर्गीकृत करने वाला एक संरचित दृष्टिकोण है।

Stefan Otten, Philipp Reis, Philipp Rigoll, Joshua Ransiek, Tobias Schürmann, Jacob Langner, Eric Sax2026-02-05
💻 computer science

AgenticAKM : Enroute to Agentic Architecture Knowledge Management

यह शोध पत्र AgenticAKM का प्रस्ताव करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो आर्किटेक्चर नॉलेज मैनेजमेंट के जटिल कार्य को निष्कर्षण (extraction), पुनर्प्राप्ति (retrieval), सृजन (generation) और सत्यापन (validation) के लिए विशिष्ट उप-कार्यों में विभाजित करता है, और 29 रिपॉजिटरीज़ पर एक उपयोगकर्ता अध्ययन के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण उच्च-गुणवत्ता वाले आर्किटेक्चर डिसीजन रिकॉर्ड्स के निर्माण को प्रभावी ढंग से स्वचालित करता है।

Rudra Dhar, Karthik Vaidhyanathan, Vasudeva Varma2026-02-05
💻 computer science

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

यह शोध पत्र SWE-Bench Lite और Verified लीडरबोर्ड का पहला व्यापक विश्लेषण प्रस्तुत करता है, जो यह प्रकट करता है कि प्रोप्राइटरी (proprietary) LLMs, विशेष रूप से क्लॉड (Claude) परिवार का उपयोग करने वाले उद्योग के सबमिशन वर्तमान में इस बेंचमार्क पर हावी हैं, जबकि अकादमिक योगदान प्रतिस्पर्धी बने हुए हैं।

Matias Martinez, Xavier Franch2026-02-05
🤖 AI

Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents

यह शोध पत्र तर्क देता है कि सॉफ्टवेयर इंजीनियरिंग एजेंटों को आगे बढ़ाने के लिए लंबी अवधि के कार्यों (long-horizon tasks) को प्रभावी ढंग से संभालने और विकसित होते साक्ष्यों के बीच सुसंगत समझ बनाए रखने के लिए प्रतिक्रियाशील डिजाइनों (reactive designs) से संरचित, अवस्था-जागरूक (state-aware) और निष्पादन-आधारित (execution-grounded) तर्क की ओर संक्रमण करना आवश्यक है।

Tse-Hsun, Chen2026-02-05
💻 computer science

Do Developers Read Type Information? An Eye-Tracking Study on TypeScript

26 स्नातक छात्रों पर आधारित यह आई-ट्रैकिंग अध्ययन यह प्रकट करता है कि डेवलपर्स टाइपस्क्रिप्ट में कोड बोध या बग लोकलाइजेशन कार्यों के दौरान टाइप एनोटेशन को सीधे तौर पर अधिक बार नहीं देखते हैं, जो यह सुझाव देता है कि हालांकि प्रकार (types) दस्तावेज़ीकरण के रूप में कार्य कर सकते हैं, लेकिन उन्हें उस तरह से सक्रिय रूप से नहीं पढ़ा जाता है जैसा कि पहले परिकल्पना की गई थी।

Samuel W. Flint, Robert Dyer, Bonita Sharif2026-02-05
💻 computer science

When Code Becomes Abundant: Redefining Software Engineering Around Orchestration and Verification

यह शोध पत्र तर्क देता है कि जैसे-जैसे एआई (AI) कोड उत्पादन की लागत को कम कर रहा है और हार्डवेयर संबंधी बाधाएं विफलता के जोखिमों को बढ़ा रही हैं, सॉफ्टवेयर इंजीनियरिंग को उभरती जवाबदेही चुनौतियों से निपटने के लिए कोड निर्माण के बजाय मानव इरादे की अभिव्यक्ति, वास्तुशिल्प नियंत्रण और व्यवस्थित सत्यापन पर केंद्रित एक अनुशासन के रूप में मौलिक रूप से बदलना चाहिए।

Karina Kohl, Luigi Carro2026-02-05
💻 computer science

Pushing the Limits: Concurrency Detection in Acyclic Sound Free-Choice Workflow Nets in O(P2+T2)O(P^2 + T^2)

यह शोध पत्र कंकरेंट पाथ्स (CP) एल्गोरिदम प्रस्तुत करता है, जो असायक्लिक साउंड फ्री-चॉइस वर्कफ्लो नेट्स में कंकरेंसी डिटेक्शन को O(P2+T2)O(P^2 + T^2) की वर्स्ट-केस कॉम्प्लेक्सिटी तक सुधारता है, जिससे उन नेट्स के लिए मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ मिलता है जिनमें कई कंकरेंट नोड्स होते हैं।

Thomas M. Prinz, Julien Klaus, Nick R. T. P. van Beest2026-02-04
💬 NLP

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

कॉन्फ्यूशियस कोड एजेंट (CCA), कॉन्फ्यूशियस SDK पर निर्मित एक स्केलेबल सॉफ्टवेयर इंजीनियरिंग एजेंट है, जो उन्नत संदर्भ प्रबंधन, निरंतर सीखने और स्वचालित परिशोधन के लिए एक मेटा-एजेंट को एकीकृत करता है ताकि SWE-Bench-Pro जैसे वास्तविक कोडिंग कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Yi (…)2026-02-04
💻 computer science

Cargo Sherlock: An SMT-Based Checker for Software Trust Costs

यह शोध पत्र Cargo Sherlock को प्रस्तुत करता है, जो एक SMT-आधारित फ्रेमवर्क है जो Rust डिपेंडेंसीज़ में सप्लाई चेन हमलों का पता लगाने के लिए मेटाडेटा-संचालित मानव कारकों (human factors) और कोड विश्लेषण को औपचारिक रूप से संयोजित करके सॉफ्टवेयर ट्रस्ट (software trust) को मापता है।

Muhammad Hassnain, Anirudh Basu, Ethan Ng, Caleb Stanford2026-02-04