💬 NLP

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

यह शोध पत्र तर्क देता है कि वर्तमान कोडिंग बेंचमार्क एजेंटिक सॉफ्टवेयर इंजीनियरिंग के साथ असंगत हैं क्योंकि वे मॉडल के प्रदर्शन को सिस्टम हार्नेस घटकों के साथ मिला देते हैं, एकल संदर्भ उत्तरों पर निर्भर रहकर वैध वैकल्पिक समाधानों को दंडित करते हैं, और पुनरावृत्ति प्रणाली सुधार के लिए आवश्यक सूक्ष्म फीडबैक का अभाव रखते हैं।

Maria I. Gorinova, Macey Baker, Amy Heineike, Maksim Shaposhnikov, Rob Willoughby, Dru Knox2026-06-17
💬 NLP

A Framework for Evaluating Agentic Skills at Scale

यह शोध पत्र यथार्थवादी कार्यों और स्कोरिंग रूब्रिक्स को उत्पन्न करके एजेंटिक कौशल का आकलन करने के लिए एक स्केलेबल मूल्यांकन ढांचे को प्रस्तुत करता है, जिसे 19 मॉडलों में 500 वास्तविक दुनिया के कौशलों पर लागू किया गया था यह प्रदर्शित करने के लिए कि जबकि कौशल एजेंट के व्यवहार को महत्वपूर्ण रूप से बदलते हैं, कौशल निर्देशों के प्रति मॉडल का पालन व्यापक रूप से भिन्न होता है, जो समग्र प्रदर्शन लाभ को प्रभावित करता है।

Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby2026-06-17
🤖 AI

All Smoke, No Alarm: Oracle Signals in Agent-Authored Test Code

एजेंट-लिखित 86,000 से अधिक टेस्ट पैच का यह अनुभवजन्य अध्ययन प्रकट करता है कि जबकि 80.2% में सार्थक सत्यापन तर्क (verification logic) का अभाव है, मजबूत ओरकल संकेतों (oracle signals) की उपस्थिति किसी पुल रिक्वेस्ट के मर्ज होने की संभावना को काफी बढ़ा देती है, जो यह सुझाव देता है कि अभ्यासकर्ताओं को सरल टेस्ट-फ़ाइल गणनाओं से आगे बढ़कर ओरकल-जागरूक गुणवत्ता जांच अपनाने चाहिए।

Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim2026-06-17
🤖 machine learning

Towards Functional Correctness of Large Code Models with Selective Generation

यह शोध पत्र "FuzzEval" का प्रस्ताव देता है, जो एक ऐसा प्रतिमान (paradigm) है जो गतिशील रूप से जनरेट किए गए यूनिट टेस्ट का लाभ उठाता है ताकि एक चयनात्मक कोड जनरेटर को अनिश्चित आउटपुट देने से बचने में सक्षम बनाया जा सके, जिससे सैद्धांतिक रूप से फॉल्स डिस्कवरी रेट को नियंत्रित किया जा सके और बड़े कोड मॉडल्स की कार्यात्मक शुद्धता में सुधार किया जा सके।

Jaewoo Jeong, Taesoo Kim, Sangdon Park2026-06-16
💻 computer science

Human-Centred Requirements Engineering for Critical Systems: Insights from Disaster Early Warning Applications

यह शोध पत्र आपदा पूर्व चेतावनी प्रणालियों के लिए एक मानव-केंद्रित आवश्यकता इंजीनियरिंग प्रक्रिया का प्रस्ताव और सत्यापन करता है जो समावेशी डिजाइन दिशानिर्देशों को पता लगाने योग्य आवश्यकताओं में अनुवादित करता है, और यह अनुभवजन्य मूल्यांकन के माध्यम से प्रदर्शित करता है कि संवेदनशील उपयोगकर्ताओं की आवश्यकताओं को स्पष्ट रूप से संबोधित करना महत्वपूर्ण प्रणालियों की सुरक्षा और विश्वसनीयता को महत्वपूर्ण रूप से बढ़ाता है।

Anuradha Madugalla, Jixuan Dong, Kai Lyne Loi, Matthew Crossman, John Grundy2026-06-16
🤖 AI

DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents

यह शोधपत्र DualGauge का परिचय देता है, जो एक स्वचालित फ्रेमवर्क और बेंचमार्क है जो यह प्रदर्शित करता है कि वर्तमान LLMs और कोडिंग एजेंट एक साथ ऐसा कोड उत्पन्न करने में संघर्ष करते हैं जो कार्यात्मक रूप से सही और सुरक्षित दोनों हो, जिसमें कई भाषाओं में संयुक्त सफलता दर 15% से नीचे बनी रहती है और यह प्रकट होता है कि उन्नत मॉडल क्षमताएं या पुनरावृत्त स्कैफोल्डिंग (iterative scaffolding) सुरक्षा-कार्यात्मक समझौतों को विश्वसनीय रूप से हल नहीं करते हैं।

Rupam Patir, Keyan Guo, Suvadra Barua, Abhijeet Pathak, Dinesh Gudimetla, Jiawei Guo, Hongxin Hu, Haipeng Cai2026-06-16
💻 computer science

Bridging Natural Language and Formal Specification--Automated Translation of Software Requirements to LTL via Hierarchical Semantics Decomposition Using LLMs

यह शोध पत्र Req2LTL को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो पदानुक्रमित अर्थ संबंधी अपघटन (hierarchical semantic decomposition) के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है और वास्तविक दुनिया के एयरोस्पेस डेटासेट पर बेहतर प्रदर्शन प्राप्त करते हुए, प्राकृतिक भाषा सॉफ्टवेयर आवश्यकताओं को स्वचालित रूप से सिंटैक्टिक रूप से वैध और अर्थ संबंधी रूप से सटीक लीनियर टेम्पोरल लॉजिक (Linear Temporal Logic) विनिर्देशों में अनुवादित करने के लिए नियतात्मक नियम-आधारित संश्लेषण (deterministic rule-based synthesis) का उपयोग करता है।

Zhi Ma, Cheng Wen, Zhexin Su, Xiao Liang, Cong Tian, Shengchao Qin, Mengfei Yang2026-06-16
🤖 AI

FasterPy: An LLM-based Code Execution Efficiency Optimization Framework

FasterPy एक कम लागत वाला फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है जिन्हें रिट्रीवल-ऑगमेंटेड जनरेशन और लो-रैंक एडेप्टेशन द्वारा संवर्धित किया गया है ताकि पायथन कोड निष्पादन दक्षता को स्वचालित रूप से अनुकूलित किया जा सके, जो PIE बेंचमार्क पर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Yue Wu, Minghao Han, Ruiyin Li, Peng Liang, Amjed Tahir, Zengyang Li, Qiong Feng, Mojtaba Shahin2026-06-16
💻 computer science

A Framework of Critical Success Factors for Agile Software Development

यह व्यवस्थित साहित्य समीक्षा पांच विषयों में 21 महत्वपूर्ण सफलता कारकों की पहचान करने के लिए 53 प्राथमिक अध्ययनों का विश्लेषण करती है, जो एक सैद्धांतिक ढांचे के रूप में परिणत होती है जो एजाइल सॉफ्टवेयर विकास की सफलता प्राप्त करने में टीम प्रभावशीलता और परियोजना प्रबंधन की महत्वपूर्ण भूमिकाओं पर प्रकाश डालता है।

Ridewaan Hanslo, Maureen Tanner2026-06-16
💻 computer science

Schema-Agnostic Process Trace Construction: From Raw Tables to Execution Behavior

यह शोध पत्र एक स्कीमा-अज्ञेय (schema-agnostic) पाइपलाइन का प्रस्ताव करता है जो प्रमुख और अस्थायी विशेषताओं की सांख्यिकीय पहचान करके, अंतर-तालिका संबंधों की खोज करके, और घटना क्रम को मॉडल करने के लिए एक टेम्पोरल कन्वोल्यूशनल नेटवर्क का उपयोग करके, कच्चे, ढीले ढंग से जुड़े रिलेशनल टेबल्स से उच्च-सटीक प्रक्रिया निष्पादन ट्रेस को स्वचालित रूप से पुनर्गठित करता है, जिससे गतिशील सूचना प्रणालियों में पूर्व-निर्धारित स्कीमा या डोमेन टेम्पलेट्स की आवश्यकता समाप्त हो जाती है।

Joel Lim Zhi Quan, Tan Kar Way, Lau Hoong Chuin2026-06-16