💻 computer science

AI-Assisted Code Review as a Scaffold for Code Quality and Self-Regulated Learning: An Experience Report

यह शोध पत्र सॉफ्टवेयर इंजीनियरिंग कैपस्टोन परियोजनाओं में कोड गुणवत्ता और स्व-नियमित शिक्षण को सुदृढ़ करने के लिए गिटहब पुल रिक्वेस्ट (GitHub pull requests) में एक एलएलएम-आधारित (LLM-based) समीक्षक को एकीकृत करने पर एक मिश्रित-पद्धति अनुभव रिपोर्ट प्रस्तुत करता है, जो यह प्रदर्शित करता है कि उचित निर्देशात्मक मार्गदर्शन के साथ जुड़ने पर संरचित एआई फीडबैक पुनरावृत्ति विकास और सार्थक छात्र जुड़ाव को बढ़ावा दे सकता है।

Eduardo Oliveira, Michael Fu, Patanamon Thongtanunam, Sonsoles López-Pernas, Mohammed Saqr2026-04-28
💻 computer science

Towards Agentic Test-Driven Quality Assurance for 6G Networks

यह शोध पत्र एक एजेंटिक, इंटेंट-ड्रिवन ऑर्केस्ट्रेशन फ्रेमवर्क का प्रस्ताव करता है जो 6G नेटवर्क के लिए, स्वचालित परीक्षण व्युत्पत्ति (ऑटोमेटेड टेस्ट डेरिवेशन) के माध्यम से सक्रिय SLA अनुपालन सुनिश्चित करने हेतु TM Forum सूचना मॉडलों और मल्टी-एजेंट सिस्टम के साथ इंटेंट को-क्रिएशन को 'टेस्ट-ड्रिवन क्वालिटी एश्योरेंस' प्रतिमान के साथ एकीकृत करता है।

Christos Tranoris, Besiana Agko, Kostis Trantzas, Irene Denazi2026-04-28
💻 computer science

Can LLMs be Effective Code Contributors? A Study on Open-source Projects

यह अध्ययन एक सत्यापन और पुष्टिकरण ढांचे के माध्यम से बड़े पैमाने की ओपन-सोर्स परियोजनाओं में योगदान देने में तीन LLMs की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया कि वे जटिल संदर्भों, नए कोड जनरेशन और परियोजना-विशिष्ट मानकों को बनाए रखने में संघर्ष करते हैं, जबकि उनकी सफलता दर 0% से 60% के बीच काफी भिन्न होती है।

Chun Jie Chong (Zephyr), Muyeed Ahmed (Zephyr), Zhihao (Zephyr), Yao, Iulian Neamtiu2026-04-28
💻 computer science

Empirical Insights of Test Selection Metrics under Multiple Testing Objectives and Distribution Shifts

यह शोध पत्र 15 परीक्षण चयन मेट्रिक्स का एक व्यापक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो चिकित्सकों के लिए एक व्यापक बेंचमार्क प्रदान करने हेतु कई परीक्षण उद्देश्यों, विविध आउट-ऑफ-डिस्ट्रीब्यूशन परिदृश्यों और विभिन्न डेटा मोडैलिटीज में उनकी प्रभावशीलता का मूल्यांकन करता है।

Jingyu Zhang, Fan Wang, Jacky Keung, Yihan Liao, Yan Xiao, Lei Ma2026-04-28
🤖 machine learning

UniAda: Universal Adaptive Multi-objective Adversarial Attack for End-to-End Autonomous Driving Systems

UniAda एक मल्टी-ऑब्जेक्टिव व्हाइट-बॉक्स एडवरसैरियल अटैक है जिसे एंड-टू-एंड ऑटोनॉमस ड्राइविंग सिस्टम के लिए डिज़ाइन किया गया है, जो इमेज-अग्नोस्टिक परटर्बेशन्स के माध्यम से स्टीयरिंग एंगल और वाहन की गति दोनों को एक साथ मैनिपुलेट करने के लिए एक एडेप्टिव वेटिंग स्कीम का उपयोग करता है।

Jingyu Zhang, Jacky Wai Keung, Yan Xiao, Yihan Liao, Yishu Li, Xiaoxue Ma2026-04-28
💻 computer science

Automating Categorization of Scientific Texts with In-Context Learning and Prompt-Chaining in Large Language Models

यह अध्ययन पदानुक्रमित ORKG वर्गीकरण का उपयोग करके वैज्ञानिक ग्रंथों को वर्गीकृत करने में ऑफ-द-शेल्फ लार्ज लैंग्वेज मॉडल्स की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया कि प्रॉम्प्ट चेनिंग, इन-कॉन्टेक्स्ट लर्निंग और स्टेट-ऑफ-द-आर्ट मॉडल्स की तुलना में शीर्ष-स्तरीय श्रेणियों के लिए बेहतर प्रदर्शन करती है, लेकिन फिर भी तीसरे स्तर के गहरे विषय वर्गीकरण के साथ संघर्ष करती है।

Gautam Kishore Shahi, Oliver Hummel2026-04-28
💻 computer science

Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

यह शोध पत्र एक ऐसे ढांचे को प्रस्तुत करता है जो साइबर-फिजिकल सिस्टम के लिए सुरक्षा परिचालन नियमों को अपडेट करने हेतु काउंटरफैक्चुअल रीजनिंग (counterfactual reasoning) को व्याकरण-प्रतिबंधित परिशोधन (grammar-constrained refinement) के साथ जोड़ता है, यह प्रदर्शित करते हुए कि हालांकि यह दृष्टिकोण स्वायत्त ड्राइविंग नियमों में विसंगतियों को हल करता है, लेकिन लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग ओवरफिटिंग और असुरक्षित परिशोधन को रोकने के लिए कठोर व्याकरण प्रवर्तन और सिमेंटिक सत्यापन की आवश्यकता को अनिवार्य बनाता है।

Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi, Sam Emmanuel Kathiravan2026-04-28
💻 computer science

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval एक ऐसा फ्रेमवर्क है जो एजेंटिक वर्कफ़्लो को निर्देशित अचक्रीय ग्राफ़ (DAGs) के रूप में औपचारिक रूप देता है ताकि संरचित, चरण-स्तरीय मूल्यांकन और स्वचालित मूल कारण एट्रिब्यूशन को सक्षम किया जा सके, जो विफलता पहचान रिकॉल में एंड-टू-एंड विधियों से काफी बेहतर प्रदर्शन करता है और उत्पादन वातावरणों में डिबगिंग समय को कम करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28
💻 computer science

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

यह शोधपत्र ClawMark प्रस्तुत करता है, जो एक गतिशील, स्टेटफुल (stateful) वातावरण में मल्टी-टर्न, मल्टी-डे, मल्टीमॉडल सहकर्मी एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि जबकि फ्रंटियर मॉडल आंशिक प्रगति दिखाते हैं, वे बाह्य परिवर्तनों के अनुकूल होने और पूर्ण एंड-टू-एंड कार्य सफलता प्राप्त करने में काफी संघर्ष करते हैं।

Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu (…)2026-04-28
💻 computer science

Query2Diagram: Answering Developer Queries with UML Diagrams

यह शोध पत्र Query2Diagram प्रस्तुत करता है, जो एक फाइन-ट्यून्ड एलएलएम (LLM) दृष्टिकोण है जो पारंपरिक रिवर्स इंजीनियरिंग टूल की सीमाओं को दूर करने के लिए प्राकृतिक भाषा वाले डेवलपर प्रश्नों से अर्थपूर्ण रूप से केंद्रित यूएमएल (UML) आरेख उत्पन्न करता है, जिससे प्रासंगिक कोड तत्वों के संरचनात्मक रूप से सुदृढ़ और संदर्भ-जागरूक विज़ुअलाइज़ेशन प्राप्त होते हैं।

Oleg Baryshnikov (HSE University), Anton M. Alekseev (St. Petersburg Department of Steklov Mathematical Institute, RAS (…)2026-04-28