💻 computer science

MEMRES: A Memory-Augmented Resolver with Confidence Cascade for Agentic Python Dependency Resolution

MEMRES एक एजेंटिक सिस्टम है जो क्यूरेटेड नॉलेज बेस, सिमेंटिक विश्लेषण और ह्यूरिस्टिक डिटेक्टर्स का लाभ उठाने के बाद केवल अंतिम विकल्प के रूप में LLM का उपयोग करते हुए, एक मल्टी-लेवल कॉन्फिडेंस कैस्केड और एक सेल्फ-इवॉल्विंग मेमोरी को नियोजित करके पायथन डिपेंडेंसी रेजोल्यूशन में मानक LLMs की तुलना में काफी बेहतर प्रदर्शन करता है।

Dao Sy Duy Minh, Tran Chi Nguyen, Trung Kiet Huynh, Pham Phu Hoa, Nguyen Lam Phu Quy, Vu Nguyen2026-04-21
💻 computer science

SynthFix: Adaptive Neuro-Symbolic Code Vulnerability Repair

SynthFix एक हाइब्रिड न्यूरल-सिम्बॉलिक फ्रेमवर्क है जो एक एडैप्टिव ट्रेनिंग स्ट्रैटेजी को एक राउटर मॉडल के माध्यम से उपयोग करके LLM-आधारित कोड वल्नरेबिलिटी रिपेयर को बढ़ाता है, जो सामान्य पैटर्न के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और जटिल रिफाइनमेंट के लिए सिम्बॉलिक फीडबैक के साथ रिवॉर्ड फाइन-ट्यूनिंग के बीच नमूनों को गतिशील रूप से निर्देशित करता है, जिससे जावास्क्रिप्ट और C बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Yifan Zhang, Jieyu Li, Kexin Pei, Yu Huang, Kevin Leach2026-04-21
💻 computer science

Persona-Based Requirements Engineering for Explainable Multi-Agent Educational Systems: A Scenario Simulator for Clinical Reasoning Training

यह शोध पत्र व्याख्यात्मक मल्टी-एजेंट शैक्षिक प्रणालियों के लिए एक मानव-केंद्रित, व्यक्तित्व-संचालित आवश्यकता इंजीनियरिंग ढांचे का प्रस्ताव करता है, जो एक क्लिनिकल रीजनिंग सिम्युलेटर के माध्यम से अपनी प्रभावशीलता प्रदर्शित करता है जिसने विकास के शुरुआती चरणों से ही पारदर्शिता और विश्वसनीयता सुनिश्चित करते हुए चिकित्सा छात्रों के कौशल में सफलतापूर्वक सुधार किया।

Weibing Zheng, Laurah Turner, Jess Kropczynski, Matthew Kelleher, Murat Ozer, Shane Halse2026-04-21
💻 computer science

React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend

यह शोध पत्र NVIDIA GH200 हार्डवेयर का उपयोग करके एक जटिल React Native एप्लिकेशन कार्य पर पांच अत्याधुनिक ओपन-वेट्स कोडिंग मॉडल्स का मूल्यांकन करता है, जो यह प्रकट करता है कि SWE-Bench रैंकिंग वास्तविक दुनिया के प्रदर्शन की भविष्यवाणी करने में विफल रहती है, तापमान-प्रेरित हैंग (temperature-induced hangs) और रीजनिंग ट्रेस लीक्स (reasoning trace leaks) जैसी महत्वपूर्ण परिनियोजन त्रुटियों की पहचान करती है, और यह प्रदर्शित करती है कि छोटे, कुशल मॉडल हार्डवेयर की लागत के एक अंश पर बड़े समकक्षों की क्षमता के बराबर हो सकते हैं।

Alex Potanin2026-04-21
💻 computer science

A Pilot Study on Detecting Software Design Patterns with Large Language Models: An Empirical Evaluation

यह पायलट अध्ययन सोर्स कोड, प्लांटयूएमएल (PlantUML) आरेख और टेक्स्ट विवरणों का उपयोग करके पांच सॉफ्टवेयर डिज़ाइन पैटर्न का पता लगाने में चार लार्ज लैंग्वेज मॉडल्स और तीन एन्सेम्बल दृष्टिकोणों की प्रभावशीलता का अनुभवजन्य मूल्यांकन करता है, जिसमें यह पाया गया कि नेक्स्टकोडर (NextCoder) और गेम्मा 3 (Gemma 3) उच्च सटीकता प्राप्त करते हैं जबकि एन्सेम्बल विधियाँ समग्र पहचान दक्षता में सुधार करती हैं।

Oishik Chowdhury, Bastin Tony Roy Savarimuthu, Sherlock A. Licorish2026-04-21
💬 NLP

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

यह शोध पत्र प्रिसिस डिबगिंग बेंचमार्क (PDB) फ्रेमवर्क प्रस्तुत करता है जो यह प्रकट करता है कि सीमावर्ती (फ्रंटियर) लार्ज लैंग्वेज मॉडल्स, यूनिट-टेस्ट पास दरों को उच्च स्तर पर प्राप्त करने के बावजूद, बार-बार कोड को अत्यधिक संपादित (ओवर-एडिट) करने के कारण सटीक डिबगिंग करने में संघर्ष करते हैं, जो एक ऐसी सीमा है जो पुनरावृत्ति रणनीतियों (इटरेटिव स्ट्रैटेजीज) के साथ भी बनी रहती है और कोडिंग मॉडल की पोस्ट-ट्रेनिंग पाइपलाइनों पर पुनर्विचार करने का आह्वान करती है।

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia2026-04-21
💻 computer science

Agentic Education: Using Claude Code to Teach Claude Code

यह शोध पत्र "cc-self-train" को प्रस्तुत करता है, जो एक मॉड्यूलर, अनुकूली पाठ्यक्रम है जो डेवलपर्स को एक प्रगतिशील व्यक्तित्व मॉडल (persona model), क्रॉस-डोमेन प्रोजेक्ट ट्रांसफर और ऑटो-अपडेटिंग सामग्री के माध्यम से एजेंटिक एआई टूल क्लाउड कोड (Claude Code) में महारत हासिल करना सिखाता है, जो 50 मॉड्यूल में आत्म-प्रभावकारिता (self-efficacy) में सांख्यिकीय रूप से महत्वपूर्ण लाभ प्रदर्शित करता है।

Zain Naboulsi2026-04-21
💻 computer science

Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications

यह शोध पत्र \textsc{Prometheus} को प्रस्तुत करता है, जो एक नवीन एजेंटिक फ्रेमवर्क है जो विफलता रिपोर्टों (failure reports) से निष्पादन योग्य गेरकिन (Gherkin) विशिष्टताओं को रिवर्स-इंजीनियर करके और उन्हें 'रिक्वायरमेंट क्वालिटी एश्योरेंस' लूप के माध्यम से सत्यापित करके स्वचालित प्रोग्राम रिपेयर में इरादे के अंतर (intent gap) को पाटता है, जिससे Defects4J बेंचमार्क पर 93.97% सही पैच दर प्राप्त होती है।

Yongchao Wang, Zhiqiu Huang2026-04-21
💻 computer science

Single-Language Evidence Is Insufficient for Automated Logging: A Multilingual Benchmark and Empirical Study with LLMs

यह शोध पत्र MultiLogBench प्रस्तुत करता है, जो छह प्रोग्रामिंग भाषाओं और 63,965 कोड इंस्टेंसों में फैला एक व्यापक बहुभाषी बेंचमार्क है, जो यह प्रदर्शित करता है कि स्वचालित लॉगिंग के बारे में पुख्ता दावों के लिए एकल-भाषा डेटासेट से परे मूल्यांकन की आवश्यकता है क्योंकि मॉडल प्रदर्शन में महत्वपूर्ण क्रॉस-लैंग्वेज भिन्नताएं और रखरखाव-उन्मुख सत्यापन का अत्यधिक महत्व है।

Renyi Zhong, Yichen Li, Yulun Wu, Jinxi Kuang, Yintong Huo, Michael R. Lyu2026-04-21
💬 NLP

Toward Reusability of AI Models Using Dynamic Updates of AI Documentation

यह शोध पत्र विकसित होते सर्वोत्तम अभ्यासों के साथ तालमेल बिठाने के लिए एआई मॉडल दस्तावेज़ीकरण को गतिशील रूप से अपडेट करने हेतु एक डेटा-संचालित, समुदाय-आधारित कार्यप्रणाली का प्रस्ताव करता है, जिससे मॉडल कार्डों में होने वाले सामयिक अंतराल (टेम्पोरल लैग) को संबोधित किया जा सके और हगिंग फेस पर दस्तावेज़ीकरण की गुणवत्ता और मॉडल जुड़ाव मेट्रिक्स के बीच सकारात्मक सहसंबंध प्रदर्शित करके एआई मॉडल की पुन: प्रयोज्यता को बढ़ाया जा सके।

Peter Bajcsy, Walid Keyrouz2026-04-21