💻 computer science

Does My README File Need To Be Updated? Exploring LLM-Based README Maintenance

यह शोध पत्र एक हल्के, मानव-इन-द-लूप लार्ज लैंग्वेज मॉडल (LLM) पाइपलाइन का प्रस्ताव और मूल्यांकन करता है जो पुल रिक्वेस्ट द्वारा ट्रिगर होने वाले सटीक README अपडेट की आवश्यकता का स्वतः पता लगाता है, उनके स्थान की पहचान करता है, और उनका औचित्य सिद्ध करता है, जो हजारों ओपन-सोर्स सॉफ्टवेयर प्रोजेक्ट्स में आउटडेटेड डॉक्यूमेंटेशन को कम करने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Haoyu Gao, Hong Yi Lin, Christoph Treude, Gregory Gay, Mansooreh Zahedi2026-03-03
💻 computer science

SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark

यह शोध पत्र SWE-ABS को पेश करता है, जो एक एडवरसेरियल फ्रेमवर्क है जो कवरेज-संचालित संवर्धन (coverage-driven augmentation) और म्यूटेशन-संचालित परीक्षण के माध्यम से टेस्ट सूट्स को मजबूत करता है ताकि पहले से "हल" किए गए पैच में सिमेंटिक त्रुटियों को उजागर किया जा सके, जिससे यह पता चलता है कि SWE-Bench Verified लीडरबोर्ड पर शीर्ष प्रदर्शन करने वाले एजेंटों की सफलता दर काफी बढ़ी हुई है, जो इन उन्नत बेंचमार्क के विरुद्ध मूल्यांकन किए जाने पर 16 प्रतिशत अंकों से अधिक गिर जाती है।

Boxi Yu, Yang Cao, Yuzhong Zhang, Liting Lin, Junjielong Xu, Zhiqing Zhong, Qinghua Xu, Guancheng Wang, Jialun Cao, Shin (…)2026-03-03
🤖 AI

Are LLMs Reliable Code Reviewers? Systematic Overcorrection in Requirement Conformance Judgement

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स व्यवस्थित रूप से ओवरकरेक्ट करते हुए सही कोड को प्राकृतिक भाषा की आवश्यकताओं के अनुरूप न होने के रूप में गलत वर्गीकृत करते हैं, एक ऐसी त्रुटि जो विस्तृत प्रॉम्प्टिंग द्वारा और बढ़ जाती है, और स्वचालित कोड समीक्षा में इन विश्वसनीयता संबंधी समस्याओं को कम करने के लिए एक फिक्स-गाइडेड वेरिफिकेशन फ़िल्टर का प्रस्ताव देता है।

Haolin Jin, Huaming Chen2026-03-03
🤖 machine learning

TopoEdge: Topology-Grounded Agentic Framework for Edge Networking Code Generation and Repair

TopoEdge एक टोपोलॉजी-आधारित, एज-डिप्लॉयबल एजेंटिक फ्रेमवर्क है जो ग्राफ न्यूरल नेटवर्क एम्बेडिंग्स और रिट्रीवल-ऑगमेंटेड जनरेशन का लाभ उठाकर प्लानिंग, जनरेशन और निष्पादन-आधारित वेरिफिकेशन एजेंटों के एक सहयोगी लूप के माध्यम से सॉफ्टवेयर-डिफाइंड नेटवर्किंग कॉन्फ़िगरेशन के एंड-टू-एंड जनरेशन, वेरिफिकेशन और इटरेटिव रिपेयर को स्वचालित करता है।

Haomin Qi, Bohan Liu, Zihan Dai, Yunkai Gao2026-03-03
🤖 AI

SWE-Hub: A Unified Production System for Scalable, Executable Software Engineering Tasks

SWE-Hub एक एकीकृत उत्पादन प्रणाली है जो सॉफ्टवेयर इंजीनियरिंग एजेंट के प्रशिक्षण और मूल्यांकन के पूर्ण जीवनचक्र का समर्थन करने के लिए स्वचालित वातावरण सेटअप, उच्च-थ्रूपुट बग संश्लेषण और विविध कार्य पीढ़ी को एकीकृत करके स्केलेबल, निष्पादन योग्य सॉफ्टवेयर इंजीनियरिंग डेटा की कमी को दूर करती है।

Yucheng Zeng, Shupeng Li, Daxiang Dong, Ruijie Xu, Zimo Chen, Liwei Zheng, Yuxuan Li, Zhe Zhou, Haotian Zhao, Lun Tian (…)2026-03-03
🤖 AI

ContextCov: Deriving and Enforcing Executable Constraints from Agent Instruction Files

ContextCov एक ऐसा फ्रेमवर्क है जो स्वायत्त (autonomous) LLM एजेंटों में "कॉन्टेक्स्ट ड्रिफ्ट" (Context Drift) को कम करने के लिए निष्क्रिय प्राकृतिक भाषा निर्देशों को स्वचालित रूप से सक्रिय, निष्पादन योग्य गार्डरेल्स (guardrails) में परिवर्तित करता है, जो स्थिर (static), रनटाइम और आर्किटेक्चरल डोमेन में प्रोजेक्ट-विशिष्ट बाधाओं को लागू करने के लिए डिज़ाइन किया गया है।

Reshabh K Sharma2026-03-03
🤖 AI

PARCER as an Operational Contract to Reduce Variance, Cost, and Risk in LLM Systems

यह शोध पत्र PARCER को प्रस्तुत करता है, जो एक डिक्लेरेटिव YAML-आधारित ऑपरेशनल कॉन्ट्रैक्ट फ्रेमवर्क है जो सात संरचित चरणों के माध्यम से अनस्ट्रक्चर्ड LLM इंटरैक्शन को वर्जन्ड, एक्जीक्यूटेबल आर्टिफैक्ट्स में परिवर्तित करता है ताकि स्टोकेस्टिक वेरिएंस और कॉन्टेक्स्ट डिग्रेडेशन को कम किया जा सके, जिससे गवर्न करने योग्य, लागत प्रभावी और ऑडिट करने योग्य AI सिस्टम सक्षम हो सकें।

Elzo Brito dos Santos Filho2026-03-03
💻 computer science

Where Do Smart Contract Security Analyzers Fall Short?

यह शोध पत्र यह पहचान करता है कि स्मार्ट कॉन्ट्रैक्ट सुरक्षा विश्लेषकों (smart contract security analyzers) को अपनाने में सीमितता का कारण महत्वपूर्ण प्रदर्शन अंतराल है—विशेष रूप से उच्च फाल्स-पॉजिटिव दरें, लंबा रनटाइम और अस्पष्ट स्पष्टीकरण—जो 653 वास्तविक दुनिया के अनुबंधों पर छह उपकरणों के बड़े पैमाने पर बेंचमार्किंग और 150 पेशेवरों के सर्वेक्षण को जोड़कर मापने योग्य सटीकता संबंधी मुद्दों को डेवलपर विश्वास बाधाओं से जोड़ता है।

Tamer Abdelaziz, Salma Alsaghir, Karim Ali2026-03-03
💻 computer science

Clawdrain: Exploiting Tool-Calling Chains for Stealthy Token Exhaustion in OpenClaw Agents

यह शोध पत्र Clawdrain को प्रस्तुत करता है, जो एक ट्रोजनयुक्त कौशल (Trojanized skill) है जो OpenClaw एजेंटों की टूल-कॉलिंग श्रृंखलाओं का लाभ उठाकर मल्टी-टर्न वेरिफिकेशन लूप उत्पन्न करता है, यह प्रदर्शित करते हुए कि इस तरह के हमले उत्पादन वातावरण (production environments) में 6-9 गुना टोकन प्रवर्धन (token amplification) प्राप्त कर सकते हैं और यह भी प्रकट करते हैं कि स्वायत्त टूल संरचना (autonomous tool composition) और वास्तुशिल्प कमजोरियां हमले के परिमाण और दृश्यता को कैसे आकार देती हैं।

Ben Dong, Hui Feng, Qian Wang2026-03-03
🤖 AI

RepoRepair: Leveraging Code Documentation for Repository-Level Automated Program Repair

RepoRepair एक नवीन, लागत प्रभावी स्वचालित प्रोग्राम रिपेयर फ्रेमवर्क है जो रिपॉजिटरी-स्तरीय फॉल्ट लोकलाइजेशन को बढ़ाने के लिए LLM-जनरेटेड पदानुक्रमित (hierarchical) कोड डॉक्यूमेंटेशन का लाभ उठाता है और SWE-bench बेंचमार्क पर अत्याधुनिक (state-of-the-art) रिपेयर दरएं प्राप्त करता है।

Zhongqiang Pan, Chuanyi Li, Wenkang Zhong, Yi Feng, Bin Luo, Vincent Ng2026-03-03