💻 computer science

Compressing Code Context for LLM-based Issue Resolution

यह शोध पत्र SWEzze का प्रस्ताव करता है, जो एक नया फ्रेमवर्क है जो ऑरेकल-गाइडेड कोड डिस्टिलेशन (Oracle-guided Code Distillation) का उपयोग करके एक हल्के मॉडल को प्रशिक्षित करता है जो शोर को फ़िल्टर करते हुए आवश्यक फिक्स सामग्री को संरक्षित करके कोड संदर्भ को प्रभावी ढंग से संकुचित करता है, जिससे टोकन लागत में काफी कमी आती है और फ्रंटियर LLMs में GitHub इश्यू समाधान दरों में सुधार होता है।

Haoxiang Jia, Earl T. Barr, Sergey Mechtaev2026-03-31
💻 computer science

A Comprehensive Evaluation of Parameter-Efficient Fine-Tuning on Code Smell Detection

यह शोध पत्र एक कठोरता से सत्यापित बेंचमार्क प्रस्तुत करके स्वचालित कोड स्मेल डिटेक्शन की चुनौतियों का समाधान करता है और यह प्रदर्शित करता है कि पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग (PEFT) विधियाँ फुल फाइन-ट्यूनिंग की तुलना में कम्प्यूटेशनल लागतों को काफी कम करते हुए मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करती हैं।

Beiqi Zhang, Peng Liang, Xin Zhou, Xiyu Zhou, David Lo, Qiong Feng, Zengyang Li, Lin Li2026-03-30
🤖 AI

ProbGuard: Probabilistic Runtime Monitoring for LLM Agent Safety

प्रोबगार्ड (ProbGuard) एक सक्रिय रनटाइम मॉनिटरिंग फ्रेमवर्क है जो भविष्य के सुरक्षा उल्लंघनों की भविष्यवाणी करने और संभाव्यता गारंटी के साथ हस्तक्षेप करने के लिए डिस्क्रीट-टाइम मार्कोव चेन (Discrete-Time Markov Chains) के माध्यम से व्यवहार संबंधी गतिशीलता को मॉडल करके एलएलएम (LLM) एजेंट सुरक्षा को बढ़ाता है, जो स्वायत्त ड्राइविंग और एम्बोडीड रोबोटिक्स जैसे डोमेन में कार्य प्रदर्शन को बनाए रखते हुए असुरक्षित व्यवहारों को काफी कम करता है।

Haoyu Wang, Christopher M. Poskitt, Jiali Wei, Jun Sun2026-03-30
🤖 AI

SWE Context Bench: A Benchmark for Context Learning in Coding

यह शोध पत्र SWE-ContextBench प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि प्रोग्रामिंग एजेंट संबंधित सॉफ्टवेयर इंजीनियरिंग कार्यों में संदर्भ (context) का पुन: उपयोग कैसे करते हैं, जो यह प्रदर्शित करता है कि सही ढंग से चयनित सारांशित संदर्भ सटीकता में महत्वपूर्ण सुधार करता है और साथ ही रनटाइम और टोकन लागत को कम करता है।

Jared Zhu, Minhao Hu, Junde Wu2026-03-30
💻 computer science

Consistency Amplifies: How Behavioral Variance Shapes Agent Accuracy

यह शोध पत्र यह प्रदर्शित करता है कि जबकि LLM-आधारित एजेंटों में उच्च व्यवहार संबंधी निरंतरता (behavioral consistency) आम तौर पर SWE-bench जैसे जटिल कार्यों पर बेहतर सटीकता के साथ सह-संबंधित होती है, निरंतरता अंततः मौजूदा व्याख्याओं को—चाहे वे सही हों या गलत—बढ़ाती है, जिसका अर्थ है कि उत्पादन विश्वसनीयता (production reliability) के लिए केवल निष्पादन निरंतरता (execution consistency) की तुलना में व्याख्या सटीकता (interpretation accuracy) एक अधिक महत्वपूर्ण कारक है।

Aman Mehta2026-03-30
💻 computer science

UCAgent: An End-to-End Agent for Block-Level Functional Verification

यह शोध पत्र UCAgent को प्रस्तुत करता है, जो एक एंड-टू-एंड एजेंट है जो एक शुद्ध पायथन वातावरण, स्वचालित चेकर के साथ 31-चरणीय सूक्ष्म वर्कफ़्लो और उच्च कवरेज प्राप्त करने तथा नाजुक LLM-जनरेटेड सिस्टमवेरिलॉग (SystemVerilog) कोड पर निर्भर रहे बिना डिज़ाइन दोषों को उजागर करने के लिए एक 'वेरिफिकेशन कंसिस्टेंसी लेबलिंग मैकेनिज्म' का उपयोग करके ब्लॉक-स्तरीय कार्यात्मक सत्यापन को स्वचालित करता है।

Junyue Wang, Zhicheng Yao, Yan Pi, Xiaolong Li, Fangyuan Song, Jinru Wang, Yunlong Xie, Sa Wang, Yungang Bao2026-03-30
💻 computer science

The Specification as Quality Gate: Three Hypotheses on AI-Assisted Code Review

यह शोध पत्र तर्क देता है कि निष्पादन योग्य विशिष्टताओं (executable specifications) के बिना एआई-सहायता प्राप्त कोड समीक्षा संरचनात्मक रूप से चक्रीय और अप्रभावी है, और इसके बजाय एक ऐसे वर्कफ़्लो का प्रस्ताव करता है जहाँ विशिष्टताएँ पहले जटिल समस्याओं को सत्यापन योग्य (verifiable) समस्याओं में परिवर्तित करती हैं, जिससे एआई समीक्षा केवल शेष स्थापत्य अवशेष (architectural residual) पर ध्यान केंद्रित कर पाती है।

Christo Zietsman2026-03-30
💻 computer science

A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation

यह शोध पत्र एक जज एजेंट (Judge Agent) प्रस्तुत करता है जो एआई-जनित वैज्ञानिक सिमुलेशन कोड में साइलेंट फेलियर्स (silent failures) को 42% से घटाकर 1.5% करने के लिए शास्त्रीय गणितीय सत्यापन को स्वचालित करता है, जिसने एक नए स्पेक्सिफिकेशन फॉर्मेट और औपचारिक रूप से परिभाषित सिम्युलेबिलिटी सीमाओं (simulability boundaries) के माध्यम से ब्लाइंडेड कार्यों पर 89% सफलता और क्लिनिकल सीटी डेटा पर 99% विशेषज्ञ-गुणवत्ता वाला प्रदर्शन प्राप्त किया है।

Chengshuai Yang2026-03-30
💻 computer science

Self-Organizing Multi-Agent Systems for Continuous Software Development

यह शोधपत्र TheBotCompany को प्रस्तुत करता है, जो एक ओपन-सोर्स फ्रेमवर्क है जो वास्तविक दुनिया की परियोजनाओं पर प्रभावी, निरंतर और मील के पत्थर-आधारित (milestone-driven) सॉफ्टवेयर विकास को सक्षम करने के लिए तीन-चरणीय स्टेट मशीन और एसिंक्रोनस मानव निरीक्षण के साथ स्व-संगठित मल्टी-एजेंट सिस्टम का लाभ उठाता है।

Wenhan Lyu, Yue Xiao, Yixuan Zhang, Yifan Sun2026-03-30
🤖 AI

SWE-PRBench: Benchmarking AI Code Review Quality Against Pull Request Feedback

SWE-PRBench 350 मानव-एनोटेटेड पुल रिक्वेस्ट का एक बेंचमार्क पेश करता है जो यह प्रकट करता है कि वर्तमान फ्रंटियर एआई मॉडल केवल 15-31% मानव-फ्लैग की गई समस्याओं का पता लगा पाते हैं और संदर्भ (context) बढ़ने के साथ उनके प्रदर्शन में गिरावट आती है, जो मजबूत कोड जनरेशन परिणामों के बावजूद एआई कोड समीक्षा और मानव विशेषज्ञ क्षमताओं के बीच एक महत्वपूर्ण अंतर को उजागर करता है।

Deepak Kumar2026-03-30