💻 computer science

Fine-Tuning Models for Automated Code Review Feedback

यह अध्ययन प्रदर्शित करता है कि पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग (PEFT), ओपन-सोर्स कोड लामा मॉडल द्वारा उत्पन्न स्वचालित कोड समीक्षा फीडबैक की गुणवत्ता को महत्वपूर्ण रूप से बढ़ाता है, जो प्रॉम्प्ट इंजीनियरिंग से बेहतर प्रदर्शन करता है और चैटजीपीटी जैसे प्रोप्राइटरी मॉडल्स के तुलनीय प्रभावशीलता प्राप्त करते हुए प्रोग्रामिंग शिक्षा के लिए एक स्केलेबल और लागत प्रभावी समाधान प्रदान करता है।

Smitha S Kumar, Michael A Lones, Manuel Maarek, Hind Zantout2026-05-14
💻 computer science

User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models

यह शोध पत्र उपयोगिता संबंधी आवश्यकताओं (usability requirements) के लिए उपयोगकर्ता समीक्षाओं का विश्लेषण करने हेतु लार्ज लैंग्वेज मॉडल्स (LLMs) के उपयोग की क्षमता की जांच करता है, जो एक कोडेड डेटासेट और प्रॉम्प्ट इंजीनियरिंग के माध्यम से यह प्रदर्शित करता है कि यदि प्रॉम्प्ट्स को सावधानीपूर्वक डिज़ाइन किया जाए, तो LLMs उपयोगिता संबंधी समस्याओं की पहचान करने में मानव-तुलनीय प्रदर्शन प्राप्त कर सकते हैं।

Cedric Wellhausen, Laura Reinhardt, Kurt Schneider2026-05-14
🤖 AI

Agentic Interpretation: Lattice-Structured Evidence for LLM-Based Program Analysis

यह शोध पत्र "एजेंटिक इंटरप्रिटेशन" (agentic interpretation) प्रस्तावित करता है, जो एक ऐसा ढांचा है जो विश्लेषण लक्ष्यों को एक सीमित-ऊंचाई वाले लैटिस (lattice) के भीतर ट्रैक किए गए स्थानीय दावों में विभाजित करके, एलएलएम-संचालित प्रोग्राम रीजनिंग पर लैटिस-आधारित स्टैटिक एनालिसिस सिद्धांतों को लागू करता है, जिससे भंगुर वन-शॉट दृष्टिकोणों की तुलना में अधिक सुदृढ़, साक्ष्य-आधारित और पुनरावृत्तिपूर्ण प्रोग्राम विश्लेषण सक्षम होता है।

Jacqueline L. Mitchell, Chao Wang2026-05-14
🤖 AI

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

यह शोध पत्र AgentLens प्रस्तुत करता है, जो यह प्रदर्शित करके कि केवल बाइनरी टेस्ट परिणामों पर निर्भर रहना समाधान की गुणवत्ता में महत्वपूर्ण अंतरों को छिपा देता है, SWE-agent मूल्यांकन में "लकी पास" (Lucky Pass) घटनाओं की व्यापकता को उजागर करता है, और मॉडल प्रदर्शन को अधिक सटीक रूप से रैंक करने के लिए टास्क-लेवल प्रिफिक्स ट्री एक्सेप्टर (Prefix Tree Acceptor) संदर्भों का उपयोग करते हुए एक प्रोसेस-लेवल मूल्यांकन पद्धति का प्रस्ताव करता है।

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu2026-05-14
🤖 AI

Protocol-Driven Development: Governing Generated Software Through Invariants and Evidence

यह शोध पत्र प्रोटोकॉल-ड्रिवन डेवलपमेंट (PDD) को प्रस्तुत करता है, जो स्वचालित सॉफ्टवेयर इंजीनियरिंग के लिए एक शासन मॉडल है जो क्षणिक कोड के बजाय संरचनात्मक, व्यवहारिक और परिचालन अपरिवर्तनीयताओं (invariants) को परिभाषित करने वाले मशीन-प्रवर्तनीय प्रोटोकॉल को प्राथमिकता देता है, यह सुनिश्चित करते हुए कि उत्पन्न कार्यान्वयनों को जनरेटर में विश्वास के बजाय प्रोटोकॉल अनुपालन के सत्यापन योग्य साक्ष्य के माध्यम से ही स्वीकार किया जाए।

Jun He, Deying Yu2026-05-14
💻 computer science

Security Incentivization: An Empirical Study of how Micropayments Impact Code Security

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि टीम-स्तरीय प्रोत्साहनों को स्वचालित सुरक्षा मेट्रिक्स से जोड़ने से कोड सुरक्षा समस्या घनत्व में काफी कमी आती है, विशेष रूप से बैक-एंड घटकों में, बिना कोड की मात्रा को कृत्रिम रूप से बढ़ाए, जिससे सॉफ्टवेयर सुरक्षा में सुधार के लिए माइक्रोपेमेंट-शैली के पुरस्कारों की प्रभावशीलता प्रमाणित होती है।

Stefan Rass, Martin Pinzger, Rainer W. Alexandrowicz, Georg Sengstbratl, Johann Glock, Alexander Lercher, Fabian Oraze (…)2026-05-14
💻 computer science

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

यह शोध पत्र SWE-Cycle को प्रस्तुत करता है, जो 489 कठोरता से फ़िल्टर किए गए उदाहरणों और SWE-Judge मूल्यांकन एजेंट वाला एक व्यापक बेंचमार्क है, जो पर्यावरण पुनर्निर्माण, कार्यान्वयन और सत्यापन कार्यों के माध्यम से स्वायत्त कोड एजेंटों की एंड-टू-एंड क्षमताओं को सटीक रूप से मापने के लिए है, जो पृथक से पूर्ण-चक्र निष्पादन में संक्रमण करने पर प्रदर्शन में महत्वपूर्ण गिरावट को प्रकट करता है।

Hao Guan, Lingyue Fu, Shao Zhang, Yaoming Zhu, Kangning Zhang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zha (…)2026-05-14
💻 computer science

UIBenchKit: A unified toolkit for design-to-code model evaluation

यह शोध पत्र UIBenchKit प्रस्तुत करता है, जो एक ओपन-सोर्स, यूनिफाइड टूलकिट है जो डिज़ाइन-टू-कोड जनरेशन में मानकीकृत मूल्यांकन की कमी को दूर करने के लिए निष्पक्ष बेंचमार्किंग, सुसंगत मीट्रिक विश्लेषण और वेब इंजीनियरिंग में नवाचार को गति देने के लिए एक प्लग-एंड-प्ले वातावरण प्रदान करता है।

Chinh T. Le, Trevor Ong Yee Siang, Jingyu Xiao, Yuxuan Wan, Yintong Huo2026-05-14
🤖 AI

Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization

यह शोध पत्र CTO को प्रस्तुत करता है, जो एक नवीन ढांचा है जो डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन सेटिंग के भीतर कॉन्ट्रास्टिव लर्निंग के माध्यम से सोर्स-व्युत्पन्न सिमेंटिक रिवॉर्ड के साथ सिंटैक्स-गाइडेड कंपाइलर फीडबैक को एकीकृत करके कोड ट्रांसलेशन को बढ़ाता है, जिससे सिंटैक्टिक शुद्धता और सिमेंटिक निरंतरता दोनों सुनिश्चित करने में मौजूदा विधियों की सीमाओं को दूर किया जा सके।

Yuhan Wu, Huan Zhang, Wei Cheng, Chen Shen, Jingyue Yang, Wei Hu2026-05-14
💻 computer science

Automatic Detection of Reference Counting Bugs in Linux Kernel Drivers

यह शोध पत्र DrvHorn को प्रस्तुत करता है, जो एक स्वचालित उपकरण है जो संदर्भ गणना सत्यापन (reference counting verification) को एसेर्शन चेकिंग (assertion checking) में कम करता है ताकि लिनक्स कर्नेल ड्राइवरों में 424 पहले से अज्ञात बगों को सफलतापूर्वक पता लगाया जा सके, जिसके परिणामस्वरूप 45 मर्ज किए गए पैच प्राप्त हुए।

Joe Hattori, Naoki Kobayashi, Ken Sakayori2026-05-14