💻 computer science

Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions

यह अध्ययन प्रकट करता है कि प्रोग्रामर एआई-जनित गलत दावों का मूल्यांकन करते समय अत्यधिक आत्मविश्वासी होने के साथ-साथ गलत भी होते हैं, एक ऐसी समस्या जो प्राकृतिक-भाषा स्पष्टीकरणों द्वारा कम नहीं होती है—बल्कि और भी बढ़ सकती है—जो यह सुझाव देती है कि वर्तमान एआई उपकरण कोड की समझ या समीक्षा को विश्वसनीय रूप से बढ़ाने में सक्षम नहीं हो सकते हैं।

Zhanna Kaufman, Yuriy Brun, Adithya Murali, Madeline Endres2026-07-13
💻 computer science

Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation

यह शोध पत्र यह प्रदर्शित करता है कि छोटे भाषा मॉडलों (small language models) की सीमाओं की भरपाई के लिए एजेंट हार्नेस (agent harnesses) को स्वचालित रूप से अनुकूलित करना उन्हें नियमित व्यावसायिक कार्यों पर फ्रंटियर एलएलएम (frontier LLM) के प्रदर्शन के बराबर लाने में सक्षम कर सकता है, जबकि इससे अनुमान लागत (inference costs) में 90% तक की कमी आती है।

Chenyang Yang, Xinran Zhao, Tongshuang Wu, Christian Kästner2026-07-13
💻 computer science

SeedSmith: LLM-Driven Seed Synthesis for Directed Fuzzing

SeedSmith एक एजेंटिक (agentic) LLM पाइपलाइन है जो अप्रत्यक्ष कॉल्स (indirect calls) और क्रैश प्रीकंडीशन्स (crash preconditions) को पुनरावृत्ति से हल करके लक्षित प्रारंभिक सीड्स (targeted initial seeds) को संश्लेषित करती है, जिससे निर्देशित फज़िंग (directed fuzzing) में उल्लेखनीय तेजी आती है और विविध इनपुट स्वरूपों में पहले से अपहुंचनीय कमजोरियों की खोज संभव होती है।

Junmin Zhu, Siyu Liu, Jie Hu, Fabio Gritti, Ati Priya Bajaj, Hulin Wang, Wenbo Guo, Tiffany Bao, Christopher Kruegel, Gi (…)2026-07-13
🤖 AI

The Patchwork Problem in LLM-Generated Code

यह शोध पत्र "पैचवर्क समस्या" (patchwork problem) की पहचान और उसे औपचारिक रूप देता है, जो LLM-जनित कोड में एक संरचनात्मक सुसंगतता विफलता है जहाँ स्थानीय रूप से वैध पैच वैश्विक स्तर पर टूटी हुई प्रणालियाँ बना देते हैं जो मानक परीक्षणों से बच निकलती हैं, और इन महत्वपूर्ण, मॉडल-विशिष्ट दोषों को संबोधित करने के लिए एक हाइब्रिड सत्यापन ढांचे और एक नए विफलता वर्गीकरण का प्रस्ताव करता है।

Viraaji Mothukuri, Reza M. Parizi2026-07-13
💻 computer science

From Generic to Personalized: Exploring Persona-Aware Code Review Explanations

यह शोधपत्र एक मिश्रित-पद्धति वाले उपयोगकर्ता अध्ययन से प्रारंभिक निष्कर्ष प्रस्तुत करके व्यक्तिगत कोड समीक्षा स्पष्टीकरणों की क्षमता की जांच करता है जो यह प्रकट करता है कि डेवलपर्स की फीडबैक शैलियों के प्रति प्राथमिकताएं उनके समस्या-समाधान दृष्टिकोणों, अनुभव और भूमिकाओं के आधार पर भिन्न होती हैं, जो अंततः उन मानव-केंद्रित एआई प्रणालियों का समर्थन करती है जो व्यक्तिगत आवश्यकताओं के अनुसार समीक्षा टिप्पणियों को अनुकूलित करती हैं।

Shamse Tasnim Cynthia, Ratnadira Widyasari, Banani Roy, Italo Santos, David Lo2026-07-13
💻 computer science

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

यह शोध पत्र SkillLogic प्रस्तुत करता है, जो LLM एजेंट कौशल में तार्किक संबंधों का विश्लेषण करने के लिए एक फ्रेमवर्क है, और SLBench प्रस्तुत करता है, जो एक बेंचमार्क है जो दर्शाता है कि वर्तमान एजेंट अक्सर इन संबंधों का उल्लंघन करते हैं जिससे सुरक्षा जोखिम उत्पन्न होते हैं, जबकि यह भी प्रदर्शित करता है कि एक हल्का स्कैफोल्ड (SLGuard) ऐसे उल्लंघनों को काफी हद तक कम कर सकता है।

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang2026-07-13
💻 computer science

Automating Just-In-Time Python Type Annotation Updating

यह शोध पत्र TypeUp को प्रस्तुत करता है, जो एक नवीन LLM-आधारित दृष्टिकोण है जो कोड परिवर्तनों और तार्किक तर्क (logical reasoning) का लाभ उठाकर पायथन परियोजनाओं में जस्ट-इन-टाइम (Just-In-Time) टाइप एनोटेशन अपडेट को स्वचालित करता है, जो मौजूदा उपकरणों की तुलना में बेहतर प्रदर्शन और वास्तविक दुनिया के डेवलपर वर्कफ़्लो में उच्च व्यावहारिक मूल्य प्रदर्शित करता है।

Zhipeng Xue, Zhipeng Gao, Xing Hu, Jingyuan Chen, Xin Xia, Shanping Li2026-07-13
💻 computer science

Agentic Proof and Property-Based Testing via Property-Templates in Data-Intensive Computing

यह शोध पत्र एक द्वि-मार्गी सत्यापन ढांचे (dual-track validation framework) का प्रस्ताव करता है जो पैरामीटराइज्ड प्रॉपर्टी टेम्पलेट्स का लाभ उठाकर Lean 4 में औपचारिक प्रमाण इंजीनियरिंग (formal proof engineering) को उन्नत करने और Apache Spark के लिए PySpark में प्रॉपर्टी-आधारित परीक्षण (property-based testing) को स्वचालित करने के लिए, प्रभावी रूप से AI मतिभ्रम (hallucinations) और इरादा मिसअलाइनमेंट (intent misalignments) को कम करता है और औपचारिक मॉडलों एवं वास्तविक दुनिया के कार्यान्वयनों के बीच के अंतर को पाटता है।

Seongmin Lee, Yaoxuan Wu, Miryung Kim2026-07-13
💻 computer science

Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows

यह शोध पत्र TestAgent को प्रस्तुत करता है, जो एक मल्टी-एजेंट एलएलएम (LLM) फ्रेमवर्क है जो विशेषीकृत प्लानर, जनरेटर और रिव्यूअर एजेंटों, डायनेमिक टूल इनवोकेशन और एक टेस्ट-विशेषज्ञता वाले नॉलेज ग्राफ के माध्यम से मानव परीक्षण वर्कफ़्लो का अनुकरण करता है, जो निष्पादन दर (execution rate), कोड कवरेज और म्यूटेशन स्कोर में मौजूदा स्वचालित यूनिट टेस्ट जनरेशन विधियों से काफी बेहतर प्रदर्शन करता है।

Quanjun Zhang, Ye Shang, Siqi Gu, Jianyi Zhou, Chunrong Fang, Zhenyu Chen, Liang Xiao2026-07-13
💻 computer science

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent एक बहु-चरणीय, टूल-संवर्धित एजेंट फ्रेमवर्क है जो बग पुनरुत्पादन परीक्षण जनरेशन को बग पहचान, मूल कारण विश्लेषण, योजना और जनरेशन के स्थानीयकृत चरणों में विभाजित करके मौजूदा प्रॉम्प्ट-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है, जिससे विविध बेंचमार्क में काफी उच्च सफलता दर प्राप्त होती है।

Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao2026-07-13