💻 computer science

Improving LLM-Driven Test Generation by Learning from Mocking Information

यह शोधपत्र MOCKMILL को प्रस्तुत करता है, जो एक LLM-आधारित टूल है जो मौजूदा टेस्ट सूट्स से डेवलपर-निर्धारित मॉकिंग जानकारी का लाभ उठाकर स्वचालित यूनिट टेस्ट जनरेशन को बेहतर बनाता है ताकि बेसलाइन दृष्टिकोणों की तुलना में बेहतर कोड कवरेज और म्यूटेशन किलिंग क्षमताओं वाले टेस्ट तैयार किए जा सकें।

Jamie Lee, Flynn Teh, Hengcheng Zhu, Mengzhen Li, Mattia Fazzini, Valerio Terragni2026-04-22
🤖 AI

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

यह शोध पत्र DeepRed प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क है जो आंशिक-क्रेडिट स्कोरिंग और स्वचालित लॉग विश्लेषण का उपयोग करके यथार्थवादी कैप्चर द फ्लैग चुनौतियों पर LLM एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल सीमित सफलता (औसतन 35% चेकपॉइंट पूर्णता) प्राप्त करते हैं और गैर-मानक खोज एवं लंबी-अवधि अनुकूलन कार्यों के साथ संघर्ष करते हैं।

Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi2026-04-22
💻 computer science

CASCADE: Detecting Inconsistencies between Code and Documentation with Automatic Test Generation

यह शोध पत्र CASCADE को पेश करता है, जो एक अभिनव उपकरण है जो दस्तावेज़ों से यूनिट टेस्ट और कोड उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, और विसंगतियों का पता केवल तभी लगाता है जब मौजूदा कोड इन टेस्ट में विफल हो जाता है जबकि दस्तावेज़-व्युत्पन्न कोड पास हो जाता है, जिससे फॉल्स पॉजिटिव्स (false positives) में काफी कमी आती है और कई प्रोग्रामिंग भाषाओं में उच्च सटीकता प्रदर्शित होती है।

Tobias Kiecker, Jan Arne Sparka, Martin Reuter, Albert Ziegler, Lars Grunske2026-04-22
💻 computer science

Crash-free Deductive Verifiers

यह शोध पत्र जटिल डडक्टिव वेरीफायर (deductive verifiers) की विश्वसनीयता और मजबूती को बढ़ाने के लिए एक व्यावहारिक पद्धति के रूप में फज़िंग (fuzzing) के उपयोग का समर्थन करता है, जो प्रोटोटाइप टूल AValAnCHE के माध्यम से अपनी प्रभावशीलता को प्रदर्शित करता है, जिसने VerCors वेरीफायर में कई समस्याओं की सफलतापूर्वक पहचान की।

Wander Nauta, Marcus Gerhold, Marieke Huisman2026-04-22
🤖 machine learning

Evaluating LLM-Generated Obfuscated XSS Payloads for Machine Learning-Based Detection

यह शोध पत्र एक संरचित पाइपलाइन प्रस्तुत करता है जो रनटाइम व्यवहार के आधार पर अस्पष्ट (obfuscated) XSS पेलोड उत्पन्न करने और उनका मूल्यांकन करने के लिए नियतात्मक तकनीकों (deterministic techniques) को लार्ज लैंग्वेज मॉडल्स के साथ जोड़ता है, जो यह प्रकट करता है कि जबकि फाइन-ट्यूनिंग व्यवहार संबंधी संरक्षण (behavioral preservation) में सुधार करती है, वर्तमान LLMs अभी भी ऐसे वैध अस्पष्टन (obfuscations) बनाने में संघर्ष करते हैं जो डाउनस्ट्रीम मशीन लर्निंग डिटेक्शन प्रदर्शन को बढ़ाते हैं।

Divyesh Gabbireddy, Suman Saha2026-04-22
💻 computer science

PlayCoder: Making LLM-Generated GUI Code Playable

यह शोध पत्र PlayCoder प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो PlayEval बेंचमार्क और Play@k मेट्रिक का प्रस्ताव देकर खेलने योग्य (playable) GUI एप्लिकेशन उत्पन्न करने में मौजूद महत्वपूर्ण अंतर को संबोधित करता है ताकि एंड-टू-एंड तार्किक शुद्धता का मूल्यांकन किया जा सके, यह प्रदर्शित करते हुए कि मौजूदा LLMs इस कार्य में विफल रहते हैं जबकि PlayCoder पुनरावृत्तीय, रिपॉजिटरी-जागरूक सुधार के माध्यम से कार्यात्मक सफलता में महत्वपूर्ण सुधार करता है।

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo2026-04-22
🤖 machine learning

XOXO: Stealthy Cross-Origin Context Poisoning Attacks against AI Coding Assistants

यह शोधपत्र XOXO प्रस्तुत करता है, जो एक नवीन गुप्त हमले (stealthy attack) के रूप में AI कोडिंग सहायकों के स्वचालित संदर्भ-एकत्रीकरण तंत्र (automatic context-gathering mechanisms) का लाभ उठाता है, जिसमें LLM प्रॉम्प्ट्स को विषाक्त करने के लिए अर्थपूर्ण रूप से समान प्रतिकूल कोड संशोधनों को इंजेक्ट किया जाता है, जिससे पारंपरिक पहचान और फाइन-ट्यूनिंग सुरक्षा उपायों को दरकिनार करते हुए असुरक्षित कोड उत्पन्न किया जा सके।

Adam Štorek, Mukur Gupta, Noopur Bhatt, Aditya Gupta, Janie Kim, Prashast Srivastava, Suman Jana2026-04-21
💬 NLP

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Reasoning

यह शोध पत्र यह प्रकट करता है कि जहाँ बड़े भाषा मॉडल (large language models) लंबे कोड संदर्भों में शब्दशः शाब्दिक पुनस्मरण (verbatim lexical recall) में उत्कृष्ट हैं, वहीं जब प्रासंगिक कोड केंद्रीय रूप से स्थित होता है, तो परिचालन अर्थविज्ञान (operational semantics) को समझने की उनकी क्षमता गंभीर रूप से घट जाती है, जो यह संकेत देता है कि वर्तमान बेंचमार्क काफी हद तक वास्तविक अर्थपूर्ण तर्क के बजाय पैटर्न-मैचिंग शॉर्टकट्स पर निर्भर करते हैं।

Adam Štorek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana2026-04-21
🤖 machine learning

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction

ReGA एक स्केलेबल, मॉडल-आधारित सुरक्षा ढांचा (safeguard framework) है जो बड़े भाषा मॉडलों (Large Language Models) को प्रभावी ढंग से एब्स्ट्रैक्ट और मॉनिटर करने के लिए लो-डायमेंशनल सेफ्टी-क्रिटिकल रिप्रेजेंटेशन्स का लाभ उठाता है, जिससे पारंपरिक विश्लेषण तकनीकों की स्केलेबिलिटी सीमाओं को पार करते हुए हानिकारक सामग्री का पता लगाने में उच्च सटीकता और व्याख्यात्मकता (interpretability) प्राप्त होती है।

Zeming Wei, Chengcan Wu, Meng Sun2026-04-21
💬 NLP

MetaLint: Easy-to-Hard Generalization for Code Linting

MetaLint एक मेटा-लर्निंग फ्रेमवर्क है जो कोड लिन्टिंग को एक निर्देश-अनुसरण (instruction-following) कार्य के रूप में पुनर्गठित करता है, जिससे सिंथेटिक डेटा पर प्रशिक्षित मॉडल बिना पुनरप्रशिक्षण के, सरल, नियम-आधारित उल्लंघनों से जटिल, संदर्भ-निर्भर सर्वोत्तम प्रथाओं तक सामान्यीकरण करने में सक्षम होते हैं, जैसा कि एक नए मानव-क्यूरेटेड बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ द्वारा प्रदर्शित किया गया है।

Atharva Naik, Lawanya Baghel, Dhakshin Govindarajan, Darsh Agrawal, Yiqing Xie, Daniel Fried, Carolyn Rose2026-04-21