🤖 AI

PromptPex: Automatic Test Generation for Language Model Prompts

यह शोध पत्र PromptPex को प्रस्तुत करता है, जो एक LLM-आधारित टूल है जो प्रॉम्प्ट से विशिष्टताओं (specifications) को स्वचालित रूप से निकालता है ताकि विविध यूनिट टेस्ट उत्पन्न और मूल्यांकित किए जा सकें, जिससे मौजूदा बेसलाइन विधियों की तुलना में रिग्रेशन और मॉडल-विशिष्ट कमजोरियों को अधिक सटीकता से पहचाना जा सके।

Reshabh K Sharma, Jonathan De Halleux, Shraddha Barke, Dan Grossman, Benjamin Zorn2026-02-09
💬 NLP

code_transformed: The Influence of Large Language Models on Code

यह शोध पत्र 20,000 से अधिक GitHub रिपॉजिटरीज़ का विश्लेषण करने वाले एक अग्रणी बड़े पैमाने के अनुभवजन्य अध्ययन को प्रस्तुत करता है जो यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) वास्तविक दुनिया की प्रोग्रामिंग शैलियों को मापने योग्य रूप से बदल रहे हैं, जिसका प्रमाण snake_case नामकरण परंपराओं के प्रति बढ़ते अनुपालन और कोड जटिलता एवं रखरखाव क्षमता में बदलाव जैसे रुझानों से मिलता है।

Yuliang Xu, Siming Huang, Mingmeng Geng, Yao Wan, Xuanhua Shi, Dongping Chen2026-02-09
💻 computer science

Mut4All: Fuzzing Compilers via LLM-Synthesized Mutators Learned from Bug Reports

Mut4All एक पूर्णतः स्वचालित, भाषा-अज्ञेय (language-agnostic) फ्रेमवर्क है जो उच्च गुणवत्ता वाले म्यूटेटर्स को संश्लेषित और परिष्कृत करने के लिए लार्ज लैंग्वेज मॉडल्स और कंपाइलर बग रिपोर्ट्स का लाभ उठाता है, जो Rust और C++ कंपाइलर्स के लिए अद्वितीय कंपाइलर बग्स का पता लगाने और कवरेज में सुधार करने में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।

Bo Wang, Pengyang Wang, Chong Chen, Ming Deng, Jieke Shi, Qi Sun, Chengran Yang, Youfang Lin, Zhou Yang, Junjie Chen, Ju (…)2026-02-09
💻 computer science

LitterBox+: An Extensible Framework for LLM-enhanced Scratch Static Code Analysis

LitterBox+ एक विस्तार योग्य ढांचा है जो कोड को टेक्स्ट में बदलकर ब्लॉक-आधारित स्क्रैच प्रोग्रामिंग और लार्ज लैंग्वेज मॉडल्स के बीच के अंतर को पाटता है, जिससे शिक्षार्थी अपने प्रोग्राम के बारे में LLMs से प्रश्न पूछने, गुणवत्तापूर्ण फीडबैक प्राप्त करने और सीधे स्क्रैच वातावरण के भीतर कोड सुधार उत्पन्न करने में सक्षम होते हैं।

Benedikt Fein, Florian Obermüller, Gordon Fraser2026-02-09
💻 computer science

Context Engineering for AI Agents in Open-Source Software

यह शोध पत्र 466 ओपन-सोर्स प्रोजेक्ट्स के एक प्रारंभिक अध्ययन को प्रस्तुत करता है ताकि AGENTS.md फाइलों के अपनाए जाने, सामग्री संरचना और विकास की जांच की जा सके, जो यह प्रकट करता है कि डेवलपर्स द्वारा AI एजेंटों के लिए संदर्भ (context) प्रदान करने के तरीके में महत्वपूर्ण भिन्नता है और यह जनरेट की गई कोड गुणवत्ता में सुधार के लिए कॉन्टेक्स्ट इंजीनियरिंग को अनुकूलित करने पर भविष्य के शोध की क्षमता को रेखांकित करता है।

Seyedmoein Mohsenimofidi, Matthias Galster, Christoph Treude, Sebastian Baltes2026-02-09
🤖 machine learning

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

यह शोध पत्र SpIDER का प्रस्ताव करता है, जो एक स्थानिक रूप से सूचित सघन एम्बेडिंग रिट्रीवल (spatially informed dense embedding retrieval) विधि है जो सॉफ्टवेयर इश्यू लोकलाइजेशन को महत्वपूर्ण रूप से सुधारने के लिए ग्राफ-आधारित कोडबेस एक्सप्लोरेशन के साथ LLM-आधारित रीजनिंग को एकीकृत करती है, जिसे SpIDER-Bench नामक एक नए बहु-भाषी बेंचमार्क द्वारा प्रमाणित किया गया है।

Shravan Chaudhari, Rahul Thomas Jacob, Mononito Goswami, Jiajun Cao, Shihab Rashid, Christian Bock2026-02-09
💻 computer science

FirmReBugger: A Benchmark Framework for Monolithic Firmware Fuzzers

यह शोध पत्र FirmReBugger प्रस्तुत करता है, जो एक समग्र बेंचमार्क फ्रेमवर्क है जो बग ओरैकल्स और वास्तविक दुनिया के लक्ष्यों के एक विविध सेट (FirmBench) का उपयोग करता है ताकि लक्षित बाइनरी को संशोधित किए बिना मोनोलिथिक फर्मवेयर फज़र्स का निष्पक्ष और सटीक मूल्यांकन किया जा सके, और नौ अत्याधुनिक उपकरणों के एक बड़े पैमाने के पुनरुत्पादकता अध्ययन के माध्यम से इसकी प्रभावशीलता को प्रदर्शित करता है।

Mathew Duong, Michael Chesser, Guy Farrelly, Surya Nepal, Damith C. Ranasinghe2026-02-09
🤖 AI

How does information access affect LLM monitors' ability to detect sabotage?

यह शोध पत्र प्रकट करता है कि एलएलएम (LLM) मॉनिटर्स अक्सर कम जानकारी के साथ एजेंट द्वारा की जाने वाली तोड़फोड़ (sabotage) का अधिक प्रभावी ढंग से पता लगाते हैं ("कम-है-अधिक-है" प्रभाव) और एक पदानुक्रमित "निकालें-और-मूल्यांकन-करें" (extract-and-evaluate) ढांचे का प्रस्ताव करता है जो इस घटना का लाभ उठाकर लागत-प्रदर्शन संतुलन को अनुकूलित करते हुए पहचान दरों में उल्लेखनीय सुधार करता है।

Rauno Arike, Raja Mehta Moreno, Rohan Subramani, Shubhorup Biswas, Francis Rhys Ward2026-02-09
🤖 AI

Testing Storage-System Correctness: Challenges, Fuzzing Limitations, and AI-Augmented Opportunities

यह सर्वेक्षण मौजूदा परीक्षण तकनीकों को उनके लक्षित निष्पादन गुणों और विफलता तंत्रों के आधार पर वर्गीकृत करने के लिए एक स्टोरेज-केंद्रित परिप्रेक्ष्य अपनाता है, अंतर्निहित स्टोरेज जटिलताओं को संबोधित करने में पारंपरिक फज़िंग की सीमाओं का आलोचनात्मक विश्लेषण करता है, और यह अन्वेषण करता है कि कैसे एआई-संचालित सिमेंटिक मार्गदर्शन इन चुनौतियों को पार करने और स्टोरेज-सिस्टम की शुद्धता में सुधार करने के लिए उपयोग किया जा सकता है।

Ying Wang, Jiahui Chen, Dejun Jiang2026-02-09
💻 computer science

SEAL: Symbolic Execution with Separation Logic (Competition Contribution)

SEAL एक मॉड्यूलर, प्रोटोटाइप स्टैटिक एनालाइज़र है जो अनबाउंडेड लिंक्ड डेटा स्ट्रक्चर्स वाले प्रोग्राम्स को वेरिफाई करने के लिए सेपरेशन लॉजिक और SMT-आधारित एस्ट्रल (Astral) सॉल्वर का लाभ उठाता है ताकि LinkedLists श्रेणी में प्रतिस्पर्धी परिणाम प्राप्त किए जा सकें और साथ ही भविष्य के विकास के लिए महत्वपूर्ण विस्तार क्षमता प्रदान की जा सके।

Tomáš Brablec, Tomáš Dacík, Tomáš Vojnar2026-02-09