💻 computer science

EXPEREPAIR: Dual-Memory Enhanced LLM-based Repository-Level Program Repair

ExpeRepair एक नवीन LLM-आधारित फ्रेमवर्क है जो एक दोहरी-स्मृति प्रणाली—जिसमें ठोस मरम्मत प्रदर्शनों के लिए एपिसोडिक मेमोरी और अमूर्त अंतर्दृष्टि के लिए सिमेंटिक मेमोरी शामिल है—का लाभ उठाकर गतिशील रूप से संदर्भ-जागरूक प्रॉम्प्ट तैयार करता है, जिससे ऐतिहासिक मरम्मत ज्ञान का प्रभावी ढंग से पुन: उपयोग करके SWE-Bench Lite और Verified बेंचमार्क पर अत्याधुनिक ओपन-सोर्स प्रदर्शन प्राप्त किया जाता है।

Fangwen Mu, Junjie Wang, Lin Shi, Song Wang, Shoubin Li, Qing Wang2026-05-12
🤖 AI

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

यह शोध पत्र Scam2Prompt को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो प्रोडक्शन लार्ज लैंग्वेज मॉडल्स में एक गंभीर और बिगड़ती सुरक्षा भेद्यता को उजागर करता है, जहाँ दुर्भावनापूर्ण स्कैम साइटों से प्राप्त स्वचालित प्रॉम्प्ट कई मॉडल्स में 47.3% मामलों तक हानिकारक कोड उत्पन्न करने में सफलतापूर्वक ट्रिगर करते हैं, जिससे गार्डरेल्स और RAG जैसे वर्तमान सुरक्षा उपाय अपर्याप्त हो जाते हैं।

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long2026-05-12✓ Author reviewed
💻 computer science

Can Old Tests Do New Tricks for Resolving SWE Issues?

TestPrune एक पूर्णतः स्वचालित तकनीक है जो LLM-आधारित बग पुनरुत्पादन और पैच सत्यापन को बढ़ाने के लिए बड़े रिग्रेशन टेस्ट सूट्स को रणनीतिक रूप से कम करती है, जो न्यूनतम API लागत ओवरहेड के साथ SWE-Bench बेंचमार्क पर समस्या समाधान दरों में महत्वपूर्ण सुधार करती है।

Yang Chen, Toufique Ahmed, Reyhaneh Jabbarvand, Martin Hirzel2026-05-12
💻 computer science

"Show Me You Comply... Without Showing Me Anything": Zero-Knowledge Software Auditing for AI-Enabled Systems

यह शोध पत्र ZKMLOps प्रस्तुत करता है, जो एक मॉड्यूलर सत्यापन ढांचा (framework) है जो मशीन लर्निंग ऑपरेशन्स में ज़ीरो-नॉलेज प्रूफ को एकीकृत करता है ताकि संवेदनशील मालिकाना डेटा या मॉडल विवरण को उजागर किए बिना मॉडल की अखंडता और शुद्धता को क्रिप्टोग्राफ़िक रूप से सिद्ध करके AI सिस्टम के नियामक अनुपालन ऑडिटिंग को सक्षम बनाया जा सके।

Filippo Scaramuzza, Renato Cordeiro Ferreira, Giovanni Quattrocchi, Damian Andrew Tamburri, Willem-Jan van den Heuvel2026-05-12
🤖 AI

Energy Consumption of Dataframe Libraries for End-to-End Deep Learning Pipelines:A Comparative Analysis

यह शोध पत्र एंड-टू-एंड डीप लर्निंग पाइपलाइनों के भीतर पांडास (Pandas), पोलार्स (Polars) और डैस्क (Dask) का एक व्यापक तुलनात्मक विश्लेषण प्रदान करता है, जो महत्वपूर्ण GPU-गहन डेटा प्रोसेसिंग चरणों के दौरान उनके रनटाइम, मेमोरी, डिस्क उपयोग और ऊर्जा खपत का मूल्यांकन करता है।

Punit Kumar, Asif Imran, Tevfik Kosar2026-05-12
💻 computer science

Model checking of hyperproperties for high-level relational models

यह शोध पत्र HyperPardinus प्रस्तुत करता है, जो एक मॉडल खोजने की प्रक्रिया है जो Alloy भाषा और इसके Pardinus बैकएंड का विस्तार करती है ताकि उच्च-स्तरीय रिलेशनल डिज़ाइन मॉडलों पर जटिल हाइपरप्रॉपर्टीज़ के विनिर्देशन (specification) और स्वचालित सत्यापन को सक्षम बनाया जा सके, जिससे प्रारंभिक-चरण की सॉफ़्टवेयर इंजीनियरिंग प्रथाओं और कठोर हाइपरप्रॉपर्टी विश्लेषण के बीच के अंतर को पाटा जा सके।

Nuno Macedo, Hugo Pacheco2026-05-12
🤖 AI

Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments

यह शोध पत्र DiGiT-TC प्रस्तुत करता है, जो एक नवीन डेटा जनरेशन विधि है जो उपयोगकर्ता अनुरोधों के भीतर टूल कॉल्स को अंतर्निहित रूप से दर्शाकर स्टेटलेस निष्पादन वातावरण (stateless execution environments) के लिए जटिल मल्टी-टर्न टूल कॉलिंग वार्तालापों को संश्लेषित करती है, जिससे स्टेटफुल सत्यापन (stateful validation) पर निर्भर किए बिना छोटे भाषा मॉडलों की प्रभावी ट्यूनिंग सक्षम होती है।

Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumarave (…)2026-05-12
💻 computer science

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ एक नवीन दृष्टिकोण है जो टेम्पोरल नॉलेज ग्राफ्स और LLM एजेंट्स का लाभ उठाकर पारंपरिक git blame-आधारित विधियों की सीमाओं को दूर करने के लिए बग-प्रेरित कमिट (Bug-Inducing Commit) की पहचान को एक ग्राफ सर्च समस्या के रूप में पुनर्गठित करता है, जिससे विस्तारित ऐतिहासिक संदर्भ और कारण संबंधी तर्क (causal reasoning) के माध्यम से पता लगाने की सटीकता में उल्लेखनीय सुधार होता है।

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan2026-05-12
💻 computer science

Reducing the Costs of Proof Synthesis on Rust Systems by Scaling Up a Seed Training Set

यह शोध पत्र VeruSyn को प्रस्तुत करता है, जो एक स्केलेबल डेटा सिंथेसिस पाइपलाइन है जो Rust प्रोग्राम्स के लिए 6.9 मिलियन औपचारिक प्रमाण (formal proofs) उत्पन्न करती है, जिससे एक फाइन-ट्यून्डed Qwen2.5-Coder-32B मॉडल को अत्याधुनिक वाणिज्यिक और अनुसंधान मॉडलों की तुलना में प्रमाण संश्लेषण (proof synthesis) में बेहतर लागत-दक्षता और प्रदर्शन प्राप्त करने में सक्षम बनाया जा सके।

Nongyu Di, Tianyu Chen, Shan Lu, Shuai Lu, Yeyun Gong, Peng Cheng, Jacob R. Lorch, Yuan Yao, Xiaoxing Ma2026-05-12
💻 computer science

Synthesis-in-the-Loop Evaluation of LLMs for RTL Generation: Quality, Reliability, and Failure Modes

यह शोध पत्र RTL जनरेशन पर 32 लैंग्वेज मॉडल्स का आकलन करने के लिए हार्डवेयर क्वालिटी इंडेक्स (HQI) का उपयोग करते हुए एक सिंथेसिस-इन-द-लूप मूल्यांकन ढांचा प्रस्तुत करता है, जो कार्यात्मक शुद्धता और हार्डवेयर कार्यान्वयन गुणवत्ता के बीच के अंतर को उजागर करने वाले विशिष्ट प्रदर्शन स्तरों और व्यवस्थित विफलता मोड को प्रकट करता है।

Weimin Fu, Zeng Wang, Minghao Shao, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu, Xiaolong Guo2026-05-12