🤖 AI

FVSpec: Real-World Property-Based Tests as Lean Challenges

यह शोधपत्र FVSpec को प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क है जो व्यावहारिक सॉफ्टवेयर के औपचारिक सत्यापन (formal verification) को स्वचालित करने में AI मॉडलों की क्षमताओं का मूल्यांकन करने के लिए 2,772 वास्तविक-विश्व पायथन प्रॉपर्टी-बेस्ड टेस्ट को 9,415 लीन 4 (Lean 4) औपचारिक विनिर्देशों (formal specifications) में अनुवादित करता है।

Quinn Dougherty, Max von Hippel, Hazel Shackleton, Mike Dodds2026-06-02
💻 computer science

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

BenchEvolver एक समाधान-केंद्रित विकासवादी ढांचा (evolutionary framework) है जो संदर्भ समाधानों (reference solutions) को विकसित करके मौजूदा कोडिंग समस्याओं को स्वचालित रूप से कठिन, सत्यापन योग्य वेरिएंट में बदल देता है, जिससे LiveCodeBench-Plus जैसे उच्च-गुणवत्ता वाले बेंचमार्क बनते हैं जो मॉडल भेदभाव (model discrimination) को बहाल करते हैं और आत्म-सुधार के लिए प्रभावी प्रशिक्षण संकेत प्रदान करते हैं।

Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin (…)2026-06-02
💻 computer science

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

यह शोध पत्र SABER को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो केवल प्रॉम्प्ट रिफ्यूज़ल (prompt refusal) के बजाय अंतिम एनवायरनमेंट स्टेट्स (final environment states) का विश्लेषण करके यथार्थवादी, स्टेटफुल प्रोजेक्ट वर्कस्पेस के भीतर LLM कोडिंग एजेंटों की परिचालन सुरक्षा का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल उच्च हानिकारक सुरक्षा-उल्लंघन दरों और विशिष्ट सुरक्षा प्रोफाइल प्रदर्शित करते हैं।

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji2026-06-02
💻 computer science

Reducing Token Usage of State-in-Context Agents using Minification

यह शोध पत्र स्टेट-इन-कॉन्टेक्स्ट एजेंट फ्रेमवर्क के एक प्रतिकृति (रेप्लिकेशन) को प्रस्तुत करता है और यह प्रदर्शित करता है कि कोड मिनिफिकेशन तकनीकों को लागू करने से रेजोल्यूशन दर में 12 प्रतिशत अंकों की गिरावट की कीमत पर इनपुट टोकन के उपयोग में 42% की कमी आती है, जो अधिक लागत प्रभावी सॉफ्टवेयर इंजीनियरिंग एजेंटों के लिए एक आशाजनक समझौता प्रदान करता है।

Nicolas Hrubec, Jürgen Cito2026-06-02
💻 computer science

Needles at Scale: LLM-Assisted Target Selection for Windows Vulnerability Research

यह शोध पत्र Symbolicate-Enrich-Sample को प्रस्तुत करता है, जो एक कम लागत वाला, LLM-सहायता प्राप्त पाइपलाइन है जो बड़े पैमाने पर भेद्यता अनुसंधान (vulnerability research) में लक्ष्य चयन की बाधा को दूर करने के लिए स्ट्रिप्ड विंडोज बाइनरीज़ में लाखों फंक्शन्स को उच्च-जोखिम वाले उम्मीदवारों की एक प्राथमिकता वाली संक्षिप्त सूची तक फ़िल्टर करता है।

Michael J. Bommarito II2026-06-02
💻 computer science

Understanding Undesirable Attributes of Requirements Engineers: Insights from Practitioners

यह अध्ययन व्यावहारिक सर्वेक्षणों और साक्षात्कारों के माध्यम से आवश्यकताओं के इंजीनियरों (requirements engineers) के सत्रह अवांछनीय गुणों को पहचानता है और उन्हें वर्गीकृत करता है—जो संचार, डोमेन ज्ञान, व्यक्तित्व और तकनीकी कौशल तक विस्तृत हैं—और पेशेवरों को उनके सहयोगात्मक अभ्यासों पर विचार करने और उनमें सुधार करने में मदद करने के लिए वैचारिक मानचित्र प्रदान करता है।

Larissa Barbosa, Sávio Freire, Marcos Kalinowski, Zadia Codabux, Rodrigo Spínola, Manoel Mendonça, Rita S. P. Maciel2026-06-02
💻 computer science

Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory

यह शोध पत्र MAAD प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो सॉफ्टवेयर आवश्यकताओं को व्यापक, गुणवत्ता-आकलन युक्त आर्किटेक्चरल डिजाइनों में बदलने के लिए विशिष्ट एजेंटों को स्वायत्त रूप से ऑर्केस्ट्रेट करने हेतु रिट्रीवल-ऑगमेंटेड जनरेशन और पदानुक्रमित मेमोरी का लाभ उठाता है, जो मौजूदा बेसलाइनों की तुलना में बेहतर पूर्णता और मॉडुलैरिटी प्रदर्शित करता है।

Ruiyin Li, Yiran Zhang, Xiyu Zhou, Yangxiao Cai, Peng Liang, Weisong Sun, Jifeng Xuan, Zhi Jin, Yang Liu2026-06-02
💻 computer science

Overcoming Challenges in Agile and DevOps Integration: A Qualitative Study

ब्राजील और जर्मनी के छह उद्योग पेशेवरों के साक्षात्कार पर आधारित यह गुणात्मक अध्ययन, एजाइल (Agile) और डेवऑप्स (DevOps) को एकीकृत करने में प्रमुख सांस्कृतिक, संरचनात्मक, प्रक्रियात्मक और तकनीकी चुनौतियों की पहचान करता है और संगठनों को इन बाधाओं को दूर करने तथा सॉफ्टवेयर वितरण में सुधार करने में मदद करने के लिए चार रणनीतिक समाधान डोमेन प्रस्तावित करता है।

Juliana Fraislebem, Mali Senapathi, Michael Neumann, Eva-Maria Schön2026-06-02
💻 computer science

Faster than the Team, Faster than the Customer: Tool Integration, Collaboration, and Organisational Lag in AI-assisted RE

यह शोध पत्र XITASO में AI-सहायता प्राप्त आवश्यकता इंजीनियरिंग (requirements engineering) की जांच करता है, जिससे यह पता चलता है कि जहाँ पेशेवरों ने टूल एकीकरण और उपयोग के मामलों को तेजी से आगे बढ़ाया है, वहीं संगठनात्मक अंतराल और खराब टूल एकीकरण अक्सर लाभों को टीम सहयोग या ग्राहक तत्परता में सुधार करने के बजाय व्यक्तिगत उत्पादकता तक ही सीमित कर देते हैं।

Jan-Philipp Steghöfer2026-06-02
💻 computer science

Trust-Calibrated Code Review: A Participatory Design Study of Review Workflows for LLM-Generated Multi-File Changes

उद्योग विशेषज्ञों के साथ एक सहभागी डिजाइन अध्ययन के माध्यम से, यह शोध पत्र LLM-जनित मल्टी-फाइल परिवर्तनों की समीक्षा करने में विश्वास अंशांकन (ट्रस्ट कैलिब्रेशन) को मुख्य चुनौती के रूप में पहचानता है और भविष्य के AI-रेडी कोड समीक्षा उपकरणों के विकास के मार्गदर्शन के लिए सात डिजाइन कंस्ट्रक्ट्स के साथ एक प्रमाणित तीन-स्तरीय वर्कफ़्लो प्रस्तावित करता है।

Lo Gullstrand Heander, Agnia Sergeyuk, Ilya Zakharov, Emma Söderberg, Nikita Mukhortov2026-06-02