💻 computer science

ACCESS: Assurance Case Centric Engineering of Safety-critical Systems

यह शोध पत्र ACCESS को प्रस्तुत करता है, जो एक इंजीनियरिंग पद्धति और टूल सुइट है जो विकसित होते, मॉडल-आधारित आश्वासन मामलों (assurance cases) के माध्यम से सुरक्षा-महत्वपूर्ण प्रणालियों के विकास को सक्षम बनाता है जो विषम आर्टिफैक्ट्स को ट्रेस करने, औपचारिक विधियों को एकीकृत करने और एक ऑटोनॉमस अंडरवॉटर व्हीकल केस स्टडी द्वारा प्रदर्शित विकास और रनटाइम दोनों पर स्वचालित मूल्यांकन का समर्थन करने में सक्षम है।

Ran Wei, Simon Foster, Haitao Mei, Fang Yan, Ruizhe Yang, Ibrahim Habli, Colin O'Halloran, Nick Tudor, Tim Kelly, Yakoub (…)2026-06-17
🤖 AI

Learning-Infused Formal Reasoning: From Contract Synthesis to Artifact Reuse and Formal Semantics

यह शोध पत्र कृत्रिम बुद्धिमत्ता को औपचारिक विधियों (फॉर्मल मेथड्स) के साथ एकीकृत करने के लिए एक दीर्घकालिक अनुसंधान दृष्टिकोण प्रस्तुत करता है ताकि एक ज्ञान-संचालित सत्यापन पारिस्थितिकी तंत्र बनाया जा सके जो अनुबंधों का संश्लेषण करे, हाइब्रिड लर्निंग-सिंबोलिक फ्रेमवर्क के माध्यम से सिमेंटिक आर्टिफैक्ट्स का पुन: उपयोग करे, और कंपोजिशनल रीजनिंग के माध्यम से व्यवस्थित रूप से विकसित हो।

Arshad Beg, Diarmuid O'Donoghue, Rosemary Monahan2026-06-17
💻 computer science

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

यह शोध पत्र DeNovoSWE को प्रस्तुत करता है, जो 4,818 होल-रिपॉजिटरी जनरेशन इंस्टेंस का एक बड़े पैमाने पर, स्वचालित रूप से क्यूरेट किया गया डेटासेट है जिसे लॉन्ग-होराइजन सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए LLM एजेंटों को प्रशिक्षित करने के लिए डिज़ाइन किया गया है, जो BeyondSWE-Doc2Repo बेंचमार्क पर प्रदर्शन को 5.8% से बढ़ाकर 47.2% कर देता है।

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia2026-06-17
💻 computer science

Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work

यह नियंत्रित पायलट अध्ययन यह प्रदर्शित करता है कि हालांकि स्पष्ट सॉफ़्टवेयर डेलीगेशन अनुबंध (delegation contracts) AI कोडिंग एजेंटों के आउटपुट की वस्तुनिष्ठ शुद्धता में सुधार नहीं करते हैं, वे साक्ष्य पर्याप्तता को बढ़ाकर और अस्पष्टता को कम करके उनके कार्य की समीक्षा योग्यता (reviewability) को महत्वपूर्ण रूप से बढ़ाते हैं, भले ही इसके लिए टोकन उपयोग और निष्पादन समय की लागत चुकानी पड़े।

Vincent Schmalbach2026-06-17
📊 statistics

The Right Call for Software Benchmarking: Consistent Decisions in Stateful Environments

यह शोध पत्र तर्क देता है कि उन स्टेटफुल कंप्यूटिंग परिवेशों में जहाँ अनुकूली तंत्र (adaptive mechanisms) पूर्ण प्रदर्शन मापों को पक्षपाती बनाते हैं, सॉफ्टवेयर बेंचमार्किंग को एक निर्णय समस्या के रूप में पुनर्गठित किया जाना चाहिए जो पूर्ण मूल्यों के बजाय प्रदर्शन अंतर के सुसंगत अनुमान प्रदान करने वाले प्रयोगात्मक डिजाइनों के माध्यम से सबसे तेज़ प्रोग्राम की पहचान करने पर केंद्रित हो।

Gábor Melis2026-06-17
🤖 AI

SoK: AI-Augmented Binary Reversing

यह शोध पत्र 144 शोध पत्रों का विश्लेषण करके AI-संवर्धित बाइनरी रिवर्सिंग (AI-augmented binary reversing) पर ज्ञान के पहले व्यापक व्यवस्थितकरण को प्रस्तुत करता है ताकि एक एकीकृत वर्गीकरण स्थापित किया जा सके जो पारंपरिक तकनीकों को आधुनिक AI दृष्टिकोणों से जोड़ता है, जिससे इस क्षेत्र के विकास को स्पष्ट किया जा सके, निरंतर चुनौतियों की पहचान की जा सके और भविष्य के अनुसंधान का मार्गदर्शन किया जा सके।

Yujeong Kwon, Yiyue Zhang, Shakhzod Yuldoshkhujaev, Kexin Pei, Dokyung Song, Hyungjoon Koo2026-06-17
🤖 AI

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

यह शोध पत्र एक पाठ्यक्रम-आधारित, कॉन्फ़िगर करने योग्य LLM-as-Judge पाइपलाइन प्रस्तुत करता है जो व्यवस्थित रूप से स्वचालित प्रश्न-स्तरीय अंकन को अधिकृत शैक्षिक मानकों और पाठ्यक्रम संबंधी कलाकृतियों के साथ संरेखित करता है, जिससे परीक्षा की तैयारी के लिए अधिक पता लगाने योग्य औचित्य प्रदान करते हुए मानव ट्यूटरों के तुलनीय निरंतरता प्राप्त होती है।

Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang, Qian Fu, Mohan Dhall, Wenjie Zhang, Liming Zhu2026-06-17
🤖 machine learning

When the Next Step Is Not One Step: Distribution-Aware Execution Modeling for Concurrent Go Programs

यह शोध पत्र समवर्ती (concurrent) गो (Go) प्रोग्रामों के लिए एक डिस्ट्रीब्यूशन-अवेयर निष्पादन मॉडलिंग दृष्टिकोण प्रस्तुत करता है जो अनुभवजन्य घटना वितरणों (empirical event distributions) पर 7B मॉडल को फाइन-ट्यून करने के लिए शेड्यूलर नॉन-डिटरमिनिज्म का लाभ उठाता है, जिससे वास्तविक दुनिया के बग भविष्यवाणियों पर अत्याधुनिक सटीकता और बेहतर कैलिब्रेशन प्राप्त होता है और साथ ही विशिष्ट गोरौटीन लीक्स (goroutine leaks) का पता लगाने के लिए औपचारिक गारंटी भी प्रदान करता है।

Kaviru Hapuarachchi2026-06-17
⚡ electrical engineering

OmniDroneX: An LLM-Assisted Holistic Drone-as-a-Service Ecosystem

यह शोध पत्र OmniDroneX का प्रस्ताव करता है, जो एक एकीकृत ड्रोन-एज़-ए-सर्विस इकोसिस्टम है जो बड़े भाषा मॉडलों (large language models) और एक औपचारिक एब्स्ट्रैक्शन मॉडल का लाभ उठाकर निश्चित-कार्य वाले ड्रोनों को प्राकृतिक भाषा संवाद और बहु-स्तरीय सेवा संयोजन के माध्यम से जटिल मिशनों को निष्पादित करने में सक्षम, गतिशील रूप से संयोजनीय और स्व-विकसित संस्थाओं में बदल देता है।

I-Ling Yen, Akeem Mohammed, Farokh Bastani, San-Yih Hwang2026-06-17
🤖 AI

FacProcessTwin: An LLM-Based System for Process Twin Development

FacProcessTwin एक LLM-आधारित प्रणाली है जो दस्तावेज़ों से सटीक प्रक्रिया मॉडल स्वतः उत्पन्न करके और उन्हें लाइव डेटा से जोड़कर प्रोसेस ट्विन्स के विकास को महत्वपूर्ण रूप से तेज़ करती है, जबकि वास्तविक दुनिया के विनिर्माण वातावरणों में सुरक्षा-महत्वपूर्ण निर्णय सटीकता सुनिश्चित करने के लिए ह्यूमन-इन-द-लूप गवर्नेंस का उपयोग करती है।

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Prem Prakash Jayaraman2026-06-17