💻 computer science

Search-based Testing of Vision Language Models for In-Car Scene Understanding

यह शोध पत्र ISU-Test प्रस्तुत करता है, जो एक स्वचालित, खोज-आधारित परीक्षण ढांचा है जो इन-कार दृश्य समझ के लिए विजन लैंग्वेज मॉडल्स का कुशलतापूर्वक मूल्यांकन करने हेतु रेंडरिंग-आधारित दृश्य पीढ़ी को अनुकूलन तकनीकों के साथ जोड़ता है, जो यादृच्छिक बेसलाइन की तुलना में काफी उच्च विफलता पहचान और कवरेज प्रदर्शित करता है।

Lev Sorokin, Chen Yang, Ken E. Friedl, Andrea Stocco2026-07-03
💻 computer science

Guiding Human Validation of LLM-Generated Code via Verifiable Literate Programming

यह शोध पत्र वेरीफिएबल लिटरेट प्रोग्रामिंग (VLP) का परिचय देता है, जो एक मानव-इन-द-लूप फ्रेमवर्क है जो स्पष्ट दस्तावेज़ीकरण के माध्यम से प्राकृतिक भाषा प्रॉम्प्ट और LLM-जनित कोड के बीच के अंतर को पाटता है, जिससे सभी कौशल स्तरों के उपयोगकर्ता सूक्ष्म-स्तर के विसंगति पता लगाने (mismatch detection) और औपचारिक सत्यापन (formal verification) के माध्यम से प्रभावी ढंग से कोड को मान्य और मरम्मत करने में सक्षम होते हैं, जिससे कोड की विश्वसनीयता में महत्वपूर्ण सुधार होता है।

Ziqi Yuan, Wenhao Lu, Hao Wu, Dunhong Jin, Chuan Wu2026-07-03
💻 computer science

Developers' Experience with Generative AI Beyond Productivity Assessment -- Insights from an Empirical Mixed-Methods Field Study

यह मिश्रित-पद्धति वाला क्षेत्र अध्ययन (mixed-methods field study) यह प्रकट करता है कि जबकि पेशेवर डेवलपर्स आम तौर पर दोहराव वाले कार्यों के लिए जनरेटिव एआई (Generative AI) उपकरणों को फायदेमंद पाते हैं और उत्पादकता में वृद्धि की रिपोर्ट करते हैं, विशिष्ट इंटरेक्शन मोड (इन-कोड सुझाव बनाम चैट) की प्रभावशीलता कार्य की जटिलता के आधार पर भिन्न होती है, जिसमें उन्हें संयोजित करने से अक्सर विकास-प्रधान कार्य के दौरान लाभ कम हो जाता है और संज्ञानात्मक भार (cognitive load) बढ़ जाता है।

Charlotte Brandebusemeyer, Kerim Zunic, Thomas Zimmermann, Tobias Schimmer, Bert Arnrich2026-07-03
💬 NLP

SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

यह शोध पत्र SkillFuzz को प्रस्तुत करता है, जो पहला निष्पादन-मुक्त (execution-free) फज़िंग फ्रेमवर्क है जो ओपन LLM-आधारित एजेंट मार्केटप्लेस में स्किल कंपोजिशन से उत्पन्न होने वाले उच्च-जोखिम वाले निहित इरादों (implicit intents) को कुशलतापूर्वक खोजने और प्राथमिकता देने के लिए संरचित स्किल कॉन्ट्रैक्ट्स और कॉन्ट्रैक्ट-गाइडेड मोंटे कार्लो ट्री सर्च का उपयोग करता है।

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang2026-07-03
🤖 AI

Understanding Agent-Based Patching of Compiler Missed Optimizations

यह शोध पत्र एक व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि AI एजेंट कंपाइलर द्वारा छूटी हुई अनुकूलन (optimizations) को ठीक कर सकते हैं, वे अक्सर मानव डेवलपर्स के सामान्यीकरण दायरे (generalization scope) के साथ तालमेल बिठाने में संघर्ष करते हैं, एक ऐसी चुनौती जिसे पूर्व LLVM अनुकूलन डेटा का लाभ उठाने वाली ऐतिहासिक-ज्ञान संवर्धन (historical-knowledge augmentation) तकनीकों को पेश करके प्रभावी ढंग से संबोधित किया गया है।

Batu Guan, Zirui Wang, Shaohua Li2026-07-03
🤖 AI

Steerability via constraints: a substrate for scalable oversight of coding agents

यह शोध पत्र यह तर्क देता है कि कोडिंग एजेंटों पर एक्सेस कंट्रोल और सख्त कोडिंग कन्वेंशन जैसे स्थापित इंजीनियरिंग बाधाओं (constraints) को लागू करना, अनकन्स्ट्रेंड एजेंटिक स्कैफोल्डिंग की तुलना में अधिक स्केलेबल और लागत प्रभावी निगरानी समाधान प्रदान करता है, जो एक नियंत्रित प्रयोग के माध्यम से प्रदर्शित करता है कि ऐसा बाधित सबस्ट्रेट (constrained substrate) पायथन कोडबेस में बैकडोर डिटेक्शन दरों में महत्वपूर्ण रूप से सुधार करता है।

Thomas Winninger2026-07-03
💻 computer science

An MLIR-Based Compilation Framework for Control Flow Management on Coarse Grained Reconfigurable Arrays

यह शोध पत्र एक MLIR-आधारित संकलन फ्रेमवर्क प्रस्तुत करता है जो मॉड्यूलर ट्रांसफॉर्मेशन पासेस और एक नवीन मैपिंग पद्धति के माध्यम से कोर्स ग्रेन्ड रीकॉन्फ़िगरेबल एरेज़ (CGRAs) पर अनिश्चित नियंत्रण प्रवाहों को प्रभावी ढंग से प्रबंधित और अनुकूलित करता है, जिससे हार्डवेयर-विशिष्ट संशोधनों की आवश्यकता के बिना अत्याधुनिक दृष्टिकोणों की तुलना में 2.1X तक की गति वृद्धि प्राप्त होती है।

Yuxuan Wang, Cristian Tirelli, Giovanni Ansaloni, Laura Pozzi, David Atienza2026-07-02
🤖 AI

Structural Enforcement of Statistical Rigor in AI-Driven Discovery: A Functional Architecture

यह शोध पत्र एक औपचारिक रूप से सत्यापित, द्वि-स्तरीय कार्यात्मक वास्तुकला प्रस्तुत करता है जो एक हैस्केल-आधारित अनुसंधान मोनैड (research monad) को ओएस-स्तरीय सैंडबॉक्स के साथ जोड़ता है ताकि ऑनलाइन फॉल्स-डिस्कवरी-रेट नियंत्रण की गारंटी देकर और सत्यापन डेटा को भौतिक रूप से अलग करके एआई-संचालित वैज्ञानिक अन्वेषण में सांख्यिकीय कठोरता को संरचनात्मक रूप से लागू करना और स्पूरियस डिस्कवरीज़ (spurious discoveries) को रोकना सुनिश्चित किया जा सके।

Karen Sargsyan2026-07-02
💻 computer science

ATLAS: Multi-View Code Representation Tool for C and C++ Source Programs

ATLAS एक ओपन-सोर्स कमांड-लाइन टूल है जो बिना किसी पूर्ण बिल्ड की आवश्यकता के, सीधे C और C++ सोर्स फाइलों से संरेखित एब्स्ट्रैक्ट सिंटैक्स ट्री (AST), कंट्रोल फ्लो ग्राफ (CFG) और डेटा फ्लो ग्राफ (DFG) उत्पन्न करता है, जो JSON, DOT या PNG स्वरूपों में मल्टी-व्यू रिप्रजेंटेशन प्रदान करता है।

Jaid Monwar Chowdhury, Ahmad Farhan Shahriar Chowdhury, Humayra Binte Monwar, Mahmuda Naznin2026-07-02
💬 NLP

GameDevBench: Evaluating Agentic Capabilities Through Game Development

यह शोध पत्र GameDevBench प्रस्तुत करता है, जो गेम डेवलपमेंट में एजेंटिक क्षमताओं के मूल्यांकन के लिए पहला बेंचमार्क है, जिसमें 333 जटिल मल्टीमॉडल कार्यों के माध्यम से यह खुलासा किया गया है कि वर्तमान एजेंट विजुअल एसेट मैनिपुलेशन (दृश्य संपत्ति हेरफेर) में संघर्ष करते हैं, जबकि यह भी प्रदर्शित किया गया है कि सरल विजुअल फीडबैक तंत्र उनके प्रदर्शन में महत्वपूर्ण सुधार कर सकते हैं।

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wan (…)2026-07-02