💻 computer science

Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents

यह शोध पत्र प्रदर्शित करता है कि AI कोडिंग एजेंट हेरफेर की गई सेटअप डॉक्यूमेंटेशन के माध्यम से होने वाले सप्लाई-चेन हमलों के प्रति संवेदनशील हैं, जो यह प्रकट करता है कि उनकी सुरक्षा काफी हद तक विशिष्ट मॉडल-हारनेस पेयरिंग पर निर्भर करती है और पैकेज के नाम, स्रोत और संस्करणों के नियत (deterministic) प्री-इंस्टॉल सत्यापन की महत्वपूर्ण आवश्यकता को रेखांकित करती है।

Aadesh Bagmar, Pushkar Saraf2026-07-17
💻 computer science

UniCode: Augmenting Evaluation for Code Reasoning

यह शोध पत्र UniCode को पेश करता है, जो एक जनरेटिव मूल्यांकन ढांचा (generative evaluation framework) है जो बहु-आयामी समस्या संवर्धन (multi-dimensional problem augmentation) और स्वचालित परीक्षण का उपयोग करके अत्याधुनिक LLMs की कोड तर्क (code reasoning) में भंगुरता को उजागर करता है, जिससे यह प्रकट होता है कि वास्तविक वैचारिक तर्क के बजाय याद किए गए शॉर्टकट्स पर निर्भरता के कारण प्रदर्शन में महत्वपूर्ण गिरावट आती है।

Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang2026-07-16
💬 NLP

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments

यह शोध पत्र GameEngineBench को प्रस्तुत करता है, जो नौ गेम रिपॉजिटरी से प्राप्त अनरियल इंजन 5 (Unreal Engine 5) प्रोजेक्ट्स के भीतर 110 वास्तविक-विश्व C++ कार्यों वाला एक बेंचमार्क है, जो जटिल, स्टेटफुल रियल-टाइम सिस्टम में कार्यात्मक परिवर्तनों को लागू करने और संकलित (compile) करने की कोडिंग एजेंटों की क्षमता का मूल्यांकन करता है और यह प्रकट करता है कि सबसे शक्तिशाली मॉडल भी गहराई से एकीकृत गेम इंजन विकास के साथ संघर्ष करते हैं।

Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal2026-07-16
💬 NLP

FixItFlow: Automated Troubleshooting Guide Generation from Cloud Incidents

FixItFlow एक स्वचालित प्रणाली है जो ऐतिहासिक क्लाउड इंसिडेंट डेटा से सत्यापित ट्रबलशूटिंग गाइड तैयार करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाती है, जिससे इंजीनियरिंग टीमों के लिए इंसिडेंट रिस्पॉन्स समय में काफी सुधार होता है और दस्तावेज़ीकरण का बोझ कम होता है।

Srihari Unnikrishnan, Jaskaran Singh Walia, Drishti Goel, Supriyo Ghosh2026-07-16
💻 computer science

Falsifiable Release Gates for Self-Improving Systems

यह शोध पत्र "फॉल्सिफिएबल रिलीज़ गेट्स" (Falsifiable Release Gates) को प्रस्तुत करता है, जो अंतःकरण (Antahkarana) जैसे स्व-सुधार करने वाले एजेंट सिस्टम के लिए एक मशीन-सत्यापनीय कार्यप्रणाली है, जो सख्त सुरक्षा इनवेरिएंट्स (safety invariants) को लागू करती है और नीतिगत परिवर्तनों के सभी बदलावों के परिनियोजन से पहले उनके व्यापक मॉडल चेकिंग की आवश्यकता होती है, जिससे यह सुनिश्चित होता है कि स्व-संवर्धन नियंत्रित और ऑडिट योग्य बना रहे।

Deepak Soni2026-07-16
💻 computer science

The Hitchhiker's Guide to Monoculture

यह शोध पत्र 2019 से मध्य-2026 तक के कैगल (Kaggle) प्रतियोगिता सबमिशन का विश्लेषण करता है और यह पाता है कि जहाँ एआई कोडिंग सहायकों ने कोड संरचना और परंपराओं में महत्वपूर्ण रूप से सिंटैक्टिक एकरूपता (syntactic homogenization) को बढ़ाया है, वहीं वे अभी तक डेवलपर्स द्वारा नियोजित अंतर्निहित अर्थ संबंधी दृष्टिकोणों (semantic approaches) या समस्या-समाधान रणनीतियों में अभिसरण (convergence) का कारण नहीं बने हैं।

Gordon Burtch2026-07-16
🤖 machine learning

HEDGEHOG: Hierarchical Evaluation of Drug Generators Through Rigorous Filtration

यह शोध पत्र HEDGEHOG को प्रस्तुत करता है, जो औद्योगिक वर्कफ़्लो से प्रेरित एक कठोर छह-चरणीय निस्पंदन (फिल्ट्रेशन) बेंचमार्क है, जो वर्तमान जनरेटिव मॉलिक्यूलर मॉडल्स की एक महत्वपूर्ण सीमा को उजागर करता है, जहाँ भौतिक-रासायनिक गुणों, सिंथेटिक व्यवहार्यता और 3D बाइंडिंग इंटरैक्शन की एक साथ जांच में 230,000 जनरेट किए गए यौगिकों में से केवल 0.65% ही जीवित बच पाते हैं।

Daria A. Ryabchenko (Ligand Pro, Moscow, Russia, Skolkovo Institute of Science and Technology, Artificial Intelligence C (…)2026-07-16
💻 computer science

Design-System-Aware Development with AI: Evaluating Productivity and Design Consistency

यह शोध पत्र एक बड़े ब्राज़ीलियाई उद्यम में एक नियंत्रित प्रयोग प्रस्तुत करता है जो यह प्रदर्शित करता है कि डिज़ाइन सिस्टम के साथ एआई (AI) सहायता को एकीकृत करने से मैन्युअल या केवल डीएस (DS) दृष्टिकोणों की तुलना में फ्रंट-एंड विकास में महत्वपूर्ण तेजी आती है, कार्य पूर्णता में सुधार होता है और कई प्रौद्योगिकी स्टैक में डिज़ाइन निरंतरता बढ़ती है।

Luciane Silva, Thayssa Rocha, Nicole Davila, Gustavo Pinto2026-07-16
💻 computer science

SoftBoard: A Multi-Agent Tool for the Creation and Evaluation of Low-Fidelity Prototypes

यह शोध पत्र SoftBoard को प्रस्तुत करता है, जो एक वेब-आधारित मल्टी-एजेंट टूल है जिसे सॉफ्टवेयर स्टार्टअप्स को न्यूनतम व्यवहार्य उत्पादों (Minimum Viable Products) के लिए लो-फिडेलिटी प्रोटोटाइप बनाने और उनका मूल्यांकन करने में सहायता करने के लिए डिज़ाइन किया गया है, जो पूर्व UX विशेषज्ञता पर निर्भरता को कम करने के लिए आवश्यकताओं के उद्भेदन (requirements elicitation), स्वचालित जनरेशन और उपयोगिता मूल्यांकन के लिए AI-संचालित सहायता के साथ एक प्रोटोटाइप एडिटर को एकीकृत करता है।

Gabriel R. S. Scapim, Gislaine C. L. Leal, Guilherme C. Guerino2026-07-16
💻 computer science

Microflow: Microarchitectural Causal Observability for Deep Cross-Layer Analysis and Optimization

यह शोध पत्र माइक्रोफ्लो (Microflow) को प्रस्तुत करता है, जो एक ऑब्जर्वेबिलिटी फ्रेमवर्क है जो निष्पादन ट्रेस (execution traces) को एक कॉज़ल इंटरमीडिएट रिप्रेजेंटेशन (MFIR) में परिवर्तित करता है ताकि हार्डवेयर स्टॉल्स (hardware stalls) को उनके अंतर्निहित सॉफ्टवेयर और माइक्रोआर्किटेक्चरल कारणों से स्पष्ट रूप से जोड़कर व्यवस्थित रूट-कॉज़ विश्लेषण और क्रॉस-लेयर ऑप्टिमाइज़ेशन को सक्षम बनाया जा सके।

Saber Ganjisaffar, Chengyu Song, Nael Abu-Ghazaleh2026-07-16