🤖 AI

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

AgentLens कोडिंग एजेंटों के लिए एक प्रोडक्शन-असेसमेंट बेंचमार्क पेश करता है जो औपचारिक सत्यापन (formal verification) और LLM-जनरेटेड समीक्षाओं के संयोजन के माध्यम से संपूर्ण इंटरेक्शन ट्राजेक्टरी का मूल्यांकन करता है, जिससे सरल पास/फेल मेट्रिक्स से परे विस्तृत व्यवहार संबंधी निदान और रिग्रेशन डिटेक्शन सक्षम होता है।

Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko2026-07-09
💻 computer science

Specification Grounding Drives Test Effectiveness for LLM Code

यह शोध पत्र यह प्रदर्शित करता है कि परीक्षण की मात्रा बढ़ाने या केवल स्व-जनित परीक्षणों पर निर्भर रहने के बजाय, स्पष्ट विनिर्देशों (explicit specifications) में परीक्षण जनरेशन को आधारित करना, गलत सूचनाओं (false alarms) को कम करके और अधिक बग्स को पकड़कर, सही कोड उत्पन्न करने में लार्ज लैंग्वेज मॉडल्स की प्रभावशीलता में महत्वपूर्ण सुधार करने वाला प्राथमिक चालक है।

Amin Haeri, Mahdi Ghelichi2026-07-09
🤖 AI

SmartHomeSecure: Automated Detection and Repair of Smart Home Configuration Errors Using Large Language Models

यह शोध पत्र SmartHomeSecure को प्रस्तुत करता है, जो एक प्रोटोटाइप सिस्टम है जो हल्के प्रोग्राम विश्लेषण (lightweight program analysis) को बाधा-निर्देशित लार्ज लैंग्वेज मॉडल्स (constraint-guided large language models) के साथ जोड़ता है ताकि होम असिस्टेंट YAML कॉन्फ़िगरेशन फ़ाइलों में सिंटैक्स और सिमेंटिक त्रुटियों का स्वचालित रूप से पता लगाया जा सके और उन्हें सुधारा जा सके, जिससे बिना किसी भ्रामक आउटपुट (hallucinated outputs) के उच्च पहचान सटीकता और मरम्मत सफलता दर प्राप्त होती है।

Yizhi Wang, Xinghua Gao, Reachsak Ly, Alireza Shojaei2026-07-09
💻 computer science

Deployment Risk Assessment Using Diff-Aware Features: A Case Study at Prime Video

यह शोध पत्र प्राइम वीडियो में कोड परिनियोजन (डिप्लॉयमेंट) जोखिमों की भविष्यवाणी करने के लिए एक गोपनीयता-संरक्षण, भाषा-अज्ञेय (लैंग्वेज-अगनॉस्टिकिक) ढांचे को प्रस्तुत करता है, जो डिफ-अवेयर (diff-aware) विशेषताओं को निकालने के लिए एलएलएम (LLMs) का लाभ उठाता है, यह प्रदर्शित करते हुए कि संरचनात्मक कोड जटिलता वॉल्यूम मेट्रिक्स की तुलना में एक अधिक विश्वसनीय जोखिम संकेतक है और आंतरिक एवं सार्वजनिक दोनों डेटासेटों में उच्च सटीकता प्राप्त करता है।

Mayur Kurup, Hyunjae Suh, Swathi Vaidyanathan, Pranesh Vyas, Srinidhi Madabhushi, Yegor Silyutin2026-07-09
💻 computer science

Scaling Author Identity Disambiguation to the World of Code: A Methodology

यह शोध पत्र 'वर्ल्ड ऑफ कोड' में लेखक पहचान विसंगति निवारण (author identity disambiguation) के लिए एक स्केलेबल कार्यप्रणाली प्रस्तुत करता है जो स्ट्रक्चरल ग्राफ कट्स को GitHub no-reply आइडेंटिफायर्स पर प्रशिक्षित प्रति-एज क्लासिफायर के साथ जोड़कर लाखों पहचानों के "मेगा-क्लस्टर्स" में अत्यधिक विलय (over-merging) को हल करता है, जिससे स्टेट-ऑफ-द-आर्ट प्रिसिजन और रिकॉल प्राप्त होता है और पहचान समाधान (identity resolution) को स्केल करने पर प्रमुख सीखों का दस्तावेजीकरण किया जाता है।

Audris Mockus2026-07-09
💻 computer science

Thinking More, Harnessing Better: State Machine Guided Harness Automatic Generation with Project Digestion and Workflow Decomposition

SynapseFlow एक नवीन स्वचालित हार्नेस जनरेटर है जो मौजूदा LLM-आधारित विधियों की सीमाओं को दूर करने के लिए स्टेट मशीन-निर्देशित वर्कफ़्लो डिकंपोज़िशन और डेटाफ्लो-अवेयर फंक्शन एग्रीगेशन का लाभ उठाता है, जिससे वास्तविक दुनिया के सॉफ़्टवेयर प्रोजेक्ट्स में काफी अधिक ब्रांच कवरेज और बग डिटेक्शन दर प्राप्त होती है।

Xing Zhang, Zikang Huang, Gang Yang, CongChong Wang, Lu Liu, Bin Yin, Mingyi Wang, Ziquan Zhao, Min Li, Zhenyu Chen, Bo (…)2026-07-09
🤖 machine learning

ORCAID: Oblique Rule-Based Continuous-Action Interpretation for Deep RL Policies

यह शोध पत्र ORCAID को प्रस्तुत करता है, जो एक नवीन विधि है जो निरंतर-एक्शन (continuous-action) वातावरण में डीप रिइन्फोर्समेंट लर्निंग एजेंटों से व्याख्या योग्य नियम-आधारित नीतियों को निकालने के लिए एक कुशल तिरछी निर्णय वृक्ष (oblique decision tree) एल्गोरिदम को तीन-चरणीय स्प्लिट सर्च और लीफ मर्जिंग के साथ नियोजित करती है ताकि नियमों के एक संक्षिप्त सेट के साथ उच्च प्रदर्शन प्राप्त किया जा सके।

Ignacio D. Lopez-Miguel, Ezio Bartocci, Thomas Eiter, Martin Tappler2026-07-09
💻 computer science

Holistic B2X Mobile Application Development -- A Reference Model

यह शोध पत्र साहित्य समीक्षा और 28 विशेषज्ञ साक्षात्कारों को संश्लेषित करके एक समग्र संदर्भ मॉडल में तकनीकी और संचार प्रक्रियाओं के एकीकरण के माध्यम से प्रबंधन निर्णयों का मार्गदर्शन करने वाले एक समग्र संदर्भ मॉडल में मौजूदा B2X मोबाइल ऐप विकास मॉडलों और व्यावहारिक अनुप्रयोग के बीच के अंतर को संबोधित करता है।

Oliver Werth, Nadine Guhr, Michael H. Breitner2026-07-09
⚛️ quantum physics

Quantum Software Engineering in Practice: FPGA and AI Integration for Quantum Certification

यह शोध पत्र QAccCert प्रस्तुत करता है, जो क्वांटम सॉफ्टवेयर इंजीनियरिंग सिद्धांतों पर आधारित एक हाइब्रिड सर्टिफिकेशन फ्रेमवर्क है जो क्वांटम सिमुलेशन में CHSH असमानता उल्लंघन के माध्यम से अत्यधिक कुशल एंटैंगलमेंट सत्यापन प्राप्त करने के लिए FPGAs और AI को एकीकृत करता है, जो भविष्य के NISQ हार्डवेयर प्रमाणन के लिए एक स्केलेबल मार्ग प्रदर्शित करता है।

Marcos Guillermo Lammers, José Manuel Suárez, Adrián Pousa, Luis Mariano Bibbó, Alejandro Fernández2026-07-09
💻 computer science

Rethinking Code Performance Benchmarks for LLMs

यह शोध पत्र यह प्रकट करता है कि अपर्याप्त परीक्षण सूचियों के कारण मौजूदा एलएलएम (LLM) कोड प्रदर्शन बेंचमार्क काफी हद तक अपर्याप्त हैं, और एक नवीन मल्टी-एजेंट फ्रेमवर्क प्रस्तावित करता है जो एलएलएम द्वारा जनरेट किए गए कोड में महत्वपूर्ण रनटाइम सुधारों को प्रभावी ढंग से उजागर करने के लिए अधिक कठोर, प्रदर्शन-उन्मुख परीक्षण उत्पन्न करता है।

Nhat Minh Le (Peter), Yisen Xu (Peter), Zhijie Wang (Peter), Tse-Hsun (Peter), Chen2026-07-09