⚛️ quantum physics

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

यह शोध पत्र QPipe को प्रस्तुत करता है, जो एक लार्ज लैंग्वेज मॉडल-आधारित मल्टी-एजेंट सिस्टम है जो परीक्षण अनुकूलन (टेस्ट ऑप्टिमाइज़ेशन) के लिए प्राकृतिक भाषा की आवश्यकताओं को स्वायत्त रूप से निष्पादन योग्य क्वांटम अनुप्रयोगों में परिवर्तित करता है, जो कोड जनरेशन और निष्पादन में उच्च सफलता दर प्रदर्शित करते हुए पारंपरिक जेनेटिक एल्गोरिदम बेसलाइन से बेहतर प्रदर्शन करता है।

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos2026-07-02
🤖 AI

SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests

SWE-Doctor एक नवीन सॉफ्टवेयर इंजीनियरिंग एजेंट है जो बहुआयामी बग पुनरुत्पादन परीक्षणों से प्राप्त रनटाइम निदानों का उपयोग करके पैच जनरेशन में सुधार करता है ताकि इन परीक्षणों को सीधे जनरेशन लक्ष्यों के रूप में उपयोग करने की सीमाओं को दूर किया जा सके, जिससे SWE-bench बेंचमार्क पर अत्याधुनिक समाधान दरें प्राप्त की जा सकें।

Yaoqi Guo, Yang Liu, Jie M. Zhang, Yun Ma, Yiling Lou, Zhenpeng Chen2026-07-02
💻 computer science

Identifying Effective Program Comprehension Strategies through Gaze Transitions over Syntactic Elements

यह अध्ययन एब्स्ट्रैक्ट सिंटैक्स ट्री नोड्स के बीच ट्रांज़िशन में परिवर्तित आई-ट्रैकिंग डेटा का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि सफल प्रोग्राम कॉम्प्रिहेन्शन (कार्यक्रम बोध), असफल प्रयासों की तुलना में सिंटैक्टिक तत्वों के माध्यम से अधिक व्यवस्थित गेज़ ट्रांज़िशन पैटर्न द्वारा अभिलक्षित होता है।

Kyogo Horikawa, Hidetake Uwano, Haruhiko Yoshioka2026-07-02
💻 computer science

AutoRestTest at the SBFT 2026 Tool Competition

सिमेंटिक डिपेंडेंसी ग्राफ, मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग और लार्ज लैंग्वेज मॉडल्स को संयोजित करने वाला एक टूल, AutoRestTest, ने 11 APIs में दोषों का पता लगाने और ऑपरेशन्स को प्रोसेस करने में प्रभावी ढंग से एक घंटे के टेस्टिंग बजट के भीतर SBFT 2026 REST लीग की तीनों मूल्यांकन श्रेणियों में प्रथम स्थान सुरक्षित किया।

Tyler Stennett, Myeongsoo Kim, Saurabh Sinha, Alessandro Orso2026-07-02
🤖 AI

Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity

यह शोध पत्र "एडवर्सरियल प्रैगमैटिक्स" (adversarial pragmatics) प्रस्तुत करता है, जो एक भाषाई रूप से आधारित बेंचमार्क और एनोटेशन प्रोटोकॉल है जिसे क्षमता की सीमाओं, नीतिगत अस्पष्टता और निर्देश संघर्षों के बीच अंतर करने के माध्यम से एआई सुरक्षा (AI safety) का कठोरता से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें मॉडल व्यवहार और मूल्यांकनकर्ता निर्णयों में विफलताओं के निदान के लिए एक नियंत्रित वर्गीकरण, विशेषज्ञ मूल्यांकन मेट्रिक्स और एक सीड डेटासेट शामिल है।

Brett Reynolds2026-07-02
🤖 AI

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

यह शोध पत्र तीन प्रमुख रिपॉजिटरी-स्तरीय प्रदर्शन-अनुकूलन बेंचमार्क (GSO, SWE-Perf, और SWE-fficiency) का ऑडिट करता है और यह प्रकट करता है कि विभिन्न मशीनों पर महत्वपूर्ण संदर्भ पैच नाजुकता (reference patch fragility), रैंकिंग को विकृत करने वाले स्कोरिंग नियमों, और इस तथ्य के कारण कि अधिकांश कार्य पहले से ही मौजूदा सार्वजनिक सबमिशन द्वारा हल करने योग्य हैं, उनके लीडरबोर्ड स्कोर अविश्वसनीय हैं, जिससे वास्तविक प्रदर्शन अंतराल छिप जाता है।

Zhi Chen, Zhensu Sun, Yuling Shi, David Lo, Lingxiao Jiang2026-07-02
🤖 AI

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

यह शोध पत्र 'थियोरिया' (Theoria) का परिचय देता है, जो एक ऐसा सत्यापन आर्किटेक्चर है जो समाधानों को स्पष्ट औचित्यों के साथ ऑडिट योग्य, टाइप किए गए स्टेट ट्रांज़िशन (state transitions) में पुनर्गठित करके एआई उत्तरों की विश्वसनीयता को बढ़ाता है, जिससे यह छिपे हुए आधारों और काल्पनिक उद्धरणों का पता लगाने में समग्र एलएलएम (LLM) जजों से बेहतर प्रदर्शन करता है और विशेषज्ञ-स्तरीय समस्याओं पर उच्च सटीकता बनाए रखता है।

Ben Slivinski, Michael Saldivar2026-07-02
💻 computer science

Artificial Intelligence for Software Architecture: Literature Review and the Road Ahead

यह शोध पत्र 51 अध्ययनों की एक व्यवस्थित साहित्य समीक्षा प्रस्तुत करता है जो एआई (AI) अनुप्रयोगों को 17 अभ्यावहारिक-रिपोर्ट किए गए सॉफ्टवेयर आर्किटेक्चर चुनौतियों के साथ मैप करता है, छह महत्वपूर्ण क्षमता अंतराल की पहचान करता है, और आर्किटेक्चरल डिजाइन, मूल्यांकन और विकास में एआई को एक विश्वसनीय भागीदार के रूप में स्थापित करने के लिए एक पांच-स्तंभ अनुसंधान एजेंडा प्रस्तावित करता है।

Alessio Bucaioni, Martin Weyssow, Junda He, Yunbo Lyu, David Lo2026-07-01
💻 computer science

Good Vibrations? A Qualitative Study of Co-Creation, Communication, Flow, and Trust in Vibe Coding

यह शोध पत्र "वाइब कोडिंग" (vibe coding), जो कि एक प्राकृतिक भाषा प्रोग्रामिंग प्रतिमान है, का व्यापक डेवलपर विमर्श का विश्लेषण करके पहला व्यवस्थित गुणात्मक अध्ययन प्रस्तुत करता है ताकि एआई (AI) विश्वास, सह-सृजन और प्रवाह पर केंद्रित एक ग्राउंडेड थ्योरी प्रस्तावित की जा सके और साथ ही प्रमुख चुनौतियों एवं उभरते सर्वोत्तम अभ्यासों की पहचान की जा सके।

Veronica Pimenova, Sarah Fakhoury, Christian Bird, Margaret-Anne Storey, Madeline Endres2026-07-01
🤖 machine learning

GraphMend: Code Transformations for Fixing Graph Breaks in PyTorch 2

GraphMend एक कंपाइलर तकनीक है जो PyTorch 2 में फिक्सेबल (fixable) FX ग्राफ ब्रेक्स को समाप्त करने के लिए सोर्स-लेवल ट्रांसफॉर्मेशन को स्वचालित रूप से पहचानती है और उन्हें सिमेंटिक रूप से सुरक्षित रखती है, जिससे बिना किसी मैन्युअल डेवलपर रिफैक्टरिंग के बड़े निर्बाध ग्राफ सक्षम होते हैं और महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Savini Kashmira, Jayanaka Dantanarayana, Thamirawaran Sathiyalogeswaran, Krisztian Flautner, Lingjia Tang, Jason Mars2026-07-01