🤖 AI

Where Do AI Coding Agents Fail? An Empirical Study of Failed Agentic Pull Requests in GitHub

यह शोध पत्र GitHub पर 33,000 AI-जनित पुल रिक्वेस्ट (pull requests) के एक बड़े पैमाने के अनुभवजन्य अध्ययन को प्रस्तुत करता है, जो मात्रात्मक विश्लेषण और गुणात्मक वर्गीकरण (qualitative taxonomy) को जोड़कर यह प्रकट करता है कि जहाँ दस्तावेज़ीकरण और CI कार्य सबसे अधिक बार सफल होते हैं, वहीं एजेंटिक विफलताएं बड़े कोड परिवर्तनों, CI विफलताओं और मानव समीक्षक की अपेक्षाओं के साथ मिसअलाइनमेंट जैसे कारकों द्वारा संचालित होती हैं।

Ramtin Ehsani, Sakshi Pathak, Shriya Rawal, Abdullah Al Mujahid, Mia Mohammad Imran, Preetha Chatterjee2026-01-22
💻 computer science

Repairing vulnerabilities without invisible hands. A differentiated replication study on LLMs

यह शोध पत्र एक विभेदित प्रतिकृति अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्वचालित भेद्यता सुधार (vulnerability repair) में लार्ज लैंग्वेज मॉडल्स की सफलता वास्तविक तर्क के बजाय प्रशिक्षण डेटा के स्मृतिकरण (memorization) द्वारा संचालित हो सकती है, क्योंकि प्रॉम्प्ट्स में दोष के स्थान (fault location) को बदलने से सही पैच उत्पन्न करने की उनकी क्षमता काफी कम हो जाती है।

Maria Camporese, Fabio Massacci2026-01-15
💻 computer science

Adaptive Trust Metrics for Multi-LLM Systems: Enhancing Reliability in Regulated Industries

यह शोध पत्र मल्टी-एलएलएम (multi-LLM) प्रणालियों के लिए अनुकूली विश्वास मेट्रिक्स (adaptive trust metrics) का एक ढांचा प्रस्तावित करता है जो गतिशील निगरानी और अनिश्चितता मूल्यांकन के माध्यम से स्वास्थ्य सेवा और वित्त जैसे विनियमित उद्योगों में विश्वसनीयता को परिमाणित करता है और जवाबदेही सुनिश्चित करता है।

Tejaswini Bollikonda2026-01-15
💻 computer science

Integrating APK Image and Text Data for Enhanced Threat Detection: A Multimodal Deep Learning Approach to Android Malware

यह शोध पत्र एक मल्टीमॉडल डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है जो एंड्रॉइड मैलवेयर डिटेक्शन को बेहतर बनाने के लिए APK बाइटकोड छवियों और LLaMA-2 द्वारा निकाले गए टेक्स्ट फीचर्स को एकीकृत करता है, जिसमें यह पाया गया है कि जबकि उच्च-रिज़ॉल्यूशन वाली RGB छवियां वर्गीकरण प्रदर्शन में महत्वपूर्ण सुधार करती हैं, CLIP मॉडल के माध्यम से छवि और टेक्स्ट का विशिष्ट एकीकरण सीमित क्षमता प्रदर्शित करता है।

Md Mashrur Arifin, Maqsudur Rahman, Nasir U. Eisty2026-01-15
💻 computer science

On the Flakiness of LLM-Generated Tests for Industrial and Open-Source Database Management Systems

यह अध्ययन चार डेटाबेस प्रबंधन प्रणालियों के लिए LLM-जनरेटेड परीक्षणों की अस्थिरता (flakiness) की जांच करता है, जो यह प्रकट करता है कि ऐसे परीक्षणों में मौजूदा परीक्षणों की तुलना में अस्थिरता की दर थोड़ी अधिक है, जिसका मुख्य कारण गैर-गारंटीकृत निष्पादन क्रमों (non-guaranteed execution orders) पर निर्भरता है, और यह भी कि LLM अक्सर अपने प्रॉम्प्ट से मौजूदा अस्थिरता पैटर्न को प्रसारित करते हैं, विशेष रूप से क्लोज्ड-सोर्स वातावरण में।

Alexander Berndt, Thomas Bach, Rainer Gemulla, Marcus Kessel, Sebastian Baltes2026-01-15
💻 computer science

Formally Verifying Noir Zero Knowledge Programs with NAVe

यह शोध पत्र NAVe प्रस्तुत करता है, जो एक ओपन-सोर्स फॉर्मल वेरिफायर है जो उनके ACIR इंटरमीडिएट रिप्रेजेंटेशन को फाइनाइट फील्ड पॉलीनोमियल इक्वेशन्स में अनुवादित करके Noir ज़ीरो-नॉलेज प्रोग्राम्स की शुद्धता और उचित बाधाओं को औपचारिक रूप से सत्यापित करने के लिए SMT-LIB और cvc5 सॉल्वर का उपयोग करता है।

Pedro Antonino, Namrata Jain2026-01-15
💻 computer science

DepRadar: Agentic Coordination for Context Aware Defect Impact Analysis in Deep Learning Libraries

DepRadar एक एजेंट समन्वय ढांचा (agent coordination framework) है जो डीप लर्निंग लाइब्रेरीज़ में दोषों (defects) को स्वचालित रूप से पहचानने और डाउनस्ट्रीम क्लाइंट प्रोग्राम्स पर उनके प्रभाव का सटीक मूल्यांकन करने के लिए विशिष्ट एजेंटों, स्टैटिक एनालिसिस और डोमेन-विशिष्ट नियमों का लाभ उठाता है।

Yi Gao, Xing Hu, Tongtong Xu, Jiali Zhao, Xiaohu Yang, Xin Xia2026-01-15