💻 computer science

Software is infrastructure: failures, successes, costs, and the case for formal verification

यह अध्याय यह तर्क देता है कि चूंकि सॉफ्टवेयर महत्वपूर्ण बुनियादी ढांचे के रूप में कार्य करता है और ऐतिहासिक विफलताओं की भारी लागत खराब गुणवत्ता के गंभीर परिणामों को प्रदर्शित करती है, इसलिए औपचारिक सत्यापन (फॉर्मल वेरिफिकेशन) और प्रोग्राम विश्लेषण को अपनाना आवश्यक है, एक ऐसा रुख जिसे सफल औद्योगिक अनुप्रयोगों द्वारा समर्थित किया गया है।

Giovanni Bernardi, Adrian Francalanza, Marco Peressotti, Mohammad Reza Mousavi2026-01-30
🤖 AI

Abstain and Validate: A Dual-LLM Policy for Reducing Noise in Agentic Program Repair

यह शोध पत्र एक ड्यूल-एलएलएम (dual-LLM) पॉलिसी फ्रेमवर्क पेश करता है जो बग एब्स्टेंशन (bug abstention) और पैच वैलिडेशन (patch validation) को जोड़कर औद्योगिक स्तर के एजेंटिक ऑटोमेटेड प्रोग्राम रिपेयर (Automated Program Repair) में शोर को काफी कम करता है और मानव समीक्षा से पहले सुधार की संभावना कम वाले बग्स और उप-इष्टतम पैच को फ़िल्टर करके सफलता दर में सुधार करता है।

José Cambronero, Michele Tufano, Sherry Shi, Renyao Wei, Grant Uy, Runxiang Cheng, Chin-Jung Liu, Shiying Pan, Satish Ch (…)2026-01-30
🤖 AI

A Hierarchical Imprecise Probability Approach to Reliability Assessment of Large Language Models

यह शोध पत्र HIP-LLM प्रस्तुत करता है, जो एक पदानुक्रमित अनिश्चित संभाव्यता ढांचा (hierarchical imprecise probability framework) है जो परिचालन प्रोफाइल्स और उप-डोमेन में विफलता-मुक्त संचालन की संभावनाओं को मॉडल करते हुए और पोस्टीरियर विश्वसनीयता लिफाफों (posterior reliability envelopes) के माध्यम से एपिस्टेमिक अनिश्चितता को स्पष्ट रूप से परिमाणित करते हुए लार्ज लैंग्वेज मॉडल्स के विश्वसनीयता मूल्यांकन को बढ़ाता है।

Robab Aghazadeh-Chakherlou, Qing Guo, Siddartha Khastgir, Peter Popov, Xiaoge Zhang, Xingyu Zhao2026-01-30
🤖 AI

DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle

यह शोध पत्र DevOps-Gym प्रस्तुत करता है, जो 30+ Java और Go प्रोजेक्ट्स के माध्यम से 700+ वास्तविक दुनिया के कार्यों वाला पहला एंड-टू-एंड बेंचमार्क है, जो पूर्ण DevOps वर्कफ़्लो में AI एजेंटों का मूल्यांकन करता है, और यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल इश्यू रिज़ॉलिंग, टेस्ट जनरेशन, मॉनिटरिंग और बिल्ड कॉन्फ़िगरेशन जैसे जटिल कार्यों के साथ काफी संघर्ष करते हैं।

Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christoph (…)2026-01-30
🤖 AI

Towards Comprehensive Benchmarking Infrastructure for LLMs In Software Engineering

यह शोध पत्र सॉफ्टवेयर इंजीनियरिंग के लिए वर्तमान लार्ज लैंग्वेज मॉडल मूल्यांकन में महत्वपूर्ण कमियों की पहचान करता है और BEHELM को पेश करता है, जो एक समग्र बेंचमार्किंग इंफ्रास्ट्रक्चर है जिसे निष्पक्ष, यथार्थवादी और पुनरुत्पादनीय मूल्यांकन सक्षम करने के लिए सॉफ्टवेयर-परिदृश्य विशिष्टताओं को मल्टी-मैट्रिक आकलन के साथ एकीकृत करने के लिए डिज़ाइन किया गया है।

Daniel Rodriguez-Cardenas, Xiaochang Li, Marcos Macedo, Antonio Mastropaolo, Dipin Khati, Yuan Tian, Huajie Shao, Denys (…)2026-01-30
💻 computer science

The Quiet Contributions: Insights into AI-Generated Silent Pull Requests

यह शोध पत्र 4,762 "साइलेंट" एआई-जनरेटेड पुल रिक्वेस्ट (SPRs) का पहला अनुभवजन्य अध्ययन प्रस्तुत करता है जिनमें चर्चा का अभाव है, और उनके स्वीकृति या अस्वीकृति के संभावित कारणों को उजागर करने के लिए कोड जटिलता, गुणवत्ता और सुरक्षा पर उनके प्रभाव का विश्लेषण करता है।

S M Mahedy Hasan, Md Fazle Rabbi, Minhaz Zibran2026-01-30
💻 computer science

From Logic to Toolchains: An Empirical Study of Bugs in the TypeScript Ecosystem

यह शोध पत्र 16 टाइपस्क्रिप्ट प्रोजेक्ट्स के 633 बग्स का पहला बड़े पैमाने पर अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि इस इकोसिस्टम का दोष प्रोफाइल लॉजिक त्रुटियों के बजाय टूलिंग, कॉन्फ़िगरेशन और एकीकरण संबंधी समस्याओं द्वारा हावी है, जो यह दर्शाता है कि स्टैटिक टाइपिंग ने सॉफ्टवेयर की नाजुकता को रनटाइम से बिल्ड सिस्टम और टूलचेन की ओर स्थानांतरित कर दिया है।

TianYi Tang, Saba Alimadadi, Nick Sumner2026-01-30
💻 computer science

CovAgent: Overcoming the 30% Curse of Mobile Application Coverage with Agentic AI and Dynamic Instrumentation

CovAgent एक अभिनव एजेंटिक AI फ्रेमवर्क है जो जटिल एक्टिवेशन स्थितियों की पहचान करने और उन्हें गतिशील रूप से संतुष्ट करने के लिए डिकम्पाइल्ड कोड का विश्लेषण करके मौजूदा एंड्रॉइड GUI टेस्टिंग टूल्स की सीमित कवरेज की समस्या को दूर करता है, जिससे यह अत्याधुनिक बेसलाइन्स की तुलना में एक्टिविटी, क्लास, मेथड और लाइन कवरेज को महत्वपूर्ण रूप से बढ़ाता है।

Wei Minn, Biniam Fisseha Demissie, Yan Naing Tun, Jiakun Liu, Mariano Ceccato, Lwin Khin Shar, David Lo2026-01-30
💻 computer science

Virtualization-based Penetration Testing Study for Detecting Accessibility Abuse Vulnerabilities in Banking Apps in East and Southeast Asia

यह शोध पत्र पूर्वी और दक्षिण-पूर्व एशिया में बैंकिंग अनुप्रयोगों की फ्योर्डफैंटम (FjordPhantom) मैलवेयर के प्रति संवेदनशीलता पर एक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह विश्लेषण करता है कि कैसे इसकी वर्चुअलाइजेशन और हुकिंग तकनीकें सुरक्षा उपायों को बायपास करने के लिए एक्सेसिबिलिटी सेवाओं का शोषण करती हैं, और इसके साथ ही पहचान एवं शमन रणनीतियों का प्रस्ताव करता है।

Wei Minn, Phong Phan, Vikas K. Malviya, Benjamin Adolphi, Yan Naing Tun, Henning Benzon Treichl, Albert Ching, Lwin Khin (…)2026-01-30
🤖 AI

More Code, Less Reuse: Investigating Code Quality and Reviewer Sentiment towards AI-generated Pull Requests

यह शोध पत्र कोड की गुणवत्ता और समीक्षक की भावना पर LLM एजेंटों के प्रभाव की जांच करता है, जिससे यह पता चलता है कि हालांकि AI-जनित पुल रिक्वेस्ट (pull requests) तटस्थ या सकारात्मक प्रतिक्रियाएं प्राप्त करते हैं, वे अक्सर बढ़ी हुई पुनरुक्ति (redundancy) और अनदेखी पुन: उपयोग के अवसरों से ग्रस्त होते हैं जो मूक तकनीकी ऋण (silent technical debt) में योगदान देते हैं।

Haoming Huang, Pongchai Jaisri, Shota Shimizu, Lingfeng Chen, Sota Nakashima, Gema Rodríguez-Pérez2026-01-30