💻 computer science

How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos

यह अध्ययन 41 घंटों के गेमप्ले वीडियो में विजुअल बग्स का पता लगाने में ऑफ-द-शेल्फ विजन लैंग्वेज मॉडल्स (VLMs) की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि बेसलाइन प्रदर्शन आशाजनक है, सामान्य नॉन-फाइन-ट्यूनिंग संवर्धन रणनीतियां केवल मामूली सुधार प्रदान करती हैं, जो यह सुझाव देती हैं कि भविष्य की प्रगति के लिए टेक्स्टुअल और विजुअल विसंगतियों के बीच बेहतर अंतर करने हेतु हाइब्रिड दृष्टिकोणों की आवश्यकता है।

Wentao Lu, Alexander Senchenko, Alan Sayle, Abram Hindle, Cor-Paul Bezemer2026-03-25
💻 computer science

Does Teaming-Up LLMs Improve Secure Code Generation? A Comprehensive Evaluation with Multi-LLMSecCodeEval

यह शोध पत्र MULTI-LLMSECCODEEVAL फ्रेमवर्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्टेटिक एनालिसिस और संरचित सहयोग के साथ एकीकृत सावधानीपूर्वक ऑर्केस्ट्रेटेड मल्टी-एलएलएम (multi-LLM) एन्सेम्बल्स, सुरक्षित कोड उत्पन्न करने में एकल बड़े लैंग्वेज मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करते हैं, जो यह सिद्ध करता है कि सुरक्षा के लिए सिस्टम डिज़ाइन, मॉडल के स्केल से अधिक महत्वपूर्ण है।

Bushra Sabir, Shigang Liu, Seung Ick Jang, Sharif Abuadbba, Yansong Gao, Kristen Moore, SangCheol Kim, Hyoungshick Kim (…)2026-03-25
💻 computer science

A Study of Scientific Computational Notebook Quality

यह अध्ययन 2024 के नेचर प्रकाशनों से वैज्ञानिक कोड की गुणवत्ता का मूल्यांकन करता है, जो पुनरुत्पादकता (reproducibility), पठनीयता और पुन: प्रयोज्यता में गंभीर चुनौतियों को प्रकट करता है—जैसे कि निम्न निष्पादन सफलता दर, व्यापक कोड दोहराव और उलझा हुआ स्टेट मैनेजमेंट—जो वैज्ञानिक प्रगति में बाधा डालते हैं और बेहतर उपकरणों एवं एब्स्ट्रैक्शंस की आवश्यकता को रेखांकित करते हैं।

Shun Kashiwa, Ayla Kurdak, Savitha Ravi, Ridhi Srikanth, Angel Thakur, Sonia Chandra, Jonathan Truong, Michael Coblenz2026-03-25
⚛️ quantum physics

Understanding Bugs in Quantum Simulators: An Empirical Study

यह शोध पत्र 12 ओपन-सोर्स क्वांटम सिम्युलेटर्स में पाए गए 394 पुष्ट बग्स का एक व्यापक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि विफलताएं मुख्य रूप से उपयोगकर्ताओं द्वारा खोजी जाती हैं, अक्सर मूक तार्किक त्रुटियों के रूप में प्रकट होती हैं, और अक्सर मूल क्वांटम तर्क के बजाय शास्त्रीय बुनियादी ढांचे के मुद्दों से उत्पन्न होती हैं।

Krishna Upadhyay, Moshood Fakorede, Umar Farooq2026-03-25
💻 computer science

A Practical Framework for Flaky Failure Triage in Distributed Database Continuous Integration

यह शोधपत्र SCOUT को प्रस्तुत करता है, जो एक व्यावहारिक, स्टेट-अवेयर (state-aware) कॉज़ल ऑनलाइन फ्रेमवर्क है जो डिप्लॉयमेंट चुनौतियों जैसे कि लेबल बायस और टेलीमेट्री शिफ्ट्स से निपटने के लिए प्री-फेलियर टेलीमेट्री और ऐतिहासिक डेटा का लाभ उठाकर, डिस्ट्रिब्यूटेड डेटाबेस CI में फ्लैकी फेलियर्स के मिलीसेकंड-लेटेंसी, अनसर्टेन्टी-कैलिब्रेटेड ट्राइएज को सक्षम बनाता है।

Jun-Peng Zhu, Qizhi Wang, Yulong Zhai, Yishen Sun, Sen Chen, Kai Xu, Peng Cai, Hongming Zhang, Heng Long, Liu Tang, Qi L (…)2026-03-25
💻 computer science

Rethinking Self-Sovereign Identity Principles: An Actor-Oriented Categorization of Requirements

यह शोध पत्र SSI सिद्धांतों को प्रमुख अभिनेताओं (actors) से जुड़े 24 आवश्यकताओं में विघटित करके, उनके बीच की अंतःक्रियाओं को औपचारिक रूप देने के लिए एक निर्भरता मॉडल (dependency model) पेश करके, और उपयोगकर्ता-केंद्रित आवश्यकताओं को उत्तरदायित्व एवं स्वामित्व विशिष्टताओं के साथ एकीकृत करने वाले DI/SSI सिस्टम आर्किटेक्चर के लिए पहला संरचित मॉडल प्रदान करके, मौजूदा विकेंद्रीकृत पहचान (Decentralized Identity) अनुसंधान में उपयोगकर्ता परिप्रेक्ष्य की कमी को संबोधित करता है।

Daria Schumm, Burkhard Stiller2026-03-25
💻 computer science

MuSe: a Mutation Testing Plugin for the Remix IDE

यह शोध पत्र MuSe को प्रस्तुत करता है, जो Remix IDE के लिए एक नवीन म्यूटेशन टेस्टिंग प्लगइन है जो डेवलपर्स और शोधकर्ताओं को अतिरिक्त सेटअप की आवश्यकता के बिना स्मार्ट कॉन्ट्रैक्ट टेस्ट सुइट की प्रभावशीलता का आकलन करने और कमजोरियों की पहचान करने में मदद करने के लिए पारंपरिक, सॉलिडिटी-विशिष्ट और सुरक्षा-उन्मुख ऑपरेटरों को एकीकृत करता है।

Gerardo Iuliano, Daniele Carangelo, Carmine Calabrese, Dario Di Nucci2026-03-25
🤖 AI

Evaluating LLM-Based Test Generation Under Software Evolution

यह बड़े पैमाने पर किया गया अनुभवजन्य अध्ययन यह प्रकट करता है कि जहाँ LLMs स्थिर कोड के लिए उच्च गुणवत्ता वाले यूनिट टेस्ट उत्पन्न करते हैं, वहीं उनका प्रदर्शन अर्थ-परिवर्तक (semantic-altering) और अर्थ-संरक्षण करने वाले (semantic-preserving) दोनों प्रकार के कोड परिवर्तनों के तहत काफी कम हो जाता है, जो वास्तविक अर्थपूर्ण तर्क या प्रतिगमन जागरूकता (regression awareness) के बजाय सतही पैटर्न पर अत्यधिक निर्भरता को दर्शाता है।

Sabaat Haroon, Mohammad Taha Khan, Muhammad Ali Gulzar2026-03-25
🤖 AI

Code Review Agent Benchmark

यह शोध पत्र c-CRAB प्रस्तुत करता है, जो एआई एजेंटों की कोड समीक्षा क्षमताओं का मूल्यांकन करने के लिए मानव समीक्षाओं से प्राप्त एक नवीन बेंचमार्क डेटासेट है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक एजेंट केवल लगभग 40% कार्यों को हल करते हैं और सॉफ्टवेयर गुणवत्ता आश्वासन में मानव-एजेंट सहयोग के महत्वपूर्ण अवसरों को रेखांकित करता है।

Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury2026-03-25
💻 computer science

ConceptCoder: Improve Code Reasoning via Concept Learning

ConceptCoder एक नवीन फाइन-ट्यूनिंग विधि है जो कोड रीजनिंग, विशेष रूप से भेद्यता का पता लगाने (vulnerability detection) में सुधार करती है, जो बड़े भाषा मॉडलों को तर्क करने से पहले मानव-समझने योग्य कोड अवधारणाओं को पहचानने के लिए प्रशिक्षित करती है, जिससे कई बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है और यह ब्रांच प्रेडिक्शन जैसे अन्य कार्यों में भी सामान्यीकृत होती है।

Md Mahbubur Rahman, Hengbo Tong, Wei Le2026-03-25