💻 computer science

DIRT: Database-Integrated Random Testing

यह शोध पत्र DIRT प्रस्तुत करता है, जो एक ऐसा प्रतिमान (paradigm) है जो एक रैंडम टेस्टिंग फ्रेमवर्क को सीधे डेटाबेस मैनेजमेंट सिस्टम में एकीकृत करता है ताकि डेवलपर्स शुद्धता गुणों (correctness properties) को परिभाषित कर सकें और फॉल्स पॉजिटिव्स को काफी कम कर सकें, जो सक्रिय रूप से विकसित हो रहे टर्सो (Turso) इंजन में 23 पुष्ट बग्स की खोज करके अपनी प्रभावशीलता प्रदर्शित करता है जहाँ पारंपरिक उपकरण विफल रहे थे।

Alperen Keles, Ethan Chou, Harrison Goldstein, Leonidas Lampropoulos2026-04-21
🤖 AI

StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability

यह शोध पत्र StressWeb को प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क (diagnostic benchmark) है जो स्थिर वातावरण में उनके प्रदर्शन की वास्तविक, संरचित गड़बड़ियों (structured perturbations) के साथ व्यवस्थित रूप से तुलना करके बड़े भाषा मॉडल-आधारित वेब एजेंटों की मजबूती का मूल्यांकन करता है ताकि छिपे हुए विफलता मोड और मजबूती के अंतराल को प्रकट किया जा सके।

Haoyue Bai, Dong Wang, Long Chen, Bingguang Hao, Pengyang Shao, Yonghui Yang, Yicheng He, Chenyi Zhuang2026-04-21
💻 computer science

On the Use of Commit Messages for Corrective Software Maintenance: A Systematic Mapping Study

2004 और मई 2025 के बीच प्रकाशित 97 स्रोतों का यह व्यवस्थित मैपिंग अध्ययन प्रकट करता है कि जबकि कमिट संदेशों (commit messages) का उपयोग—अक्सर कोड डिफ्स (code diffs) और एआई-संचालित तकनीकों के साथ मिलकर—सुधारात्मक रखरखाव (corrective maintenance) में बग विश्लेषण और पहचान के समर्थन के लिए तेजी से किया जा रहा है, वे अक्सर परिवर्तन के इरादे (change intent) को पूरी तरह से व्यक्त करने के लिए पर्याप्त विवरण की कमी रखते हैं और स्वचालित प्रोग्राम रिपेयर (automated program repair) जैसे अन्य महत्वपूर्ण विषयों के लिए कम उपयोग किए जाते हैं।

Syful Islam, Stefano Zacchiroli2026-04-21
🧬 biology

MLE-Toolbox: An Open-Source Toolbox for Comprehensive EEG and MEG Data Analysis

MLE-Toolbox एक व्यापक, ओपन-सोर्स MATLAB टूलबॉक्स है जो एक सहज ग्राफिकल इंटरफेस के भीतर प्रीप्रोसेसिंग और सोर्स लोकलाइजेशन से लेकर मशीन लर्निंग क्लासिफिकेशन तक संपूर्ण MEG/EEG विश्लेषण पाइपलाइन को एकीकृत करता है, जबकि पुनरुत्पादक अनुसंधान (reproducible research) को सुगम बनाने के लिए स्थापित न्यूरोइमेजिंग प्लेटफॉर्म्स के साथ अंतर-संचालनीयता (interoperability) सुनिश्चित करता है।

Xiaobo Liu2026-04-21
🤖 machine learning

Understanding Tool-Augmented Agents for Lean Formalization: A Factorial Analysis

यह शोध पत्र तीन टूल श्रेणियों—फाइन-ट्यून्ड मॉडल क्वेरीइंग, नॉलेज सर्च और कंपाइलर फीडबैक—का एक व्यवस्थित फैक्टोरियल विश्लेषण करके नेचुरल लैंग्वेज मैथमेटिक्स को लीन 4 (Lean 4) कोड में अनुवाद करने में टूल-ऑगमेंटेड एजेंट्स की प्रभावशीलता की जांच करता है, ताकि वन-शॉट बेसलाइन्स की तुलना में उनके महत्वपूर्ण सुधार को प्रदर्शित किया जा सके और संकलन सफलता (compilation success) तथा सिमेंटिक फिडेलिटी (semantic fidelity) में उनके व्यक्तिगत योगदान को मापा जा सके।

Ke Zhang, Patricio Gallardo, Maziar Raissi, Sudhir Murthy2026-04-21
🤖 AI

SpecPylot: Python Specification Generation using Large Language Models

SpecPylot एक पायथन टूल है जो निष्पादन योग्य कॉन्ट्रैक्ट एनोटेशन (contract annotations) उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है और मूल कोड को सुरक्षित रखते हुए शुद्धता सुनिश्चित करने के लिए क्रॉसहेयर (Crosshair) के सिम्बोलिक एक्जीक्यूशन का उपयोग करके उन्हें पुनरावृत्ति से परिष्कृत करता है।

Ragib Shahariar Ayon, Shibbir Ahmed2026-04-21
🤖 AI

Certified Program Synthesis with a Multi-Modal Verifier

यह शोधपत्र LeetProof प्रस्तुत करता है, जो मल्टी-मोडल वेरीफ़ायर Velvet पर निर्मित एक एजेंटिक पाइपलाइन है, जो डायनेमिक वैलिडेशन, ऑटोमेटेड रीजनिंग और इंटरैक्टिव प्रूफ स्क्रिप्टिंग को एकीकृत करके सिंगल-पैराडाइम दृष्टिकोणों की सीमाओं को दूर करता है, ताकि स्पेकिफिकेशन डिफेक्ट्स का व्यवस्थित रूप से पता लगाया जा सके और पूर्णतः प्रमाणित समाधानों की काफी उच्च दर प्राप्त की जा सके।

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey2026-04-21
💻 computer science

Exploring Ethical Concerns of Mobile Applications from App Reviews: A Literature Survey

यह शोध पत्र गोपनीयता, सुरक्षा और सुलभता के संबंध में उपयोगकर्ता द्वारा रिपोर्ट की गई नैतिक चिंताओं की पहचान करने के लिए मोबाइल ऐप समीक्षाओं का विश्लेषण करने वाले 37 अध्ययनों का एक व्यापक सर्वेक्षण प्रस्तुत करता है, साथ ही वर्तमान अनुसंधान अंतराल को उजागर करता है और स्वचालित पहचान एवं बेहतर विकास प्रथाओं के लिए एक भविष्य का एजेंडा प्रस्तावित करता है।

Aakash Sorathiya, Gouri Ginde2026-04-21
🤖 AI

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

यह शोध पत्र सॉफ्टवेयर इंजीनियरिंग में LLM-as-a-Judge प्रणालियों का व्यवस्थित रूप से ऑडिट करता है, जो यह प्रकट करता है कि उनका मूल्यांकन प्रॉम्प्ट-प्रेरित पूर्वाग्रहों और प्रस्तुति संकेतों के प्रति अत्यधिक संवेदनशील है, जो सटीकता और मॉडल रैंकिंग को महत्वपूर्ण रूप से विकृत कर सकता है, जिससे विश्वसनीय कोड मूल्यांकन के लिए सटीकता के साथ-साथ पूर्वाग्रह संवेदनशीलता मेट्रिक्स को शामिल करना आवश्यक हो जाता है।

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard2026-04-21
💻 computer science

Treating Run-time Execution History as a First-Class Citizen: Co-Versioning Run-time Behavior alongside Code

यह शोध पत्र "बिहेवियरल को-वर्जनिंग" (Behavioral Co-Versioning) का प्रस्ताव करता है, जो एक ऐसा प्रतिमान (paradigm) है जो सिमेंटिक डिफिंग (semantic diffing), व्यवहार-जागरूक रिग्रेशन लोकलाइजेशन (behavior-aware regression localization) और सॉफ्टवेयर विकास के पूर्वव्यापी ऑडिटिंग (retrospective auditing) को सक्षम करने के लिए पारंपरिक सोर्स कोड वर्जनिंग को रन-टाइम निष्पादन इतिहास (run-time execution histories) के एक स्थायी, क्वेरेबल आर्काइव के साथ संवर्धित करता है।

Marcus Kessel2026-04-21