⚛️ high-energy experiments

CelloAI Benchmarks: Toward Repeatable Evaluation of AI Assistants

यह शोध पत्र CelloAI पेश करता है, जो वैज्ञानिक सॉफ्टवेयर विकास की अनूठी बाधाओं को संबोधित करने के लिए कोड दस्तावेज़ीकरण, GPU कर्नेल जनरेशन और ग्राफ़िकल डेटा विश्लेषण सहित HEP/HPC-विशिष्ट कार्यों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किए गए दोहराव योग्य और स्वचालित बेंचमार्क का एक समूह है।

Mohammad Atif, Kriti Chopra, Fang-Ying Tsai, Ozgur O. Kilic, Tianle Wang, Zhihua Dong, Douglas Benjamin, Charles Leggett (…)2026-03-03
💻 computer science

A Systematic Study of LLM-Based Architectures for Automated Patching

यह शोध पत्र चार LLM-आधारित पैचिंग आर्किटेक्चर का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि मॉडल क्षमता के अकेले होने की तुलना में आर्किटेक्चरल डिज़ाइन और इटरेशन डेप्थ अधिक महत्वपूर्ण हैं, जिसमें सामान्य-उद्देश्य वाले कोड एजेंट विभिन्न प्रतिमानों (पैराडाइम्स) में दक्षता, लचीलेपन और ओवरहेड के बीच के समझौतों के बावजूद समग्र रूप से सर्वश्रेष्ठ प्रदर्शन प्राप्त करते हैं।

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang2026-03-03
🤖 AI

Inference-Time Safety For Code LLMs Via Retrieval-Augmented Revision

यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड इन्फरेंस-टाइम सुरक्षा तंत्र प्रस्तुत करता है जो जनरेट किए गए कोड को संशोधित करने में LLMs को निर्देशित करने के लिए क्यूरेटेड स्टैक ओवरफ्लो ज्ञान का लाभ उठाता है, जिससे मॉडल को पुन: प्रशिक्षित किए बिना व्याख्यात्मकता, उभरती हुई कमजोरियों के विरुद्ध मजबूती और सुरक्षा संरेखण को बढ़ाया जा सके।

Manisha Mukherjee, Vincent J. Hellendoorn2026-03-03
💻 computer science

The Repeat Offenders: Characterizing and Predicting Extremely Bug-Prone Source Methods

यह अध्ययन "ExtremelyBuggy" विधियों—बग्स से बार-बार जुड़े रहने वाली सोर्स कोड इकाइयों—की जांच करता है, जो यह प्रकट करता है कि यद्यपि वे कोड का एक छोटा हिस्सा बनाती हैं फिर भी अत्यधिक संख्या में दोष उत्पन्न करती हैं, तथापि विशिष्ट और आवर्ती विशेषताओं को प्रदर्शित करने के बावजूद, वे आरंभ में ही पूर्वानुमानित होने में कठिन बनी रहती हैं।

Ethan Friesen, Sasha Morton-Salmon, Md Nahidul Islam Opu, Shahidul Islam, Shaiful Chowdhury2026-03-02
💻 computer science

The Agentic Automation Canvas: a structured framework for agentic AI project design

यह शोध पत्र एजेंटिक ऑटोमेशन कैनवस (AAC) को प्रस्तुत करता है, जो एक संरचित, मशीन-इंटरऑपरेबल फ्रेमवर्क और ओपन-सोर्स वेब टूल है जिसे छह प्रमुख आयामों को कैप्चर करके और FAIR-अनुपालन प्रोजेक्ट कॉन्ट्रैक्ट्स को एक्सपोर्ट करके एजेंटिक AI सिस्टम के संभावित डिजाइन, गवर्नेंस और मूल्यांकन को मानकीकृत करने के लिए डिज़ाइन किया गया है।

Sebastian Lobentanzer2026-03-02
💻 computer science

Array-Carrying Symbolic Execution for Function Contract Generation

यह शोध पत्र LLVM के भीतर कार्यान्वित और Frama-C के साथ एकीकृत एक नवीन प्रतीकात्मक निष्पादन (symbolic execution) ढांचे को प्रस्तुत करता है जो निरंतर सरणी खंडों (contiguous array segments) पर इनवेरिएंट्स (invariants) और संशोधन जानकारी को प्रभावी ढंग से ले जाकर फंक्शन कॉन्ट्रैक्ट्स उत्पन्न करता है, जिससे सरणी-हेरफेर करने वाले कार्यों के विश्लेषण में मौजूदा दृष्टिकोणों की सीमाओं को दूर किया जा सके।

Weijie Lu, Jingyu Ke, Hongfei Fu, Zhouyue Sun, Yi Zhou, Guoqiang Li, Haokun Li2026-03-02
💻 computer science

Peeling Off the Cocoon: Unveiling Suppressed Golden Seeds for Mutational Greybox Fuzzing

यह शोध पत्र PoCo को प्रस्तुत करता है, जो एक म्यूटेशनल ग्रेबॉक्स फज़िंग तकनीक है जो बाधा उत्पन्न करने वाले कंडीशनल स्टेटमेंट्स (conditional statements) को व्यवस्थित रूप से हटाकर आधुनिक कवरेज-आधारित सीड चयन (coverage-based seed selection) को बेहतर बनाता है ताकि पहले से दबे हुए उच्च-गुणवत्ता वाले सीड्स को खोजा और उपयोग किया जा सके।

Ruixiang Qian, Chunrong Fang, Zengxu Chen, Youxin Fu, Zhenyu Chen2026-03-02
💬 NLP

SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale

यह शोध पत्र SWE-rebench V2 को प्रस्तुत करता है, जो एक भाषा-अज्ञेय (language-agnostic) स्वचालित पाइपलाइन है जो सुदृढीकरण लर्निंग-आधारित (reinforcement learning-based) सॉफ्टवेयर इंजीनियरिंग एजेंटों के लिए प्रशिक्षण डेटा की कमी को दूर करने हेतु 20 भाषाओं में 32,000 से अधिक सत्यापित और 120,000+ सिंथेटिक सॉफ्टवेयर इंजीनियरिंग कार्यों का एक बड़े पैमाने का, विविध डेटासेट तैयार करती है।

Ibragim Badertdinov, Maksim Nekrashevich, Anton Shevtsov, Alexander Golubev2026-03-02
💻 computer science

Novice Developers Produce Larger Review Overhead for Project Maintainers while Vibe Coding

यह अध्ययन प्रकट करता है कि एआई कोडिंग एजेंटों का उपयोग करने वाले नौसिखिया डेवलपर्स ("वाइब कोडर्स") अनुभवी डेवलपर्स की तुलना में काफी अधिक मात्रा में कोड उत्पन्न करते हैं जिसके लिए अधिक व्यापक समीक्षा, कम स्वीकृति दर और लंबे समाधान समय की आवश्यकता होती है, जो यह संकेत देता है कि कम अनुभव वाले योगदानकर्ता रखरखाव करने वालों पर समीक्षा के बोझ को बढ़ाए बिना विशेषज्ञों की जगह केवल इतनी आसानी से नहीं ले सकते।

Syed Ammar Asdaque, Imran Haider, Muhammad Umar Malik, Maryam Abdul Ghafoor, Abdul Ali Bangash2026-03-02
💻 computer science

Invariant-Driven Automated Testing

यह शोध पत्र API विनिर्देशों के लिए एक प्रथम-क्रम तर्क-आधारित एनोटेशन भाषा APOSTL और PETIT नामक एक उपकरण को पेश करके माइक्रोसर्विस आर्किटेक्चर के लिए प्रभावी स्वचालित परीक्षण की कमी को संबोधित करता है, जो इन एनोटेशन का लाभ उठाकर माइक्रोसर्विसेज का उनके सोर्स कोड से स्वतंत्र रूप से स्वचालित रूप से परीक्षण करता है।

Ana Catarina Ribeiro2026-03-02