💻 computer science

Refactoring for Novices in Java: An Eye Tracking Study on the Extract vs. Inline Methods

जावा नौसिखियों से जुड़े एक आई-ट्रैकिंग अध्ययन से पता चलता है कि जबकि मेथड एक्सट्रैक्शन जटिल कार्यों के लिए प्रदर्शन में महत्वपूर्ण सुधार कर सकता है और दृश्य प्रयास को कम कर सकता है, यह अक्सर सरल कार्यों के लिए समझ में बाधा डालता है और संज्ञानात्मक भार को बढ़ाता है, जो यह सुझाव देता है कि शिक्षकों को शुरुआती लोगों के लिए समयपूर्व मॉड्यूलराइजेशन को बढ़ावा देने में सतर्क रहना चाहिए।

José Aldo Silva da Costa, Rohit Gheyi, José Júnior Silva da Costa, Márcio Ribeiro, Rodrigo Bonifácio, Hyggo Almeida, Ana (…)2026-03-06
🔒 cryptography

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks

यह शोध पत्र 31 LLM सुरक्षा बेंचमार्क का पहला बहु-आयामी मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वे अकादमिक प्रभाव में गैर-बेंचमार्क शोध पत्रों से बेहतर प्रदर्शन नहीं करते हैं, फिर भी एक महत्वपूर्ण मिसअलाइनमेंट (विसंगति) है जहाँ न तो लेखक की प्रमुखता और न ही शोध पत्र का प्रभाव कोड की गुणवत्ता के साथ सहसंबंध रखता है, जो रिपॉजिटरी की तत्परता और नैतिक मानकों में सुधार की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Junjie Chu, Xinyue Shen, Ye Leng, Michael Backes, Yun Shen, Yang Zhang2026-03-06
💻 computer science

iScript: A Domain-Adapted Large Language Model and Benchmark for Physical Design Tcl Script Generation

यह शोध पत्र iScript प्रस्तुत करता है, जो एक डोमेन-अनुकूलित Qwen3-8B मॉडल और इसके संगत बेंचमार्क है, जो विश्वसनीय Innovus Tcl स्क्रिप्ट उत्पन्न करने के लिए एक नवीन बहु-चरणीय डेटा संश्लेषण पाइपलाइन और एक दो-चरणीय सत्यापन ढांचे का लाभ उठाता है ताकि डेटा की कमी को दूर किया जा सके और भौतिक डिजाइन स्वचालन (physical design automation) में अत्याधुनिक LLMs से बेहतर प्रदर्शन किया जा सके।

Ning Xu, Zhaoyang Zhang, Senlin Shu, Lei Qi, Jiaqi Lv, Wensuo Wang, Tianhao Zhao, Chao Zhang, Zhaoliang Yang, Xiangyu Li (…)2026-03-06
💻 computer science

CLARC: C/C++ Benchmark for Robust Code Search

यह शोध पत्र CLARC को प्रस्तुत करता है, जो 6,700 से अधिक क्वेरी-कोड युग्मों और आइडेंटिफायर एनोनिमाइजेशन (identifier anonymization) एवं लो-लेवल भाषाओं में कंपाइलेशन जैसे चुनौतीपूर्ण मूल्यांकन सेटिंग्स वाला एक सुदृढ़ C/C++ कोड सर्च बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल वास्तविक अर्थ संबंधी समझ के बजाय लेक्सिकल फीचर्स (lexical features) पर अत्यधिक निर्भर हैं।

Kaicheng Wang, Liyan Huang, Weike Fang, Weihang Wang2026-03-06
💻 computer science

Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development

यह शोध पत्र वाइब कोड बेंच (Vibe Code Bench) को प्रस्तुत करता है, जो 100 वेब एप्लिकेशन विनिर्देशों (specifications) वाला एक नया बेंचमार्क है जिसका स्वायत्त ब्राउज़र एजेंटों द्वारा मूल्यांकन किया गया है, जो यह प्रकट करता है कि सर्वश्रेष्ठ फ्रंटियर मॉडल भी एंड-टू-एंड विकास कार्यों पर केवल 58.0% सटीकता प्राप्त करते हैं और स्वयं-परीक्षण (self-testing) एवं इवैल्यूएटर अलाइनमेंट (evaluator alignment) को सफलता के लिए महत्वपूर्ण कारकों के रूप में रेखांकित करता है।

Hung Tran, Langston Nashold, Rayan Krishnan, Antoine Bigeard, Alex Gu2026-03-06
💻 computer science

Behaviour Driven Development Scenario Generation with Large Language Models

यह शोध पत्र बीहेवियर-ड्रिवन डेवलपमेंट (BDD) परिदृश्यों को उत्पन्न करने के लिए 500 यूजर स्टोरीज के एक प्रोप्रायटरी डेटासेट पर GPT-4, Claude 3 और Gemini का मूल्यांकन करता है, जिसमें यह पाया गया कि जहाँ GPT-4 टेक्स्ट समानता में उत्कृष्ट है, वहीं मानव और LLM-आधारित विशेषज्ञों के अनुसार Claude 3 उच्चतम गुणवत्ता वाले परिणाम प्रदान करता है, जिसका इष्टतम प्रदर्शन मॉडल-विशिष्ट प्रॉम्प्टिंग रणनीतियों, उच्च-गुणवत्ता वाले इनपुट विवरणों और विशिष्ट जनरेशन मापदंडों पर निर्भर करता है।

Amila Rathnayake, Mojtaba Shahin, Golnoush Abaei2026-03-06
💻 computer science

Public Sector Open Source Program Offices - Archetypes for how to Grow (Common) Institutional Capabilities

यह अध्ययन 16 मामलों के गुणात्मक विश्लेषण के माध्यम से यूरोपीय सार्वजनिक क्षेत्र के संगठनों के भीतर ओपन सोर्स प्रोग्राम ऑफिस (OSPO) के छह विशिष्ट आर्केटाइप्स की पहचान करता है, जो OSS अपनाने, डिजिटल संप्रभुता और बेहतर सेवा इंटरऑपरेबिलिटी को बढ़ावा देने वाली संस्थागत क्षमताओं को डिजाइन करने के लिए रणनीतिक मार्गदर्शन और नीतिगत सिफारिशें प्रदान करता है।

Johan Linåker, Astor Nummelin Carlberg, Ciaran O'Riordan2026-03-06
🤖 machine learning

RepoLaunch: Automating Build&Test Pipeline of Code Repositories on ANY Language and ANY Platform

यह शोध पत्र RepoLaunch को प्रस्तुत करता है, जो एक ऐसा एजेंट है जो किसी भी भाषा और प्लेटफॉर्म के कोड रिपॉजिटरी के लिए बिल्ड और टेस्ट पाइपलाइन को स्वचालित करता है, जिससे बेंचमार्किंग और कोडिंग एजेंटों के प्रशिक्षण के लिए सॉफ्टवेयर इंजीनियरिंग डेटासेट का पूर्णतः स्वचालित निर्माण सक्षम होता है।

Kenan Li, Rongzhi Li, Linghao Zhang, Qirui Jin, Liao Zhu, Xiaosong Huang, Geng Zhang, Yikai Zhang, Shilin He, Chengxing (…)2026-03-06
💻 computer science

Formal Analysis of the Contract Automata Runtime Environment with Uppaal: Modelling, Verification and Testing

यह शोध पत्र इस ओपन-सोर्स वितरित अनुप्रयोग की विश्वसनीयता बढ़ाने के लिए स्टोकैस्टिक टाइमड ऑटोमेटा के एक नेटवर्क के रूप में कॉन्ट्रैक्ट ऑटोमेटा रनटाइम एनवायरनमेंट (CARE) के औपचारिक मॉडलिंग, Uppaal का उपयोग करके सत्यापन और परीक्षण प्रस्तुत करता है।

Davide Basile2026-03-05
💻 computer science

From Feedback to Failure: Automated Android Performance Issue Reproduction

यह शोधपत्र RevPerf को प्रस्तुत करता है, जो एक स्वचालित ढांचा है जो सिमेंटिक रिट्रीवल (semantic retrieval) और प्रॉम्प्ट इंजीनियरिंग के माध्यम से अस्पष्ट उपयोगकर्ता ऐप समीक्षाओं को संश्लेषित करके पुनरुत्पादन चरणों (reproduction steps) को उत्पन्न और निष्पादित करता है, और 72.73% सफलता दर के साथ एंड्रॉइड प्रदर्शन संबंधी समस्याओं की सफलतापूर्वक पहचान करता है।

Zhengquan Li, Zhenhao Li, Zishuo Ding2026-03-05