💻 computer science

Bigger Isn't Always Better: A Comparative Evaluation of LLMs for Automated Code Review

यह शोध पत्र प्रदर्शित करता है कि छोटा और अधिक लागत प्रभावी क्लॉड हाइकू 4.5 (Claude Haiku 4.5), स्वचालित कोड समीक्षा में बड़े क्लॉड सोनेट 4.6 (Claude Sonnet 4.6) से बेहतर प्रदर्शन करता है, साथ ही यह भी प्रकट करता है कि सिंथेटिक बेंचमार्क मॉडल की क्षमताओं का अत्यधिक आकलन करते हैं और बड़े डिफ (diff) आकारों तथा प्रदर्शन संबंधी बग्स के साथ प्रदर्शन में भारी गिरावट आती है।

Shivam Pankaj Kumar, Swati Bararia, Kislay Raj2026-06-16
🤖 AI

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

यह शोध पत्र यह प्रदर्शित करता है कि जबकि एजेंटिक LLMs ज्ञात कमजोरियों को पुनरुत्पादित करने में उच्च स्थिरता प्रदर्शित करते हैं, नई समस्याओं को खोजने की उनकी क्षमता अत्यधिक असंगत है, जो यह सुझाव देता है कि LLM-आधारित सुरक्षा समीक्षाओं को नियतकालिक (deterministic) स्टैटिक एप्लिकेशन सिक्योरिटी टेस्टिंग (SAST) के स्थान पर उसका पूरक होना चाहिए।

Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair2026-06-16
💻 computer science

ScratchLens: Lens-Parametric Behavioral Equivalence for Scratch Programs

स्क्रैचलेंस (ScratchLens) स्क्रैच प्रोग्रामों में व्यवहारिक तुल्यता (behavioral equivalence) निर्धारित करने के लिए एक लेंस-पैरामीट्रिक ढांचे को पेश करता है, जो उन्हें एक कारण मध्यवर्ती प्रतिनिधित्व (causal intermediate representation) में संकलित करता है, समवर्तीता (concurrency) को संभालने के लिए कैनोनिकलाइजेशन (canonicalization) और आंशिक-क्रम न्यूनीकरण (partial-order reduction) लागू करता है, और साक्ष्य के साथ साउंड वर्डिक्ट (sound verdicts) प्रदान करने के लिए SMT-आधारित परिशोधन (SMT-based refinement) का उपयोग करता है, जिससे स्वचालित ग्रेडिंग और मरम्मत में सिंटैक्टिक डिफरेंसिंग (syntactic differencing) और सिंगल-रन डायनेमिक एनालिसिस (single-run dynamic analysis) की सीमाओं को दूर किया जा सके।

Yuan Si, Jialu Zhang2026-06-16
🤖 AI

Graphical-Probabilistic Modeling of Generative Flows in LLM-Native Software Systems

यह शोध पत्र "जेनरेशन नेटवर्क्स" का प्रस्ताव करता है, जो ग्राफिकल प्रोबेबिलिस्टिक मॉडल्स पर आधारित एक फ्रेमवर्क है, ताकि LLM-नेटिव सॉफ्टवेयर सिस्टम में निहित स्टोकेस्टिक और प्रॉम्प्ट-डिपेंडेंट व्यवहारों के लिए सिद्धांत-आधारित डिज़ाइन-स्तरीय तर्क और विश्लेषण पेश किया जा सके।

Víctor A. Braberman, Flavia Bonomo-Braberman2026-06-16
🤖 AI

Green SARC: Predictive Cost and Carbon Governance for Agentic AI Systems

यह शोध पत्र ग्रीन SARC (Green SARC) को प्रस्तुत करता है, जो एक आर्किटेक्चरल गवर्नेंस फ्रेमवर्क है जो बजट उल्लंघन को रोकने और टोकन, वित्तीय एवं कार्बन की महत्वपूर्ण बचत प्राप्त करने के लिए प्रेडिक्टिव कॉस्ट और कार्बन कंट्रोल्स को सीधे एजेंटिक एआई लूप्स (agentic AI loops) में समाहित करता है, जो पोस्ट-एग्जीक्यूशन मॉनिटरिंग और सॉफ्ट पेनल्टी विधियों के विरुद्ध इसकी श्रेष्ठ विश्वसनीयता को दर्शाता है।

Gaston Besanson2026-06-16
🤖 AI

Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents

यह शोध पत्र Open-SWE-Traces को प्रस्तुत करता है, जो वास्तविक दुनिया के पुल रिक्वेस्ट (pull requests) से प्राप्त 207,489 सॉफ्टवेयर इंजीनियरिंग एजेंट प्रक्षेपवक्रों (trajectories) का एक बड़े पैमाने का, बहुभाषी डेटासेट है, जो विविध SWE-bench मूल्यांकनों पर अत्याधुनिक परिणाम प्राप्त करने में सक्षम उच्च-प्रदर्शन वाले, ओपन-सोर्स मॉडलों के डिस्टिलेशन (distillation) को सक्षम बनाता है।

Wasi Uddin Ahmad, Nikolai Ludwig, Somshubra Majumdar, Boris Ginsburg2026-06-16
💻 computer science

Binary Decompilation LLM with Feedback-Driven Multi-Turn Refinement

यह शोध पत्र AutoDecompiler को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) आधारित LLM है जो संकलन (compilation), निष्पादन (execution) और अर्थपूर्ण निरंतरता (semantic consistency) पुरस्कारों द्वारा निर्देशित एक पुनरावृत्ति, फीडबैक-संचालित परिशोधन प्रक्रिया में कार्य को परिवर्तित करके बाइनरी डिकंपाइलेशन की कार्यात्मक शुद्धता में सुधार करता है।

Peipei Liu, Jian Sun, Mingzhe Xing, Yicheng Zeng, Zhaoteng Yan, Lixiao Zhang, Li Chen, Dan Li2026-06-16
🤖 AI

AI Supply Chain Galaxy: 3D Visual Analytics for License Compliance

यह शोध पत्र AI सप्लाई चेन गैलेक्सी (AISCG) को प्रस्तुत करता है, जो एक इंटरैक्टिव 3D विजुअल एनालिटिक्स सिस्टम है जो लाइसेंस अनुपालन ऑडिटिंग को सुव्यवस्थित करने के लिए जटिल मॉडल निर्भरताओं को मैप करता है, जिससे यह पता चलता है कि विश्लेषण किए गए 908,449 हगिंग फेस मॉडल्स में से आधे से अधिक महत्वपूर्ण अनुपालन जोखिम या मेटाडेटा संबंधी समस्याओं का प्रदर्शन करते हैं।

Weiru Han, Xuetao Shi, Wenyi He, Wei Wang, Rui Zhao, Moming Duan2026-06-16
💻 computer science

No Resource, No Benchmarks, No Problem? Evaluating and Improving LLMs for Code Generation in No-Resource Languages

यह शोध पत्र लक्षित भाषा डेटा पर एक बेस मॉडल के निरंतर प्री-ट्रेनिंग (further pre-training) और उसके बाद वेट डिफ ट्रांसफर (weight diff transfer) के माध्यम से इंस्ट्रक्शन-फॉलोइंग क्षमताओं को इंजेक्ट करने की एक लागत प्रभावी रणनीति को पेश करके, शून्य-संसाधन वाली प्रोग्रामिंग भाषाओं में कोड जनरेशन की चुनौती को संबोधित करता है, जो कि इंस्ट्रक्शन-ट्यून्ड मॉडल्स के सीधे फाइन-ट्यूनिंग की तुलना में काफी बेहतर प्रदर्शन करती है।

Alessandro Giagnorio, Alberto Martin-Lopez, Gabriele Bavota2026-06-16
🤖 AI

Beyond Models: Reflections on Engineering AI-enabled Systems in a Project-Based Course

यह शोध पत्र ब्रेमेन विश्वविद्यालय के एक प्रोजेक्ट-आधारित मास्टर पाठ्यक्रम पर विचार करता है जो छात्रों को पूर्ण-स्तरीय सॉफ्टवेयर आर्किटेक्चर में एआई घटकों को एकीकृत करना सिखाता है, और आर्किटेक्चरल डिज़ाइन और डेटा प्रबंधन में बनी रहने वाली चुनौतियों को उजागर करने के लिए एक मिश्रित-पद्धति अध्ययन का उपयोग करते हुए सिस्टम-स्तरीय तर्क और डेटा-केंद्रित प्रथाओं को बढ़ावा देने में पाठ्यक्रम की सफलता को प्रदर्शित करता है।

Amir Mashmool, Kishan Ravindra Sawant, Mojtaba Shahin, Nico Hochgeschwender, Rainer Koschke2026-06-16