🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

यह शोध पत्र NAICS-GH प्रस्तुत करता है, जो 6,588 GitHub रिपॉजिटरी का एक उच्च-परिशुद्धता, सार्वजनिक रूप से जारी कॉर्पस है जिसे BAAI/bge-large-en एम्बेडिंग्स और GPT-4.1 को संयोजित करने वाले एक 'रिट्रीव-एंड-वेरिफाई' पाइपलाइन का उपयोग करके NAICS 2022 उद्योग क्षेत्रों के साथ लेबल किया गया है, जो 96.98% मानव-सत्यापित परिशुद्धता प्राप्त करता है और ओपन-सोर्स नवाचार अनुसंधान में उद्योग वर्गीकरण के लिए एक बेंचमार्क के रूप में कार्य करता है।

Kevin Xu, Alexander Quispe2026-07-08
💻 computer science

Towards Automated Identification of Violation Symptoms of Architecture Erosion

यह शोध पत्र पारंपरिक मशीन लर्निंग, डीप लर्निंग और लार्ज लैंग्वेज मॉडल्स की तुलना करके कोड समीक्षाओं में आर्किटेक्चर इरोजन उल्लंघन के लक्षणों की पहचान करने के लिए एक स्वचालित दृष्टिकोण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एलएलएम-आधारित क्लासिफायर अन्य की तुलना में बेहतर प्रदर्शन करते हैं और एक नियंत्रित प्रयोग में डेवलपर्स की पहचान दरों में महत्वपूर्ण सुधार करते हैं।

Ruiyin Li, Peng Liang, Paris Avgeriou, Yifei Wang2026-07-07
🤖 machine learning

Towards Trustworthy AI Software Development Assistance

यह शोध पत्र विश्वसनीय एआई सॉफ्टवेयर विकास सहायकों के लिए एक समग्र आर्किटेक्चर प्रस्तावित करता है जो वास्तविक दुनिया के परिदृश्यों पर प्रशिक्षित एक मौलिक एलएलएम (LLM) को ग्राफ-आधारित कोड निरूपणों, एक अद्यतित ज्ञान ग्राफ और एक सुव्यवस्थित बाधा-आधारित डिकोडिंग ढांचे के साथ एकीकृत करता है ताकि सही, सुरक्षित और उच्च गुणवत्ता वाले कोड का सृजन सुनिश्चित किया जा सके।

Daniel Maninger, Krishna Narasimhan, Mira Mezini2026-07-07
🤖 AI

Evaluating LLM-Based Regression Test Generation

यह शोध पत्र Cleverest प्रस्तुत करता है, जो एक फीडबैक-निर्देशित, ज़ीरो-शॉट LLM फ्रेमवर्क है जो रिग्रेशन टेस्ट जनरेशन को मशीन ट्रांसलेशन के रूप में फ्रेम करता है ताकि कमिट संदेशों से प्रभावी टेस्ट केस तेजी से तैयार किए जा सकें, और यह पाता है कि यह दो मिनट से भी कम समय में उतने बग्स ढूंढ लेता है जितने स्टेट-ऑफ-द-आर्ट फज़र्स 24 घंटों में ढूंढते हैं और जब इसे सीड कॉर्पस के रूप में उपयोग किया जाता है तो यह आगे के फज़िंग की प्रभावशीलता को महत्वपूर्ण रूप से बढ़ाता है।

Jing Liu, Seongmin Lee, Eleonora Losiouk, Marcel Böhme2026-07-07
💻 computer science

Foundation Models for Software Engineering of Cyber-Physical Systems: the Road Ahead

यह शोध पत्र एक भविष्योन्मुखी अनुसंधान रोडमैप प्रस्तुत करता है जो साइबर-फिजिकल सिस्टम्स सॉफ्टवेयर इंजीनियरिंग की अनूठी डेटा प्रोसेसिंग आवश्यकताओं को संबोधित करने के लिए केवल लार्ज लैंग्वेज मॉडल्स से परे विविध और मल्टीमॉडल फाउंडेशन मॉडल्स के उपयोग को विस्तारित करने का समर्थन करता है, साथ ही तकनीकी, आर्थिक और मानवीय आयामों में प्रमुख चुनौतियों और कार्रवाई योग्य अवसरों की पहचान करता है।

Chengjie Lu, Pablo Valle, Jiahui Wu, Erblin Isaku, Hassan Sartaj, Aitor Arrieta, Shaukat Ali2026-07-07
🤖 AI

EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention

EyeMulator एक मॉडल-अज्ञेय (model-agnostic) विधि है जो मानव आई-ट्रैकिंग डेटा को सिमेंटिक सैलिएंस (semantic salience) और गेज़-ट्रांज़िशन प्रायर्स (gaze-transition priors) में आसवित (distill) करके कोड लैंग्वेज मॉडल्स को बेहतर बनाती है ताकि टोकन-स्तरीय प्रशिक्षण लॉस को पुन: भारित (reweight) किया जा सके, जिसके परिणामस्वरूप विभिन्न मॉडल्स और कार्यों में निरंतर प्रदर्शन सुधार प्राप्त होता है।

Yifan Zhang, Chen Huang, Yueke Zhang, Jiahao Zhang, Toby Jia-Jun Li, Collin McMillan, Kevin Leach, Yu Huang2026-07-07
💻 computer science

REConnect: Participatory RE for Social Sustainability

यह शोधपत्र REConnect को प्रस्तुत करता है, जो 26 सामुदायिक-जुड़े प्रोजेक्ट्स से व्युत्पन्न एक मानव-केंद्रित सहभागी आवश्यकता इंजीनियरिंग ढांचा (framework) है, जो सामाजिक स्थिरता सुनिश्चित करने और स्वचालित एवं AI-सहायता प्राप्त निष्कर्षण के जोखिमों के विरुद्ध मानवीय एजेंसी को संरक्षित करने के लिए विश्वास, सह-सृजन और उपयोगकर्ता सशक्तिकरण को प्राथमिकता देता है।

Daniela Damian, Bachan Ghimire, Ze Shi Li, Kezia Devathasan2026-07-07
🤖 machine learning

Benchmarking Web API Integration Code Generation

यह शोध पत्र WAPIIBench पेश करता है, जो एक ऐसा डेटासेट और मूल्यांकन पाइपलाइन है जो यह प्रकट करता है कि वर्तमान ओपन-सोर्स लार्ज लैंग्वेज मॉडल्स सही वेब API इंटीग्रेशन कोड जेनरेट करने में काफी संघर्ष करते हैं, जो हैलुसिनेटेड एंडपॉइंट्स और गलत आर्गुमेंट उपयोग जैसी समस्याओं के कारण 40% से भी कम सफलता प्राप्त करते हैं।

Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini2026-07-07
🤖 machine learning

Where Do LLMs Still Struggle? An In-Depth Analysis of Code Generation Benchmarks

यह शोध पत्र उन कार्यों की पहचान करने के लिए कोड जनरेशन बेंचमार्क का विश्लेषण करता है जहाँ लार्ज लैंग्वेज मॉडल्स लगातार विफल होते हैं, जो चार आवर्ती कमजोरी पैटर्न और सामान्य कार्य जटिलताओं को प्रकट करता है जो प्रदर्शन में बाधा डालते हैं।

Amir Molzam Sharifloo, Maedeh Heydari, Parsa Kazerooni, Daniel Maninger, Mira Mezini2026-07-07
💻 computer science

Securing High-Concurrency Ticket Sales: A Framework Based on Microservice

यह शोध पत्र एक स्प्रिंग क्लाउड माइक्रोसर्विस आर्किटेक्चर पर निर्मित एक सुरक्षित, उच्च-प्रदर्शन वाली रेलवे टिकटिंग प्रणाली प्रस्तुत करता है जो स्थिरता, डेटा निरंतरता और एक व्यापक ऑनलाइन बुकिंग अनुभव सुनिश्चित करते हुए पीक अवधि के दौरान उच्च-सहमति (हाई-कन्करेंसी) चुनौतियों को प्रभावी ढंग से संबोधित करता है।

Zhiyong Zhang, Xiaoyan Zhang, Xiaoqi Li2026-07-07