🤖 AI

Tricky2^2: Towards a Benchmark for Evaluating Human and LLM Error Interactions

यह शोध पत्र Tricky2^2 को प्रस्तुत करता है, जो कई प्रोग्रामिंग भाषाओं में मानव-लिखित दोषों को LLM-इंजेक्टेड त्रुटियों के साथ संवर्धित करने वाला एक हाइब्रिड डेटासेट है, ताकि यह अध्ययन किया जा सके कि मानव और मशीन-जनित बग कैसे परस्पर क्रिया करते हैं, जिससे हाइब्रिड सॉफ्टवेयर विकास वर्कफ़्लो में त्रुटि वर्गीकरण, स्थानीयकरण और मरम्मत के नए मूल्यांकन को सक्षम बनाया जा सके।

Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk2026-01-28
💻 computer science

Reward Engineering for Reinforcement Learning in Software Tasks

यह शोध पत्र सॉफ्टवेयर कार्यों के लिए सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) हेतु रिवॉर्ड इंजीनियरिंग का पहला व्यवस्थित और व्यापक सर्वेक्षण प्रस्तुत करता है, जो मौजूदा विधियों को तीन आयामों में व्यवस्थित करता है और भविष्य की चुनौतियों एवं सिफारिशों को रेखांकित करता है।

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez2026-01-28
💻 computer science

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

यह शोध पत्र अमेज़न के नोवा 2.0 लाइट (Nova 2.0 Lite) मॉडल का फ्रंटियर मॉडल सेफ्टी फ्रेमवर्क (Frontier Model Safety Framework) के विरुद्ध एक व्यापक मूल्यांकन प्रस्तुत करता है, जो स्वचालित बेंचमार्क, विशेषज्ञ रेड-टीमिंग और अपलिफ्ट अध्ययनों के संयोजन के माध्यम से CBRN, आक्रामक साइबर ऑपरेशंस और स्वचालित AI अनुसंधान एवं विकास (R&D) जैसे उच्च-जोखिम वाले क्षेत्रों में इसकी महत्वपूर्ण जोखिम प्रोफ़ाइल पर केंद्रित है।

Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spy (…)2026-01-28
💻 computer science

LLM-based Vulnerability Detection at Project Scale: An Empirical Study

यह शोध पत्र प्रोजेक्ट स्तर पर विशिष्ट LLM-आधारित भेद्यता डिटेक्टरों (vulnerability detectors) की पारंपरिक स्टैटिक एनालाइज़र के साथ तुलना करने वाला पहला व्यापक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि LLM अद्वितीय भेद्यताओं को उजागर कर सकते हैं, वे वर्तमान में कम रिकॉल, उच्च फॉल्स डिस्कवरी दर और अत्यधिक कम्प्यूटेशनल लागत से ग्रस्त हैं, जिससे उनकी व्यावहारिक सुदृढ़ता और स्केलेबिलिटी सीमित हो जाती है।

Fengjie Li, Jiajun Jiang, Dongchi Chen, Yingfei Xiong2026-01-28
💻 computer science

Understanding Dominant Themes in Reviewing Agentic AI-authored Code

यह शोध पत्र एजेंट-जनित पुल रिक्वेस्ट (pull requests) पर 19,450 कोड समीक्षा टिप्पणियों का एक बड़े पैमाने पर अनुभवजन्य अध्ययन प्रस्तुत करता है, जो LLMs द्वारा सत्यापित एक 12-थीम वर्गीकरण (taxonomy) पेश करता है ताकि यह प्रकट किया जा सके कि जहाँ AI एजेंट कोड उत्पादन में तेजी लाते हैं, वहीं मानव समीक्षक कार्यात्मक शुद्धता के बजाय मुख्य रूप से दस्तावेज़ीकरण, रिफैक्टरिंग और स्टाइलिंग पर ध्यान केंद्रित करते हैं।

Md. Asif Haider, Thomas Zimmermann2026-01-28
💻 computer science

Bridging the Socio-Emotional Gap: The Functional Dimension of Human-AI Collaboration for Software Engineering

यह अध्ययन प्रकट करता है कि सॉफ्टवेयर विशेषज्ञ मानव-एआई सहयोग में सामाजिक-भावनात्मक अंतराल को मानवीय भावनात्मक गुणों की नकल करने में एआई की विफलता के रूप में नहीं, बल्कि सहयोगात्मक क्षमताओं में एक कार्यात्मक कमी के रूप में देखते हैं, जो यह सुझाव देता है कि प्रभावी साझेदारी मानवीय सामाजिक-भावनात्मक बुद्धिमत्ता की नकल करने के बजाय तकनीकी "कार्यात्मक समकक्षों" के माध्यम से प्राप्त की जानी चाहिए।

Lekshmi Murali Rani, Richard Berntsson Svensson, Robert Feldt2026-01-28
💻 computer science

From Scattered to Structured: A Vision for Automating Architectural Knowledge Management

यह शोध पत्र विषम सॉफ्टवेयर आर्टिफैक्ट्स से बिखरे हुए आर्किटेक्चरल ज्ञान को एक संरचित, सुसंगत ज्ञान आधार में बदलने के लिए एक स्वचालित पाइपलाइन का प्रस्ताव करता है जो महत्वपूर्ण रखरखाव कार्यों और प्राकृतिक भाषा क्वेरीइंग का समर्थन करता है।

Jan Keim, Angelika Kaplan2026-01-28
💻 computer science

The Competence Crisis: A Design Fiction on AI-Assisted Research in Software Engineering

यह विजन पेपर डिज़ाइन फिक्शन (Design Fiction) का उपयोग करके बढ़ते प्रकाशन दबावों और जनरेटिव एआई (generative AI) उपकरणों के अनियंत्रित एकीकरण के कारण सॉफ्टवेयर इंजीनियरिंग में शोधकर्ता की सक्षमता, उत्तरदायित्व और विश्वास के संभावित क्षरण का अन्वेषण करता है, जो अंततः समुदाय को भविष्य के अनुसंधान परिदृश्य में दक्षता और जवाबदेही को महत्वपूर्ण रूप से पुनर्परिभाषित करने के लिए आमंत्रित करता है।

Mairieli Wessel, Daniel Feitosa, Sangeeth Kochanthara2026-01-28
💻 computer science

Who Said CVE? How Vulnerability Identifiers Are Mentioned by Humans, Bots, and Agents in Pull Requests

यह शोध पत्र गिटहब (GitHub) पुल रिक्वेस्ट में भेद्यता पहचानकर्ताओं (vulnerability identifiers) के उपयोग के पैटर्न का विश्लेषण करता है, जो यह प्रकट करता है कि जहाँ बॉट्स स्वचालित निर्भरता अपडेट के माध्यम से अधिकांश उल्लेख उत्पन्न करते हैं, वहीं मानव डेवलपर्स और स्वायत्त एजेंटों द्वारा फिक्स और चर्चाओं को समर्थन देने के लिए कम लेकिन अधिक प्रासंगिक रूप से विविध संदर्भ प्रदान किए जाते हैं।

Pien Rooijendijk, Christoph Treude, Mairieli Wessel2026-01-28