💻 computer science

Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation

यह मिश्रित-पद्धति वाला अध्ययन प्रकट करता है कि जहाँ लिंग-आधारित प्रॉम्प्टिंग शैलियों के कोड जनरेशन की गुणवत्ता पर सूक्ष्म प्रभाव होते हैं, वहीं वे एलएलएम-आधारित (LLM-based) कोड समीक्षा में व्यवस्थित पूर्वाग्रह उत्पन्न करते हैं, जहाँ मॉडल समान तकनीकी योग्यता के बावजूद महिला-लिखित प्रॉम्प्ट से जुड़े कोड को असमान रूप से अधिक स्वीकृति देते हैं।

Lynn Janzen, Üveys Eroglu, Dorothea Kolossa, Pia Knöferle, Sebastian Möller, Vera Schmitt, Veronika Solopova2026-03-26
🤖 machine learning

Composer 2 Technical Report

कंपोज़र 2 (Composer 2) एक फ्रंटियर-स्तर का एजेंटिक सॉफ्टवेयर इंजीनियरिंग मॉडल है जो एक वास्तविक दुनिया के कर्सर (Cursor) वातावरण के भीतर निरंतर प्रीट्रेनिंग और बड़े पैमाने पर सुदृढीकरण लर्निंग (reinforcement learning) की दो-चरणीय प्रशिक्षण प्रक्रिया के माध्यम से SWE-bench Multilingual और Terminal-Bench जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Cursor Reseach, :, Aaron Chan, Ahmed Shalaby, Alexander Wettig, Aman Sanger, Andrew Zhai, Anurag Ajay, Ashvin Nair, Cha (…)2026-03-26
💻 computer science

Boosting LLMs for Mutation Generation

यह शोध पत्र SMART का परिचय देता है, जो एक नवीन फ्रेमवर्क है जो रिट्रीवल-ऑगमेंटेड जनरेशन (retrieval-augmented generation), फोकस्ड कोड चंकिंग (focused code chunking) और वास्तविक दुनिया के बग्स पर सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) को एकीकृत करके LLM-आधारित म्यूटेशन टेस्टिंग को उन्नत करता है, जिससे अत्याधुनिक दृष्टिकोणों की तुलना में म्यूटेशन वैधता, प्रभावशीलता और फॉल्ट लोकलाइजेशन क्षमताओं में महत्वपूर्ण सुधार होता है।

Bo Wang, Ming Deng, Mingda Chen, Chengran Yang, Youfang Lin, Mark Harman, Mike Papadakis, Jie M. Zhang2026-03-26
💬 NLP

Comparing Developer and LLM Biases in Code Evaluation

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो तीन मोडैलिटीज़ में कोड मूल्यांकन के दौरान LLM जजों और मानव डेवलपर्स के बीच महत्वपूर्ण मिसअलाइनमेंट (असमानता) को प्रकट करता है, यह दर्शाते हुए कि सबसे अच्छे मॉडल भी अधिकांश मौजूदा कोड गुणवत्ता आयामों पर मनुष्यों से 12-23% पीछे रह जाते हैं और लंबी व्याख्याओं को प्राथमिकता देने जैसे व्यवस्थित पूर्वाग्रह प्रदर्शित करते हैं।

Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Che (…)2026-03-26
💻 computer science

Smart Contract Vulnerabilities, Tools, and Benchmarks: an Updated Systematic Literature Review

यह शोध पत्र 222 उच्च-गुणवत्ता वाले अध्ययनों की एक अद्यतित व्यवस्थित साहित्य समीक्षा प्रस्तुत करता है जो 192 एथेरियम स्मार्ट कॉन्ट्रैक्ट कमजोरियों का एक पदानुक्रमित वर्गीकरण स्थापित करता है, 219 डिटेक्शन टूल्स को सूचीबद्ध करता है, और वर्तमान स्वचालित सुरक्षा समाधानों की स्थिति का मूल्यांकन करने तथा भविष्य के अनुसंधान को मार्गदर्शन देने के लिए 133 बेंचमार्क संकलित करता है।

Gerardo Iuliano, Dario Di Nucci2026-03-25
💻 computer science

Towards Industrial-scale Product Configuration

यह शोध पत्र COOM भाषा में तैयार किए गए उत्पाद विन्यास बेंचमार्क और बाइक मॉडल उदाहरणों के एक व्यापक संग्रह, साथ ही एक अनुकूलन योग्य ASP-आधारित वर्कफ़्लो के साथ COOM सुइट को प्रस्तुत करता है, ताकि औद्योगिक-स्तर की उत्पाद विन्यास की चुनौतियों का समाधान किया जा सके और हितधारकों के लिए एक साझा आधार प्रदान किया जा सके।

Joachim Baumeister (denkbares, Würzburg, Germany, University of Würzburg, Germany), Susana Hahn (University of Potsdam (…)2026-03-25
🤖 AI

From Context to Intent: Reasoning-Guided Function-Level Code Completion

यह शोध पत्र एक तर्क-निर्देशित ढांचे (reasoning-guided framework) का प्रस्ताव करता है जो डॉकस्ट्रिंग्स (docstrings) की अनुपस्थिति में फंक्शन-स्तर के कोड पूर्णता (function-level code completion) को बढ़ाता है, जो बड़े भाषा मॉडल (Large Language Models) को चरण-दर-चरण तर्क के माध्यम से निहित कोड संदर्भ से डेवलपर के इरादे का अनुमान लगाने के लिए प्रशिक्षित करता है, जिसे एक नए 40k-उदाहरणों वाले डेटासेट और मानव फीडबैक के लिए एक संवादात्मक प्लेटफॉर्म द्वारा समर्थित किया गया है।

Yanzhou Li, Tianlin Li, Yiran Zhang, Shangqing Liu, Aishan Liu, Xianglong Liu, Yang Liu2026-03-25
🤖 machine learning

TopoMap: A Feature-based Semantic Discriminator of the Topographical Regions in the Test Input Space

यह शोध पत्र TopoMap को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स, मॉडल-अज्ञेय (model-agnostic) फ्रेमवर्क है जो आयामी कमी (dimensionality reduction) और क्लस्टरिंग के माध्यम से इनपुट फीचर स्पेस का एक टोपोग्राफिकल मैप बनाता है ताकि इनपुट्स को साझा विफलता-प्रेरित विशेषताओं (failure-inducing features) द्वारा समूहित किया जा सके, जिससे रैंडम चयन की तुलना में म्यूटेशन विश्लेषण के लिए टेस्ट केस के अधिक प्रभावी चयन को सक्षम बनाया जा सके।

Gianmarco De Vita, Nargiz Humbatova, Paolo Tonella2026-03-25
💻 computer science

Evaluating Language Model Applications for Identifying Solution-Related Content in Issue Report Discussions

यह शोध पत्र प्रदर्शित करता है कि फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स, विशेष रूप से जब उन्हें एन्सेम्बल मेथड्स और क्रॉस-प्रोजेक्ट ट्रांसफर लर्निंग के साथ संयोजित किया जाता है, सॉफ्टवेयर इश्यू चर्चाओं में समाधान-संबंधी सामग्री की पहचान को प्रभावी ढंग से स्वचालित करते हैं, जो पारंपरिक मशीन लर्निंग और प्रॉम्प्टिंग दृष्टिकोणों से बेहतर प्रदर्शन करते हैं।

Antu Saha, Mehedi Sun, Oscar Chaparro2026-03-25
🤖 AI

AI-Generated Code Is Not Reproducible (Yet): An Empirical Study of Dependency Gaps in LLM-Based Coding Agents

यह अनुभवजन्य अध्ययन प्रकट करता है कि अत्याधुनिक एलएलएम (LLM) एजेंटों से उत्पन्न एआई-जनित कोड में वर्तमान में पूर्ण पुनरुत्पादकता का अभाव है, क्योंकि घोषित और वास्तविक रनटाइम निर्भरताओं के बीच महत्वपूर्ण अंतराल के कारण केवल 68.3% प्रोजेक्ट ही स्वच्छ वातावरण में सफलतापूर्वक निष्पादित होते हैं।

Bhanu Prakash Vangala, Ali Adibifar, Ashish Gehani, Tanu Malik2026-03-25