💻 computer science

Context Before Code: An Experience Report on Vibe Coding in Practice

यह अनुभव रिपोर्ट यह प्रदर्शित करती है कि जहाँ "वाइब कोडिंग" (vibe coding) उत्पादन प्रणालियों के लिए स्केफोल्डिंग (scaffolding) को गति प्रदान करती है, वहीं यह आइसोलेशन (isolation), सुरक्षा और विश्वसनीयता जैसी महत्वपूर्ण उत्पादन आवश्यकताओं की पूर्ति सुनिश्चित करने के लिए स्पष्ट बाधा विनिर्देशन (constraint specification) और स्थापत्य ऑडिटिंग (architectural auditing) की ओर इंजीनियरिंग प्रयास के एक रणनीतिक बदलाव की आवश्यकता को अनिवार्य बनाती है।

Md Nasir Uddin Shuvo, Md Aidul Islam, Md Mahade Hasan, Muhammad Waseem, Pekka Abrahamsson2026-03-13
💬 NLP

CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents

यह शोध पत्र CR-Bench, एक बेंचमार्किंग डेटासेट, और CR-Evaluator, एक सूक्ष्म-स्तरीय मूल्यांकन पाइपलाइन पेश करता है, ताकि कोड समीक्षा एजेंटों का आकलन किया जा सके और समस्या समाधान एवं भ्रामक निष्कर्षों के बीच उस महत्वपूर्ण समझौते को उजागर किया जा सके जो वर्तमान में उनकी वास्तविक उपयोगिता में बाधा डाल रहा है।

Kristen Pereira, Neelabh Sinha, Rajat Ghosh, Debojyoti Dutta2026-03-13
💻 computer science

Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining

यह शोध पत्र एक नवीन "पुनर्निर्माण द्वारा समझ" (understanding by reconstruction) प्रतिमान प्रस्तावित करता है जो स्थिर कोड रिपॉजिटरी से प्राप्त एजेंटिक प्रक्षेपवक्रों—जैसे कि योजना बनाना, तर्क करना और डिबगिंग चरणों—को संश्लेषित और अनुकूलित करके LLM प्रीट्रेनिंग को बढ़ाता है, जिससे जटिल सॉफ्टवेयर इंजीनियरिंग कार्यों में मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Zhiyuan Zeng, Yichi Zhang, Yong Shan, Kai Hua, Siyuan Fang, Zhaiyu Liu, Jiaheng Liu, Haozhe Wang, Yining Zheng, Ming Din (…)2026-03-13
💻 computer science

ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning

ExecVerify एक व्हाइट-बॉक्स सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का उपयोग करके छोटे भाषा मॉडलों में कोड निष्पादन तर्क (code execution reasoning) को बढ़ाता है, जो सत्यापन योग्य, चरण-दर-चरण निष्पादन पुरस्कारों और एक कठिनाई-नियंत्रित डेटासेट का उपयोग करता है ताकि बड़े मॉडलों से बेहतर प्रदर्शन किया जा सके और कोड जनरेशन प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Lingxiao Tang, He Ye, Zhaoyang Chu, Muyang Ye, Zhongxin Liu, Xiaoxue Ren, Lingfeng Bao2026-03-13
💻 computer science

Unveiling Practical Shortcomings of Patch Overfitting Detection Techniques

यह शोध पत्र एक व्यापक बेंचमार्किंग अध्ययन प्रस्तुत करता है जो यह प्रकट करता है कि वर्तमान पैच ओवरफिटिंग डिटेक्शन तकनीकें सीमित व्यावहारिक लाभ प्रदान करती हैं, क्योंकि सरल यादृच्छिक चयन (random selection) अक्सर उनसे बेहतर प्रदर्शन करता है, जिससे ऑटोमेटेड प्रोग्राम रिपेयर में नवीन दृष्टिकोणों और अधिक यथार्थवादी मूल्यांकन पद्धतियों की तत्काल आवश्यकता पर बल मिलता है।

David Williams, Ioakim Avraam, Aldeida Aleti, Matias Martinez, Justyna Petke, Federica Sarro2026-03-13
🤖 AI

Social, Legal, Ethical, Empathetic and Cultural Norm Operationalisation for AI Agents

यह शोध पत्र सामाजिक, कानूनी, नैतिक, सहानुभूतिपूर्ण और सांस्कृतिक (SLEEC) मानदंडों को एआई एजेंटों के लिए ठोस, सत्यापन योग्य आवश्यकताओं में क्रियान्वित करने हेतु एक व्यवस्थित ढांचे का प्रस्ताव करता है, साथ ही वर्तमान पद्धतियों का सर्वेक्षण करता है और उच्च-जोखिम वाले क्षेत्रों में अमूर्त मानदण्डों और व्यावहारिक कार्यान्वयन के बीच के अंतर को पाटने के लिए एक अनुसंधान एजेंडा की रूपरेखा तैयार करता है।

Radu Calinescu, Ana Cavalcanti, Marsha Chechik, Lina Marsso, Beverley Townsend2026-03-13
💻 computer science

QUARE: Multi-Agent Negotiation for Balancing Quality Attributes in Requirements Engineering

QUARE एक मल्टी-एजेंट फ्रेमवर्क है जो पांच गुणवत्ता-विशेषज्ञ एजेंटों के बीच एक द्वंद्वात्मक वार्ता प्रोटोकॉल (dialectical negotiation protocol) का उपयोग करके आवश्यकताओं की इंजीनियरिंग (requirements engineering) को स्वचालित करता है ताकि विरोधाभासी गुणवत्ता गुणों को व्यवस्थित रूप से हल किया जा सके, जिससे मौजूदा बेसलाइन की तुलना में बेहतर अनुपालन, अर्थपूर्ण संरक्षण और सत्यापन क्षमता प्राप्त होती है।

Haowei Cheng, Milhan Kim, Foutse Khomh, Teeradaj Racharak, Nobukazu Yoshioka, Naoyasu Ubayashi, Hironori Washizaki2026-03-13
🤖 AI

What Makes Code Generation Ethically Sourced?

यह शोध पत्र एथिकल और सस्टेनेबल प्रथाओं के माध्यम से कोड जनरेशन मॉडल्स के संपूर्ण जीवनचक्र को प्रबंधित करने के लिए एक फ्रेमवर्क के रूप में एथिकली सोर्स्ड कोड जनरेशन (ES-CodeGen) की नवीन अवधारणा प्रस्तुत करता है, जो एक व्यापक साहित्य समीक्षा और अभ्यावहारिक सर्वेक्षण के माध्यम से एक 11-आयामी वर्गीकरण स्थापित करता है और प्रमुख परिणामों की पहचान करता है।

Zhuolin Xu, Chenglin Li, Qiushi Li, Shin Hwei Tan2026-03-12
💻 computer science

One Model, Many Skills: Parameter-Efficient Fine-Tuning for Multitask Code Analysis

यह शोध पत्र मल्टीटास्क कोड विश्लेषण के लिए पैरामीटर-कुशल फाइन-ट्यूनिंग (PEFT) का पहला व्यापक मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक एकल साझा PEFT मॉड्यूल पूर्ण फाइन-ट्यूनिंग के प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन कर सकता है और साथ ही कम्प्यूटेशनल और स्टोरेज लागत को काफी कम कर सकता है, बशर्ते कि कार्यों को पूरकता और स्थिरता जैसे कारकों के आधार पर रणनीतिक रूप से समूहीकृत किया जाए।

Amal Akli, Maxime Cordy, Mike Papadakis, Yves Le Traon2026-03-12
🤖 AI

Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety

यह बड़े पैमाने का नियंत्रित अध्ययन प्रकट करता है कि मूल्यांकन प्रारूप (बहुविकल्पीय बनाम मुक्त-अंत) और विशिष्ट मॉडल-स्कैफोल्ड परस्पर क्रियाएं, न कि केवल स्कैफोल्ड आर्किटेक्चर, भाषा मॉडलों में मापी गई सुरक्षा अंतरों के प्राथमिक चालक हैं, जो अंततः यह प्रदर्शित करता है कि विभिन्न परिनियोजन विन्यासों के बीच कोई सार्वभौमिक सुरक्षा रैंकिंग मौजूद नहीं है।

David Gringras2026-03-12