💬 NLP

Revisiting the Reliability of Language Models in Instruction-Following

यह शोध पत्र IFEval++ बेंचमार्क और reliable@k मीट्रिक को प्रस्तुत करता है जो यह प्रकट करता है कि जबकि उन्नत भाषा मॉडल मानक निर्देश-अनुपालन परीक्षणों पर उच्च स्कोर प्राप्त करते हैं, वे सूक्ष्म प्रॉम्प्ट बारीकियों का सामना करने पर महत्वपूर्ण नाजुकता और 61.8% तक की प्रदर्शन गिरावट प्रदर्शित करते हैं, जो वास्तविक दुनिया की विश्वसनीयता में एक महत्वपूर्ण अंतर को उजागर करता है।

Jianshuo Dong, Yutong Zhang, Yan Liu, Zhenyu Zhong, Tao Wei, Chao Zhang, Han Qiu2026-04-15
🤖 AI

From Junior to Senior: Allocating Agency and Navigating Professional Growth in Agentic AI-Mediated Software Engineering

जूनियर और सीनियर सॉफ्टवेयर इंजीनियरों की तुलना करने वाले एक मिश्रित-पद्धति अध्ययन के माध्यम से, यह शोध पत्र प्रकट करता है कि संगठनात्मक नीतियां, न कि व्यक्तिगत प्राथमिकताएं, एआई-मध्यस्थता वाले विकास में एजेंसी को मुख्य रूप से बाधित करती हैं, जो यह रेखांकित करता है कि अनुभवी डेवलपर्स प्रभावी ढंग से प्रतिनिधिमंडल करने और उन नौसिखियों को मेंटर करने के लिए अपने मौलिक सहज ज्ञान का लाभ उठाते हैं जो निर्भरता और सावधानी के बीच संतुलन बनाने में संघर्ष करते हैं।

Dana Feng, Bhada Yun, April Yi Wang2026-04-15
💻 computer science

BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations

BACE एक बेयसियन एंकोर्ड को-इवोल्यूशन (Bayesian Anchored Co-Evolution) फ्रेमवर्क पेश करता है जो जनरेट किए गए टेस्ट्स को एक पारस्परिक विश्वास-अपडेटिंग प्रक्रिया के भीतर शोर वाले संकेतों (noisy signals) के रूप में मानकर LLM-आधारित कोड जनरेशन में सुधार करता है, जिससे स्व-पुष्टि ड्रिफ्ट (self-validating drift) को रोका जा सकता है और यह LiveCodeBench v6 पर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Kaushitha Silva, Srinath Perera2026-04-15
💻 computer science

Building an Internal Coding Agent at Zup: Lessons and Open Questions

यह शोध पत्र ज़ुप (Zup) के आंतरिक कोडिंग एजेंट, कोडजेन (CodeGen) को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि टूल डिज़ाइन, सुरक्षात्मक बाधाओं (safety guardrails) और मानवीय निरीक्षण से जुड़े इंजीनियरिंग निर्णय, केवल मॉडल की गुणवत्ता की तुलना में प्रोडक्शन रेडीनेस और एडॉप्शन के लिए अधिक महत्वपूर्ण हैं।

Gustavo Pinto, Pedro Eduardo de Paula Naves, Ana Paula Camargo, Marselle Silva2026-04-15
💻 computer science

Fine-grained Multi-Document Extraction and Generation of Code Change Rationale

यह शोध पत्र ARGUS प्रस्तुत करता है, जो एक LLM-आधारित दृष्टिकोण है जो विखंडित कोड परिवर्तन तर्क (code change rationale) की चुनौती को संबोधित करता है, जो कई आर्टिफ़ेक्ट्स में तर्क घटकों के वितरण का अनुभवजन्य विश्लेषण करके और उन्हें सटीक, उपयोगी सारांशों में संश्लेषित करके सॉफ्टवेयर रखरखाव कार्यों में डेवलपर्स की सहायता करता है।

Mehedi Sun, Antu Saha, Nadeeshan De Silva, Antonio Mastropaolo, Oscar Chaparro2026-04-15
💻 computer science

SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents

SWE-Shepherd एक ऐसा फ्रेमवर्क है जो प्रोसेस रिवॉर्ड मॉडल्स को एकीकृत करके रिपॉजिटरी-लेवल कोड एजेंट्स को बेहतर बनाता है ताकि मध्यवर्ती कार्यों (intermediate actions) के मार्गदर्शन के लिए सघन, स्टेप-लेवल पर्यवेक्षण प्रदान किया जा सके, जिससे SWE-Bench Verified बेंचमार्क पर इंटरेक्शन दक्षता और निर्णय की गुणवत्ता में सुधार होता है।

Mahir Labib Dihan, Md Ashrafur Rahman Khan2026-04-15
💻 computer science

Rethinking Software Engineering for Agentic AI Systems

यह शोध पत्र तर्क देता है कि एआई-जनित कोड का प्रसार सॉफ्टवेयर इंजीनियरिंग में मैनुअल लेखकत्व से एक नए प्रतिमान में बदलाव को आवश्यक बनाता है, जो सिस्टम की विश्वसनीयता सुनिश्चित करने और इंजीनियर की भूमिका को उन्नत करने के लिए मल्टी-एजेंट सिस्टम के संचालन, एआई आउटपुट के कठोर सत्यापन, और संरचित मानव-एआई सहयोग को बढ़ावा देने पर केंद्रित है।

Mamdouh Alenezi2026-04-15
💻 computer science

Investigating CI/CD-based Technical Debt Management in Open-source Projects

यह अध्ययन 600,000 ट्रैविस सीआई (Travis CI) कॉन्फ़िगरेशन फ़ाइलों के बड़े पैमाने पर माइनिंग सॉफ़्टवेयर रिपॉजिटरी विश्लेषण के माध्यम से यह लक्षणित करता है कि तकनीकी ऋण प्रबंधन उपकरण (technical debt management tools) को सीआई/सीडी (CI/CD) पाइपलाइनों में कैसे एकीकृत किया जाता है, जिससे यह पता चलता है कि अधिकांश बाहरी स्क्रिप्ट्स पर निर्भर हैं और अक्सर "अनुपलब्ध फीडबैक" (Absent Feedback) कॉन्फ़िगरेशन एंटी-पैटर्न से ग्रस्त होते हैं।

João Paulo Biazotto, Daniel Feitosa, Paris Avgeriou, Elisa Yumi Nakagawa2026-04-15
💻 computer science

Engineering Students' Usage and Perceptions of GitHub Copilot in Open-Source Projects

यह शोध पत्र एक अन्वेषणात्मक सर्वेक्षण-आधारित अध्ययन प्रस्तुत करता है जो यह जांचता है कि इंजीनियरिंग के छात्र ओपन-सोर्स प्रोजेक्ट्स में योगदान देते समय GitHub Copilot की विभिन्न विशेषताओं का उपयोग और धारणा कैसे रखते हैं, जिससे यह प्रकट होता है कि उपयोग के पैटर्न और कथित उपयोगिता लिंग, प्रोग्रामिंग दक्षता और एआई (AI) के साथ पूर्व परिचितता से महत्वपूर्ण रूप से प्रभावित होते हैं।

Neha Rani, Jeevan Ram Munnangi, Austin Matthew Spangler, Donald Honeycutt2026-04-15
💻 computer science

Using Budgets to Reduce Application Emissions

यह शोध पत्र एक MAPE-K फीडबैक लूप के भीतर समय-बद्ध उत्सर्जन बजटों का उपयोग करके एप्लिकेशन संसाधन आवंटन को गतिशील रूप से प्रबंधित करने का प्रस्ताव देता है, जो सिमुलेशन के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण स्थिर वातावरण में प्रदर्शन बनाए रखते हुए, परिवर्तनशील कार्बन तीव्रता वाले ग्रिडों में पारंपरिक निश्चित-दर विधियों की तुलना में कार्य पूर्ति में महत्वपूर्ण सुधार करता है।

Leo Wilhelm Lierse, Mahyar Tourchi Moghaddam, Sebastian Werner2026-04-15