🤖 AI

Context-Augmented Code Generation: How Product Context Improves AI Coding Agent Decision Compliance by 49%

यह शोध पत्र एक नियंत्रित बेंचमार्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि एआई कोडिंग एजेंटों को एक प्रोडक्ट-कॉन्टेक्स्ट रिट्रीवल सिस्टम (Brief) के साथ संवर्धित करने से, केवल कोडबेस एक्सेस की तुलना में टीम-विशिष्ट प्रोडक्ट निर्णयों के प्रति उनकी अनुपालन क्षमता में 49 प्रतिशत अंकों का सुधार होता है, जिससे वास्तविक सॉफ्टवेयर इंजीनियरिंग कार्यों पर 95% अनुपालन प्राप्त होता है।

Drew Dillon, Kasyap Varanasi2026-05-12
🤖 AI

NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims

यह स्थिति पत्र (position paper) तर्क देता है कि न्यूरिप्स (NeurIPS) को फ्रंटियर एआई सुरक्षा दावों के लिए पुनरुत्पादकता मानकों को अनिवार्य करना चाहिए, जो वर्तमान "प्रमाणिक व्युत्क्रमण" (evidential inversion) को संबोधित करने के लिए एक तीन-स्तरीय प्रकटीकरण ढांचे का प्रस्ताव करता है जहाँ रोके गए आर्टिफैक्ट्स के कारण सबसे महत्वपूर्ण सुरक्षा दावे सबसे कम सत्यापन योग्य हैं।

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais2026-05-12
🤖 AI

Computer Use at the Edge of the Statistical Precipice

यह शोध पत्र गैर-सिद्धांतवादी परिवेश डिजाइन और कार्यप्रणाली के कारण वर्तमान कंप्यूटर उपयोग एजेंट मूल्यांकन में महत्वपूर्ण खामियों की पहचान करता है, और सार्थक अनुसंधान के लिए पूर्व शर्तें स्थापित करने हेतु PRISM डिजाइन ढांचे, DigiWorld बेंचमार्क और एक कठोर सांख्यिकीय एकत्रीकरण पद्धति का प्रस्ताव करता है।

Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tigh (…)2026-05-12
🤖 AI

Do not copy and paste! Rewriting strategies for code retrieval

यह शोध पत्र कोड रिट्रीवल (code retrieval) के लिए LLM-आधारित रीराइटिंग (rewriting) रणनीतियों के एक पदानुक्रम (hierarchy) को प्रस्तुत और मूल्यांकित करता है, जो यह प्रदर्शित करता है कि जबकि पूर्ण प्राकृतिक-भाषा क्वेरी-कॉर्पस रीराइटिंग हल्के एनकोडर्स (lightweight encoders) के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाती है, इसके लाभ संदर्भ-निर्भर होते हैं और इन्हें लागत-लाभ के संतुलन को अनुकूलित करने के लिए एक नए टोकन एंट्रॉपी मीट्रिक (Delta H) द्वारा पूर्वानुमानित किया जा सकता है।

Andrea Gurioli, Federico Pennino, Maurizio Gabbrielli2026-05-12
🤖 machine learning

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

यह शोध पत्र SWE Atlas प्रस्तुत करता है, जो एक नया बेंचमार्क सुइट है जिसे कोडबेस Q&A, टेस्ट राइटिंग और रिफैक्टरिंग जैसे कम प्रतिनिधित्व वाले पेशेवर वर्कफ़्लो पर कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो कार्यात्मक शुद्धता और सॉफ़्टवेयर इंजीनियरिंग गुणवत्ता दोनों का आकलन करके यह प्रकट करता है कि जबकि शीर्ष-स्तरीय मॉडल आगे हैं, एज केस (edge cases) को संभालने और सर्वोत्तम प्रथाओं का पालन करने में महत्वपूर्ण चुनौतियाँ बनी हुई हैं।

Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum (…)2026-05-12
🤖 AI

What Software Engineering Looks Like to AI Agents? -- An Empirical Study of AI-Only Technical Discourse on MoltBook

यह अनुभवजन्य अध्ययन MoltBook पर स्वायत्त तकनीकी विमर्श का विश्लेषण करता है, जो यह प्रकट करता है कि केवल AI-आधारित अंतःक्रियाएं सुरक्षा और विश्वास जैसे विषयों के इर्द-गिर्द अत्यधिक केंद्रित हैं, जबकि उनमें उन ठोस, संदर्भ-युक्त डिबगिंग विवरणों और पर्यावरणीय विशिष्टताओं का अभाव है जो GitHub पर मानव डेवलपर्स की चर्चाओं की विशेषता है।

Junyu Huo, Ziqi Mao, Zihao Wan, Gouri Ginde2026-05-12
🤖 AI

VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation

यह शोध पत्र VeriContest को प्रस्तुत करता है, जो Rust और Verus के साथ 946 प्रतिस्पर्धी प्रोग्रामिंग समस्याओं का एक व्यापक बेंचमार्क है जो प्राकृतिक भाषा विवरणों को विशेषज्ञ-सत्यापित औपचारिक विशिष्टताओं और मशीन-जांच योग्य प्रमाणों के साथ जोड़ता है, जो वर्तमान मॉडलों की कोडिंग क्षमताओं और उनकी सत्यापन योग्य कोड जनरेशन की क्षमता के बीच एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Zichen Xie, Mrigank Pawagi, Yuxin Liu, Aaditi Rai, Lize Shao, John Berberian Jr., Sicong Che, Wenxi Wang2026-05-12
🤖 machine learning

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

यह शोध पत्र 'स्केच-एंड-वेरिफाई' (Sketch-and-Verify) को पेश करता है, जो छोटे कोड मॉडलों के लिए एक लागत प्रभावी इन्फरेंस-टाइम स्केलिंग रणनीति है जो विविध एल्गोरिद्मिक स्केचेस को सूचीबद्ध करने और उन्हें कई उम्मीदवारों के साथ भरने के माध्यम से फ्लैट सैंपलिंग से बेहतर प्रदर्शन करती है, हालांकि यह मजबूत मॉडल स्तरों के प्रदर्शन को पूरी तरह से प्रतिस्थापित नहीं कर सकता है।

Shan Jiang, Zijian Yi, Chenguang Zhu2026-05-12
🤖 AI

Semantic Voting: Execution-Grounded Consensus for LLM Code Generation

यह शोध पत्र यह प्रदर्शित करता है कि एक पूर्ण ओरेकल (oracle) के बिना LLM कोड जनरेशन के लिए, निष्पादन-आधारित सर्वसम्मति (execution-based consensus) विधियाँ आउटपुट-पैटर्न वोटिंग की तुलना में काफी बेहतर प्रदर्शन करती हैं, जहाँ सफलता का प्राथमिक चालक प्रयुक्त विशिष्ट एकत्रीकरण नियम (aggregation rule) के बजाय उत्पन्न किए गए परीक्षण इनपुट (test inputs) की गुणवत्ता है।

Shan Jiang, Zijian Yi, Chenguang Zhu2026-05-12
🤖 AI

BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models

BoostAPR एक तीन-चरणीय ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग को निष्पादन-सत्यापित तर्क (execution-verified reasoning) और दोहरे रिवॉर्ड मॉडल के साथ जोड़कर स्वचालित प्रोग्राम रिपेयर को बढ़ाता है ताकि सुदृढीकरण शिक्षण (reinforcement learning) के दौरान सूक्ष्म, लाइन-स्तरीय क्रेडिट असाइनमेंट सक्षम किया जा सके, जिससे कई बेंचमार्क में अत्याधुनिक प्रदर्शन और मजबूत क्रॉस-लैंग्वेज सामान्यीकरण प्राप्त होता है।

Yuanhao Li, Hongbo Wang, Xiaotang Shang, Xunzhu Tang, Yiming Cao, Xuhong Chen2026-05-12