💬 NLP

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

यह शोध पत्र यह पहचान करता है कि सत्यापनकर्ताओं के साथ मानक शुद्धता-केंद्रित सुदृढीकरण शिक्षण (RLVR) से कोड जनरेशन में पुनरुक्ति (redundancy) होती है, और JPlag-आधारित एंटी-रिडंडेंसी रिवार्ड्स का उपयोग करने वाला एक रिडंडेंसी-अवेयर RLVR दृष्टिकोण प्रस्तावित करता है जो विविध कैंडिडेट समाधानों को बनाए रखकर सीमित-बजट वाले कोड जनरेशन प्रदर्शन में महत्वपूर्ण सुधार करता है।

Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne2026-05-28
🤖 AI

DeltaMCP: Incremental Regeneration via Spec-Aware Transformation for MCP servers

डेल्टाएमसीपी (DeltaMCP) एक स्पेसिफिकेशन-जागरूक टूल है जो ओपनएपीआई (OpenAPI) स्पेसिफिकेशन्स में बदलाव होने पर केवल प्रभावित घटकों को अपडेट करके एंटरप्राइज-ग्रेड एमसीपी (MCP) सर्वरों के क्रमिक पुनरुत्पादन (incremental regeneration) को सक्षम बनाता है, जिससे पूर्ण पुनरुत्पादन विधियों की तुलना में डेवलपर ओवरहेड कम होता है और रखरखाव में सुधार होता है।

Aditya Pujara, Xiaogang Zhu, Hsiang-Ting Chen2026-05-28
🤖 AI

Efficient and Scalable Provenance Tracking for LLM-Generated Code Snippets

यह शोध पत्र SOURCETRACKER और इसके हाइब्रिड टू-स्टेज पाइपलाइन, HYBRIDSOURCETRACKER को प्रस्तुत करता है, जो अरबों-पैमाने के कॉर्पोरा के भीतर संभावित प्रशिक्षण स्रोतों की कुशलतापूर्वक पहचान करने के लिए वेक्टर सर्च को क्लासिकल फिंगरप्रिंटिंग के साथ जोड़कर LLM-जनरेटेड कोड के लिए स्केलेबल, उच्च-परिशुद्धता वाली प्रोवेनेंस ट्रैकिंग को सक्षम बनाता है।

Andrea Gurioli, Davide D'Ascenzo, Federico Pennino, Maurizio Gabbrielli, Stefano Zacchiroli2026-05-28
🤖 AI

Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation

यह शोधपत्र \textsc{VIBench} को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि प्रदाता-संबद्ध (provider-affiliated) लार्ज लैंग्वेज मॉडल्स कोड जनरेशन में महत्वपूर्ण वर्टिकल इंटीग्रेशन बायस (Vertical Integration Bias) प्रदर्शित करते हैं, जो विकल्पों के बजाय अपने स्वयं के इकोसिस्टमों का पक्ष लेते हैं—एक ऐसी प्रवृत्ति जो डायरेक्ट जनरेशन में सांख्यिकीय रूप से महत्वपूर्ण है और एजेंटिक वर्कफ़्लो (agentic workflows) में काफी अधिक बढ़ जाती है।

Melih Catal, Alex Wolf, Tiago Ferreiro Matos, Pooja Rani, Harald Gall2026-05-28
💻 computer science

A Minimal Executable Proof for Multi-Language Contract Traceability

यह शोध पत्र एक न्यूनतम, विखंडनीय निष्पादन योग्य प्रमाण प्रस्तुत करता है जो यह प्रदर्शित करता है कि कैसे एक बहु-भाषा अनुबंध, कार्यान्वयन ग्राफ, ट्रैसेबिलिटी चेन और समीक्षा गेट को विभिन्न भाषाओं में छह "हेलो, वर्ल्ड!" कार्यक्रमों के माध्यम से मान्य किया जा सकता है, जिससे पांच सफल पास परिणाम और टूलिंग की कमी के कारण एक स्किप प्राप्त होता है।

Werner Kasselman2026-05-28
🤖 AI

PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts

यह शोध पत्र PoCo को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो प्राकृतिक भाषा में दी गई भेद्यता (vulnerability) विवरणों से स्वायत्त रूप से निष्पादन योग्य (executable) Foundry-संगत प्रूफ-ऑफ-कॉन्सेप्ट एक्सप्लॉइट्स उत्पन्न करता है, जिससे स्मार्ट कॉन्ट्रैक्ट सुरक्षा ऑडिट के लिए आवश्यक समय और प्रयास में काफी कमी आती है।

Vivi Andersson, Sofia Bobadilla, Harald Hobbelhagen, Martin Monperrus2026-05-27
🤖 AI

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

यह शोध पत्र RepoNavigator को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) आधारित LLM एजेंट है, जो सिंबल डेफिनिशन जंपिंग के लिए एक एकल निष्पादन-जागरूक (execution-aware) टूल का उपयोग करके रिपॉजिटरी-स्तरीय इश्यू लोकलाइजेशन में अत्याधुनिक प्रदर्शन प्राप्त करता है, जिससे मॉडल नियंत्रण सरल हो जाता है और यह बड़े बेसलाइन और क्लोज्ड-सोर्स मॉडल्स से बेहतर प्रदर्शन करता है।

Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizho (…)2026-05-27
🤖 machine learning

The Constraint Tax: Measuring Validity-Correctness Tradeoffs in Structured Outputs for Small Language Models

यह शोध पत्र "कन्स्ट्रेंट टैक्स" (constraint tax) को पेश करता है ताकि यह प्रदर्शित किया जा सके कि छोटे भाषा मॉडलों पर कठोर संरचित-आउटपुट बाधाओं को लागू करने से स्कीमा वैधता की गारंटी के बावजूद उनके उत्तर और निष्पादन योग्य सटीकता में काफी गिरावट आती है, जिससे इस धारणा को चुनौती मिलती है कि ऐसी बाधाएं तटस्थ होती हैं और वैधता एवं शुद्धता मेट्रिक्स के अलग-अलग रिपोर्टिंग की वकालत की जाती है।

Jaideep Ray2026-05-27
💻 computer science

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

यह शोधपत्र VISTA को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसे विज़ुअल विनिर्देशों (visual specifications) से एंड-टू-एंड वेब एप्लिकेशन जनरेशन पर LLM-आधारित एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो विविध प्रॉम्प्ट स्थितियों को परिभाषित करता है और एक बहुआयामी मूल्यांकन ढांचे का उपयोग करता है जो पारंपरिक स्क्रिप्ट-आधारित उपकरणों की सीमाओं को दूर करने के लिए DOM मिलान, व्यवहारिक परीक्षण और दृश्य समानता (visual similarity) को संयोजित करता है।

JunJia Guo (Joe), Yuhang Yao (Joe), Jiawei (Joe), Zhou, Jingdi Chen2026-05-27
💻 computer science

Augment Engineering: A Methodology for Multi-Tool AI Orchestration Across Professional Domains

यह शोध पत्र "ऑगमेंट इंजीनियरिंग" (Augment Engineering) को एक कार्यप्रणाली के रूप में प्रस्तुत करता है, जो प्रॉम्प्ट और कॉन्टेक्स्ट इंजीनियरिंग के पोर्टेबल मेटा-कौशल का लाभ उठाकर विविध व्यावसायिक क्षेत्रों में कई विशिष्ट उद्देश्य-निर्मित एआई (AI) उपकरणों को व्यवस्थित करने के लिए है, जिसे एक छह-चरणीय ढांचे और एक एकल-अभ्यासकर्ता केस स्टडी से प्राप्त प्रारंभिक अनुभवजन्य साक्ष्य द्वारा समर्थित किया गया है जो बढ़ी हुई दक्षता और गुणवत्ता को प्रदर्शित करता है।

Elias Calboreanu2026-05-27