🤖 AI

Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

यह शोध पत्र LLM सुरक्षा जजों के लिए एक महत्वपूर्ण विश्वसनीयता परीक्षण के रूप में "पॉलिसी इनवेरिएंस" (नीति अपरिवर्तनीयता) को प्रस्तुत करता है, जो एक नए स्ट्रेस-टेस्ट प्रोटोकॉल के माध्यम से यह प्रदर्शित करता है कि वर्तमान मूल्यांकनकर्ता अक्सर प्रॉम्प्ट की शब्दावली को एजेंट के व्यवहार के साथ मिला देते हैं, जो महत्वपूर्ण निर्णय अस्थिरता को प्रकट करता है और केवल सटीकता-आधारित बेंचमार्क के लिए अदृश्य विश्वसनीयता अंतराल को उजागर करने के लिए 'पॉलिसी इनवेरिएंस स्कोर' का प्रस्ताव देता है।

Shihao Weng, Yang Feng, Xiaofei Xie2026-05-08
🤖 machine learning

Teaching LLMs Program Semantics via Symbolic Execution Traces

यह शोध पत्र 500 C सत्यापन कार्यों के लिए एक नए मूल्यांकन ढांचे को प्रस्तुत करता है और यह प्रदर्शित करता है कि लगभग 3,000 सिम्बोलिक एक्जीक्यूशन ट्रेसेस (symbolic execution traces) के साथ चेन-ऑफ-थॉट रीजनिंग (chain-of-thought reasoning) पर एक Qwen3-8B मॉडल को प्रशिक्षित करने से विविध प्रकार के गुणों (property types) में उल्लंघन का पता लगाने और समग्र सटीकता में महत्वपूर्ण सुधार होता है, जो बड़े मॉडलों से बेहतर प्रदर्शन करता है और दोनों तकनीकों के बीच एक सुपर-एडिटिव सिनर्जी (superadditive synergy) को प्रकट करता है।

Jonas Bayer, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Michael Tautschnig, Soonho Kong2026-05-08
🤖 AI

Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions

यह बड़े पैमाने पर किया गया मापन अध्ययन प्रकट करता है कि एलएलएम (LLMs) द्वारा जनरेट किए गए पायथन कोड में विशिष्ट जोखिम भरी रिलीज़ के प्रति प्रणालीगत पूर्वाग्रहों के कारण, वे अक्सर असुरक्षित और असंगत थर्ड-पार्टी लाइब्रेरी वर्ज़न निर्दिष्ट करते हैं, जो एआई-सहायता प्राप्त सॉफ्टवेयर विकास में एक महत्वपूर्ण, पहले अनदेखे जोखिम सतह को उजागर करता है।

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao2026-05-08
🤖 AI

Search-Based Software Engineering and AI Foundation Models: Current Landscape and Future Roadmap

यह शोध पत्र फाउंडेशन मॉडल्स (FMs) के युग में सर्च-बेस्ड सॉफ्टवेयर इंजीनियरिंग (SBSE) के लिए एक अनुसंधान रोडमैप प्रस्तुत करता है, जो उनके वर्तमान परिदृश्य का विश्लेषण करता है, खुली चुनौतियों की पहचान करता है, और SBSE एवं FMs दोनों को उन्नत करने के लिए उनके सहक्रियात्मक एकीकरण हेतु भविष्य की दिशाओं को रेखांकित करता है।

Hassan Sartaj, Shaukat Ali, Paolo Arcaini, Andrea Arcuri2026-05-07
💻 computer science

Software Engineering for Self-Adaptive Robotics: A Research Agenda

यह शोध पत्र स्व-अनुकूलनशील रोबोटिक्स (self-adaptive robotics) में सॉफ्टवेयर इंजीनियरिंग के लिए एक अनुसंधान एजेंडा को रेखांकित करता है, जो 2030 तक विश्वसनीय स्वायत्त प्रणालियों को प्राप्त करने की दिशा में सत्यापन, सुरक्षा संबंधी समझौतों और फ्रेमवर्क एकीकरण की चुनौतियों को संबोधित करने के लिए सॉफ्टवेयर जीवनचक्र और सक्षम प्रौद्योगिकियों के इर्द-गिर्द संरचित है।

Hassan Sartaj, Shaukat Ali, Ana Cavalcanti, Lukas Esterle, Cláudio Gomes, Peter Gorm Larsen, Anastasios Tefas, Jim Woodc (…)2026-05-07
🔢 mathematics

Addressing Methodological Sensitivity in MCDM with a Systematic Pipeline Approach to Data Transformation Sensitivity Analysis

यह शोध पत्र विभिन्न सामान्यीकरण तकनीकों (normalization techniques) के प्रति बहु-मानदंड निर्णय लेने वाले (multicriteria decision-making) रैंकिंग की संवेदनशीलता का मूल्यांकन और मात्रा निर्धारित करने के लिए Scikit-Criteria का लाभ उठाने वाला एक व्यवस्थित, स्वचालित पाइपलाइन प्रस्तुत करता है, जो विधि चयन में वर्तमान मजबूती की कमी को संबोधित करता है।

Juan B. Cabral, Alvaro Roy Schachner2026-05-07
🤖 AI

In Line with Context: Repository-Level Code Generation via Context Inlining

यह योगदान InlineCoder को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो एक अधूरे फंक्शन के कॉल ग्राफ—जिसमें एक जनित एंकर, अपस्ट्रीम कॉलिंग फंक्शन्स और डाउनस्ट्रीम कॉल्ड फंक्शन्स शामिल हैं—को प्रॉम्प्ट में एकीकृत करके रिपॉजिटरी-स्तरीय कोड जनरेशन में सुधार करता है ताकि संपूर्ण रिपॉजिटरी की जटिल समझ को फंक्शन स्तर पर एक अधिक प्रबंधनीय कार्य में बदला जा सके।

Chao Hu, Wenhao Zeng, Yuling Shi, Beijun Shen, Xiaodong Gu2026-05-07
🤖 AI

Autoregressive, Yet Revisable: In Decoding Revision for Secure Code Generation

यह शोध पत्र "स्ट्रीम ऑफ रिवीज़न" (Stream of Revision) प्रस्तुत करता है, जो एक नवीन ढांचा है जो विशिष्ट एक्शन टोकन का उपयोग करके लार्ज लैंग्वेज मॉडल्स को एक ही फॉरवर्ड पास के भीतर अपने स्वयं के आउटपुट को गतिशील रूप से बैकट्रैक और संपादित करने में सक्षम बनाकर सुरक्षित कोड जनरेशन को बढ़ाता है, जिससे न्यूनतम इन्फरेंस ओवरहेड के साथ कमजोरियों को काफी कम किया जाता है।

Chengran Yang, Zichao Wei, Heminghao Deng, Jinfeng Jiang, Zhensu Sun, Ting Zhang, Tianyi Wu, Ming Wen, David Lo2026-05-07
🤖 AI

LCM: Lossless Context Management

यह शोध पत्र लॉसलेस कॉन्टेक्स्ट मैनेजमेंट (LCM) को प्रस्तुत करता है, जो एक नियतात्मक आर्किटेक्चर है जो रिकर्सिव कॉन्टेक्स्ट कंप्रेशन और टास्क पार्टीशनिंग के माध्यम से LLM मेमोरी को बढ़ाता है, जिससे वोल्ट एजेंट को 1 मिलियन टोकन तक के लॉन्ग-कॉन्टेक्स्ट कोडिंग कार्यों पर क्लॉड कोड (Claude Code) से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके, साथ ही लॉसलेस स्टेट रिट्रीवल और टर्मिनेशन की गारंटी भी दी जा सके।

Clint Ehrlich, Theodore Blackman2026-05-07
💻 computer science

TSCG: Deterministic Tool-Schema Compilation for Agentic LLM Deployments

TSCG एक नियत (deterministic), निर्भरता-मुक्त (dependency-free) टूल-स्कीमा कंपाइलर है जो अक्षम JSON स्कीमा को टोकन-कुशल संरचित टेक्स्ट में परिवर्तित करके उत्पादन परिवेशों (production environments) में छोटे और उन्नत LLMs के लिए टूल-उपयोग सटीकता में महत्वपूर्ण सुधार करता है, जिससे उस फॉर्मेट मिसमैच को हल किया जाता है जो वर्तमान में टूल-उपयोग की अधिकांश त्रुटियों का कारण बनता है।

Furkan Sakizli2026-05-07