💬 NLP

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing

यह शोध पत्र RACC (रिप्रजेंटेशन-अवेयर कवरेज क्राइटेरिया) प्रस्तुत करता है, जो LLM सुरक्षा परीक्षण के लिए एक स्केलेबल फ्रेमवर्क है जो टेस्ट सुइट की पर्याप्तता का मूल्यांकन करने और हमले के निर्माण (अटैक जनरेशन) को निर्देशित करने के लिए हिडन स्टेट्स से सुरक्षा-विशिष्ट रिप्रजेंटेशन्स निकालता है, जो पारंपरिक न्यूरॉन-स्तरीय कवरेज मानदंडों की सीमाओं को प्रभावी ढंग से दूर करता है।

Zeming Wei, Zhixin Zhang, Chengcan Wu, Yihao Zhang, Xiaokun Luan, Meng Sun2026-05-13
💻 computer science

Correct-by-Construction G-Code Generation: A Neuro-Symbolic Approach via Separation Logic

यह शोध पत्र एक न्यूरो-सिम्बोलिक ढांचे को प्रस्तुत करता है जो एक GLLM जनरेटर को सेपरेशन लॉजिक (Separation Logic) वेरीफायर के साथ एकीकृत करता है ताकि तार्किक प्रमाण विफलताओं (logical proof failures) को सटीक स्थानिक निर्देशों (spatial directives) में अनुवादित करके पुनरावृत्ति परिशोधन (iterative refinement) के माध्यम से G-कोड के स्व-सुधारात्मक, टकराव-मुक्त उत्पादन को सक्षम बनाया जा सके।

Yeonseok Lee2026-05-13✓ Author reviewed
💻 computer science

From Code-Centric to Intent-Centric Software Engineering: A Reflexive Thematic Analysis of Generative AI, Agentic Systems, and Engineering Accountability

यह शोध पत्र विविध तकनीकी और शैक्षणिक स्रोतों के रिफ्लेक्सिव थीमैटिक विश्लेषण (reflexive thematic analysis) का उपयोग करते हुए यह तर्क देता है कि जनरेटिव एआई और एजेंटिक सिस्टम सॉफ्टवेयर इंजीनियरिंग को एक कोड-केंद्रित अभ्यास से बदलकर एक इंटेंट-केंद्रित (intent-centric) अनुशासन में बदल रहे हैं, जहाँ मानवीय जवाबदेही छिपे हुए तकनीकी ऋण और जवाबदेही अंतराल जैसे जोखिमों को कम करने के लिए सामाजिक-तकनीकी प्रणालियों की निगरानी, सत्यापन और शासन की ओर स्थानांतरित हो रही है।

Elyson De La Cruz2026-05-13
💻 computer science

Read, Extract, Classify: A Tool for Smarter Requirements Engineering

यह शोध पत्र ReXCL को प्रस्तुत करता है, जो एक स्वचालित उपकरण है जो अर्ध-संरचित दस्तावेजों से डेटा निकालने और प्रेडिक्टिव मॉडलिंग एवं एडेप्टिव फाइन-ट्यूनिंग का उपयोग करके आवश्यकताओं को वर्गीकृत करके आवश्यकताओं के इंजीनियरिंग (requirements engineering) को बढ़ाता है, जिससे सॉफ्टवेयर विकास जीवन चक्र में दक्षता और सटीकता में महत्वपूर्ण सुधार होता है।

Paheli Bhattacharya, Manojit Chakraborty, Santhosh Kumar Arumugam, Rishabh Gupta2026-05-13
💻 computer science

Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

यह शोध पत्र GRIEF को प्रस्तुत करता है, जो एक ग्रेबॉक्स फज़र (greybox fuzzer) है जो कैश आइसोलेशन विफलताओं और प्रदर्शन हस्तक्षेप जैसी महत्वपूर्ण कमजोरियों को उजागर करने के लिए LLM सर्विंग सिस्टम की समवर्ती (concurrency) और स्टेट-मैनेजमेंट जटिलताओं को लक्षित करता है, जिसने vLLM और SGLang जैसे इंजनों में दो CVEs सहित 15 नई समस्याओं की सफलतापूर्वक पहचान की है।

Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek2026-05-13
🤖 machine learning

Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

यह शोध पत्र DuST प्रस्तुत करता है, जो एक सेल्फ-ट्रेनिंग फ्रेमवर्क है जो टेस्ट-टाइम सैंपलिंग का लाभ उठाकर एक "डुअल जजमेंट स्पेस" बनाता है जहाँ मॉडल ऑन-पॉलिसी रीइन्फोर्समेंट लर्निंग के माध्यम से कैंडिडेट प्रोग्राम्स को रैंक करना सीखते हैं, जिससे सही जनरेशन के लिए प्रत्यक्ष रिवार्ड्स के बिना भी कोड की शुद्धता को परखने और उच्च गुणवत्ता वाले समाधान उत्पन्न करने की उनकी क्षमता में सुधार होता है।

Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert, Yizhe Zhang2026-05-13
💻 computer science

Natural Language based Specification and Verification

यह शोध पत्र एक ऐसे नवीन दृष्टिकोण का प्रस्ताव करता है और प्रारंभिक रूप से उसे मान्य करता है जो प्राकृतिक भाषा विनिर्देशों (specifications) को उत्पन्न करने और कोड के कंपोजिशनल वेरिफिकेशन (compositional verification) करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसका लक्ष्य कठोर औपचारिक भाषाओं पर निर्भर हुए बिना असुरक्षित कार्यान्वयनों के उत्पादन को रोकना है।

Zhaorui Li, Chengyu Song2026-05-13
💻 computer science

NeuroFlake: A Neuro-Symbolic LLM Framework for Flaky Test Classification

न्यूरोफ्लेक (NeuroFlake) एक नवीन न्यूरो-सिम्बोलिक ढांचा है जो असंतुलित वास्तविक दुनिया के डेटासेट पर फ्लैकी टेस्ट वर्गीकरण को बढ़ाने के लिए एक डिस्क्रिमिनेटिव टोकन माइनिंग मॉड्यूल को एलएलएम (LLM) अटेंशन मैकेनिज्म में सांख्यिकीय रूप से महत्वपूर्ण कोड टोकन इंजेक्ट करने के लिए एकीकृत करता है, जिससे यह पूर्ववर्ती अत्याधुनिक विधियों की तुलना में बेहतर एफ1 (F1) स्कोर और एडवरसेरियल परटर्बेशन्स (adversarial perturbations) के विरुद्ध मजबूती प्राप्त करता है।

Khondaker Tasnia Hoque, Toukir Ahammed2026-05-13
🤖 AI

Decaf: Improving Neural Decompilation with Automatic Feedback and Search

यह शोध पत्र Decaf को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो कंपाइलर फीडबैक और सर्च का लाभ उठाकर न्यूरल डीकंपाइलेशन आउटपुट की सिमेंटिक शुद्धता (semantic correctness) में महत्वपूर्ण सुधार करता है, जिससे मूल सोर्स कोड के साथ समानता से समझौता किए बिना Real -O2 स्प्लिट पर सफलता दर 26.0% से बढ़कर 83.9% हो जाती है।

Alexander Shypula, Osbert Bastani, Edward Schwartz2026-05-13
🤖 AI

Cochise: A Reference Harness for Autonomous Penetration Testing

यह शोध पत्र कोचीज़ (Cochise) का परिचय देता है, जो कि स्वायत्त पेनिट्रेशन टेस्टिंग के लिए एक पृथक प्लानर-एक्जीक्यूटर (Planner-Executor) आर्किटेक्चर को लागू करने वाला एक न्यूनतम 597-लाइन का पायथन रेफरेंस हार्नेस है, जो शोधकर्ताओं को गेम ऑफ एक्टिव डायरेक्टरी (GOAD) टेस्टबेड के विरुद्ध LLM-संचालित एजेंटों का मूल्यांकन करने में सक्षम बनाता है और साथ ही रिप्ले, विश्लेषण और ट्राजेक्टरी डेटा साझा करने के लिए ओपन-सोर्स टूल्स प्रदान करता है।

Andreas Happe, Jürgen Cito2026-05-13