💻 computer science

WuppieFuzz: Coverage-Guided, Stateful REST API Fuzzing

यह शोध पत्र WuppieFuzz को प्रस्तुत करता है, जो LibAFL पर निर्मित एक ओपन-सोर्स, कवरेज-गाइडेड, स्टेटफुल REST API फज़र है जो हारनेस निर्माण को स्वचालित करता है और प्रभावी भेद्यता खोज (vulnerability discovery) के लिए अनुरोध अनुक्रमों (request sequences) को उत्पन्न करने और उन्हें उत्परिवर्तित (mutate) करने के लिए OpenAPI विनिर्देशों का उपयोग करता है।

Thomas Rooijakkers, Anne Nijsten, Cristian Daniele, Erieke Weitenberg, Ringo Groenewegen, Arthur Melissen2026-03-26
💻 computer science

HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation

यह शोध पत्र HalluJudge को प्रस्तुत करता है, जो एक संदर्भ-मुक्त (reference-free) ढांचा है जो मल्टी-स्ट्रेटजी रीजनिंग के माध्यम से संदर्भ संरेखण (context alignment) का आकलन करके LLM-जनित कोड समीक्षा टिप्पणियों में मतिभ्रम (hallucinations) का प्रभावी ढंग से पता लगाता है, जिससे वास्तविक उत्पादन वातावरण में डेवलपर प्राथमिकताओं के साथ निकटता से संरेखित होते हुए उच्च सटीकता और लागत-दक्षता प्राप्त होती है।

Kla Tantithamthavorn, Hong Yi Lin, Patanamon Thongtanunam, Wachiraphan Charoenwet, Minwoo Jeong, Ming Wu2026-03-26
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

यह शोध पत्र Agent-Diff को प्रस्तुत करता है, जो एक नवीन बेंचमार्किंग फ्रेमवर्क है जो कंटेनरीकृत (containerized) API सैंडबॉक्स के साथ स्टेट-डिफ़ (state-diff) आधारित मूल्यांकन मीट्रिक को जोड़कर वास्तविक दुनिया के एंटरप्राइज API कार्यों पर एजेंटिक LLMs का मूल्यांकन करता है, ताकि ट्रेस मिलान (trace matching) के बजाय पर्यावरणीय अवस्था परिवर्तनों के माध्यम से कार्य की सफलता का आकलन किया जा सके।

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson2026-03-26
💻 computer science

LLMORPH: Automated Metamorphic Testing of Large Language Models

यह शोध पत्र LLMORPH को प्रस्तुत करता है, जो एक स्वचालित मेटाबॉर्फिक टेस्टिंग टूल है जो मानव-लेबल वाले डेटा पर निर्भर रहे बिना आउटपुट की विसंगतियों का पता लगाने के लिए मेटाबॉर्फिक रिलेशंस के माध्यम से फॉलो-अप इनपुट्स उत्पन्न करके विभिन्न NLP कार्यों में लार्ज लैंग्वेज मॉडल्स की मजबूती का मूल्यांकन करता है।

Steven Cho, Stefano Ruberto, Valerio Terragni2026-03-26
💻 computer science

LLMLOOP: Improving LLM-Generated Code and Tests through Automated Iterative Feedback Loops

यह शोध पत्र LLMLOOP को प्रस्तुत करता है, जो एक स्वचालित फ्रेमवर्क है जो संकलन त्रुटियों (compilation errors), स्टैटिक एनालिसिस संबंधी समस्याओं और टेस्ट विफलताओं को हल करने के लिए पांच फीडबैक लूप के माध्यम से LLM-जनित कोड और टेस्ट केस को पुनरावृत्ति से परिष्कृत करता है, जिससे HUMANEVAL-X बेंचमार्क पर प्रदर्शित आउटपुट की गुणवत्ता में उल्लेखनीय सुधार होता है।

Ravin Ravi, Dylan Bradshaw, Stefano Ruberto, Gunel Jahangirova, Valerio Terragni2026-03-26
💻 computer science

Willful Disobedience: Automatically Detecting Failures in Agentic Traces

यह शोध पत्र AgentPex को प्रस्तुत करता है, जो एक AI-संचालित टूल है जो प्रॉम्प्ट्स से व्यवहार संबंधी नियमों को निकालकर एजेंटिक ट्रेसेस (agentic traces) में प्रक्रियात्मक विफलताओं और विनिर्देश उल्लंघनों का स्वचालित रूप से पता लगाता है, जिससे जटिल एजेंट वर्कफ़्लो को मान्य करने में केवल परिणाम-आधारित बेंचमार्क की सीमाओं को दूर किया जा सके।

Reshabh K Sharma, Shraddha Barke, Benjamin Zorn2026-03-26
🤖 machine learning

Praxium: Diagnosing Cloud Anomalies with AI-based Telemetry and Dependency Analysis

यह शोध पत्र प्रैक्सियम (Praxium) का परिचय देता है, जो एक एआई-संचालित ढांचा है जो क्लाउड विसंगतियों को स्वचालित रूप से पहचानने और हालिया सॉफ्टवेयर रोलआउट से संबंधित उनके मूल कारणों का अनुमान लगाने के लिए टेलीमेट्री मॉनिटरिंग को डिपेंडेंसी विश्लेषण के साथ जोड़ता है, जो व्यापक परीक्षणों में डिटेक्शन और कॉज़ल इन्फरेंस (कारण अनुमान) दोनों में उच्च सटीकता प्रदर्शित करता है।

Rohan Kumar, Jason Li, Zongshun Zhang, Syed Mohammad Qasim, Gianluca Stringhini, Ayse Kivilcim Coskun2026-03-26
💻 computer science

Towards Energy-aware Requirements Dependency Classification: Knowledge-Graph vs. Vector-Retrieval Augmented Inference with SLMs

यह शोध पत्र एक ऊर्जा-जागरूक ढांचे का प्रस्ताव और अनुभवजन्य मूल्यांकन करता है जो सॉफ्टवेयर आवश्यकताओं के संघर्षों का पता लगाने में लघु भाषा मॉडलों (7B–8B) की स्थिरता और सटीकता को बढ़ाने के लिए नॉलेज ग्राफ-आधारित और वेक्टर-आधारित पुनर्प्राप्ति विधियों की तुलना करता है।

Shreyas Patil, Pragati Kumari, Novarun Deb, Gouri Ginde2026-03-26
💻 computer science

Functional Requirements for Decentralized and Self-Sovereign Identities

यह शोध पत्र एक व्यवस्थित परिचालन पद्धति के माध्यम से कार्यात्मक आवश्यकताओं के एक व्यापक सेट को व्युत्पन्न करके विकेंद्रीकृत और स्व-संप्रभु पहचान प्रणालियों के लिए पुनरुत्पादक मूल्यांकन विधियों की कमी को संबोधित करता है, जिससे भविष्य के सिस्टम विकास और मूल्यांकन के लिए एक आधारभूत कदम स्थापित होता है।

Daria Schumm, Burkhard Stiller2026-03-26
💻 computer science

Software Supply Chain Smells: Lightweight Analysis for Secure Dependency Management

यह शोध पत्र संरचनात्मक जोखिम संकेतकों के रूप में सॉफ्टवेयर सप्लाई चेन स्मैल्स (software supply chain smells) की अवधारणा प्रस्तुत करता है और डर्टी-वॉटर्स (Dirty-Waters) को प्रस्तुत करता है, जो डेवलपर्स को उनके डिपेंडेंसी मैनेजमेंट में सुरक्षा संबंधी कमजोरियों को पहचानने और उन्हें कम करने में मदद करने के लिए मैवेन (Maven) और एनपीएम (NPM) इकोसिस्टम के मात्रात्मक अध्ययन और अभ्यासकर्ता साक्षात्कारों के माध्यम से मान्य किया गया एक टूल है।

Larissa Schmid, Diogo Gaspar, Raphina Liu, Sofia Bobadilla, Benoit Baudry, Martin Monperrus2026-03-26