💻 computer science

VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

यह शोध पत्र VeriScale को प्रस्तुत करता है, जो एक एडवर्सरियल फ्रेमवर्क (adversarial framework) है जो अधिक कठोर बेंचमार्क जैसे कि VerinaPlus और VerinaLite बनाने के लिए टेस्ट सूट्स का विस्तार और डिस्टिलेशन करता है, जो अत्याधुनिक LLMs की कोड जनरेशन और स्पेसिफिकेशन क्षमताओं में महत्वपूर्ण कमजोरियों को उजागर करते हैं जिन्हें मौजूदा बेंचमार्क पकड़ने में विफल रहते हैं।

Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo2026-05-22
💻 computer science

Why Are Agentic Pull Requests Merged or Rejected? An Empirical Study

11,000 से अधिक एजेंटिक पुल रिक्वेस्ट (agentic pull requests) का यह अनुभवजन्य अध्ययन यह प्रकट करता है कि एआई कोडिंग एजेंटों का मूल्यांकन करने के लिए केवल मर्ज या रिजेक्शन परिणामों पर निर्भर रहना भ्रामक है, क्योंकि रिजेक्शन का एक महत्वपूर्ण हिस्सा एजेंट की त्रुटियों के बजाय वर्कफ़्लो बाधाओं से उत्पन्न होता है और कई मर्ज के लिए पर्याप्त मानवीय हस्तक्षेप की आवश्यकता होती है, जिससे समीक्षा व्यवहार पर आधारित इंटरैक्शन-अवेयर (interaction-aware) मूल्यांकन मेट्रिक्स की आवश्यकता अनिवार्य हो जाती है।

Sien Reeve O. Peralta, Fumika Hoshi, Hironori Washizaki, Naoyasu Ubayashi, Inase Kondo, Yoshiki Higo, Hiroki Mukai, Nori (…)2026-05-22
💬 NLP

SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

यह शोधपत्र SynAE को प्रस्तुत करता है, जो एक बहु-अक्षीय मूल्यांकन ढांचा (multi-axis evaluation framework) है जिसे कार्य निर्देशों, टूल कॉल्स, आउटपुट और डाउनस्ट्रीम प्रदर्शन का विश्लेषण करके टूल-कॉलिंग एजेंटों के लिए सिंथेटिक डेटासेट की वैधता, निष्ठा (fidelity) और विविधता का आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि सिंथेटिक डेटा की गुणवत्ता को स्पष्ट करने के लिए कोई भी एकल मीट्रिक पर्याप्त नहीं है।

Shuaiqi Wang, Aadyaa Maddi, Zinan Lin, Giulia Fanti2026-05-22
💻 computer science

Innovations in Cardless Artificial Intelligence Banking: A Comprehensive Framework for Cyber Secure and Fraud Mitigation using Machine Learning Algorithms

यह शोध पत्र कार्डलेस एआई बैंकिंग के लिए एक व्यापक ढांचे का प्रस्ताव करता है जो साइबर सुरक्षा को बढ़ाने, लेनदेन को प्रमाणित करने और धोखाधड़ी के जोखिमों को सक्रिय रूप से कम करने के लिए मशीन लर्निंग एल्गोरिदम, एआई-संचालित डेटा क्रिप्टोग्राफी और ऑटो-जेनरेटेड वर्चुअल कार्डों का लाभ उठाता है।

Md Israfeel2026-05-22✓ Author reviewed
💻 computer science

Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents

यह शोध पत्र "कॉन्ट्रैक्चुअल स्किल्स" (contractual skills) पेश करता है, जो एक GovernSpec-प्रेरित ढांचा है जो एंटरप्राइज एआई एजेंट निर्देशों को पठनीय कार्य अनुबंधों के रूप में व्यवस्थित करता है ताकि लक्ष्यों, सीमाओं और गुणवत्ता मानदंडों की निरीक्षण क्षमता को बढ़ाया जा सके, और प्रयोगों के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण एक स्टैंडअलोन सुरक्षा तंत्र के रूप में कार्य करने के बजाय शासन और रखरखाव क्षमता में सुधार करता है।

Ting Liu2026-05-22
💻 computer science

HarnessAPI: A Skill-First Framework for Unified Streaming APIs and MCP Tools

HarnessAPI एक पायथन फ्रेमवर्क है जो टाइप किए गए स्किल फोल्डर्स को सिंगल सोर्स ऑफ ट्रुथ मानकर कोड के दोहराव को समाप्त करता है ताकि एक सिंगल हैंडलर और पयडैन्टिक (Pydantic) स्कीमा से यूनिफाइड स्ट्रीमिंग HTTP एंडपॉइंट्स, इंटरैक्टिव ओपेनएपीआई (OpenAPI) डॉक्यूमेंटेशन और ज़ीरो-कॉन्फ़िगरेशन MCP टूल्स को स्वचालित रूप से जेनरेट किया जा सके।

Edwin Jose2026-05-22
💻 computer science

FAME: Failure-Aware Mixture-of-Experts for Message-Level Log Anomaly Detection

FAME एक लेबल-कुशल, मिश्रण-ऑफ़-एक्सपर्ट्स (mixture-of-experts) फ्रेमवर्क है जो विषम प्रणालियों (heterogeneous systems) में विफलताओं की प्रभावी ढंग से पहचान करते हुए, उच्च-सटीक, संदेश-स्तर के लॉग विसंगति का पता लगाने के लिए हल्के ऑन-प्रिमाइज़ मॉडलों को प्रशिक्षित करने हेतु एकल ऑफलाइन LLM एनोटेशन पास का लाभ उठाता है, जिससे एनोटेशन लागत में काफी कमी आती है।

Huanchi Wang, Zihang Huang, Yifang Tian, Kristina Dzeparoska, Hans-Arno Jacobsen, Alberto Leon-Garcia2026-05-22
🤖 AI

A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks

यह अध्ययन कोडेफोर्स (Codeforces) प्रोग्रामिंग कार्यों पर ChatGPT 03-mini और DeepSeek-R1 की तुलना करता है, जो यह प्रकट करता है कि जबकि दोनों मॉडल आसान समस्याओं पर समान प्रदर्शन करते हैं और कठिन समस्याओं पर संघर्ष करते हैं, ChatGPT मध्यम-कठिनाई वाली चुनौतियों पर DeepSeek-R1 की तुलना में काफी बेहतर प्रदर्शन करता है।

Ronas Shakya, Sam Urmian, Mohammad Khalil2026-05-21
💬 NLP

Retrieval-Augmented Code Generation: A Survey with Focus on Repository-Level Approaches

यह सर्वेक्षण रिपॉजिटरी-स्तरीय दृष्टिकोणों पर विशिष्ट ध्यान केंद्रित करते हुए रिट्रीवल-ऑगमेंटेड कोड जनरेशन (RACG) की एक व्यापक समीक्षा प्रदान करता है, जो बड़े भाषा मॉडलों को संपूर्ण सॉफ्टवेयर रिपॉजिटरी में सुसंगत कोड उत्पन्न करने में सक्षम बनाने के लिए रिट्रीवल रणनीतियों, स्वायत्त एजेंटों और प्रमुख चुनौतियों का परीक्षण करने हेतु एक एकीकृत विश्लेषणात्मक ढांचा प्रस्तुत करता है।

Yicheng Tao, Yuante Li, Yao Qin, Yepang Liu2026-05-21
💻 computer science

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

यह शोध पत्र InteractScience प्रस्तुत करता है, जो एक नवीन बेंचमार्क और हाइब्रिड मूल्यांकन ढांचा है जिसे पांच वैज्ञानिक डोमेन में प्रोग्रामेटिक कार्यात्मक परीक्षण को दृश्य-आधारित गुणात्मक विश्लेषण के साथ जोड़कर, इंटरैक्टिव वैज्ञानिक प्रदर्शन कोड उत्पन्न करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है।

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan2026-05-21