💻 computer science

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

यह शोधपत्र SaaSBench प्रस्तुत करता है, जो जटिल, बहु-घटक एंटरप्राइज SaaS परिवेशों में स्वायत्त कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मॉडलों के लिए प्राथमिक बाधा कोड लॉजिक उत्पन्न करने में नहीं, बल्कि विषम सिस्टम घटकों को सफलतापूर्वक कॉन्फ़िगर और एकीकृत करने में निहित है।

Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong W (…)2026-05-19
💻 computer science

Few-Shot Network Intrusion Detection Using Online Triplet Mining

यह शोध पत्र एक फ्यू-शॉट नेटवर्क घुसपैठ पहचान प्रणाली (few-shot network intrusion detection system) का प्रस्ताव करता है जो दुर्भावनापूर्ण ट्रैफ़िक की प्रभावी ढंग से पहचान करने के लिए ऑनलाइन ट्रिपलेट माइनिंग के साथ एक ट्रिपलेट नेटवर्क और एक KNN क्लासिफायर को जोड़ता है, जिससे प्रति अटैक क्लास केवल 10 लेबल किए गए नमूनों के साथ डेटा-दुर्लभ परिदृश्यों में पारंपरिक पर्यवेक्षित (supervised) और विसंगति पहचान (anomaly detection) विधियों की सीमाओं को संबोधित किया जा सके।

Jack Wilkie, Hanan Hindy, Christos Tachtatzis, Miroslav Bures, Robert Atkinson2026-05-19
💻 computer science

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

यह शोध पत्र संज्ञानात्मक जाल (cognitive traps) वाले विषय विशेषज्ञ (SME) द्वारा रचित प्रॉम्प्ट्स का उपयोग करके विशेषज्ञ परामर्श कार्यों पर डीप रिसर्च एजेंटों के मूल्यांकन के लिए एक कठोर बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल (Claude, o3, और Gemini) मतिभ्रम (hallucinations), अंकगणितीय त्रुटियों और असंगत तर्क जैसे विशिष्ट विफलता मोड के कारण समान रूप से निम्न स्वीकृति दर प्राप्त करते हैं।

Tanmay Asthana, Aman Saksena, Divyansh Sahu2026-05-19
📊 statistics

Controlling False Discovery in Arbitrarily Structured Hypothesis Spaces via Reproducing Kernels

यह शोध पत्र किसी रिप्रोड्यूसिंग कर्नेल हिल्बर्ट स्पेस (Reproducing Kernel Hilbert Space) के भीतर एक नियमितकृत शिक्षण कार्य (regularized learning task) के रूप में समस्या को पुनर्गठित करके, मनमाने ढंग से संरचित परिकल्पना स्थानों (hypothesis spaces) में फॉल्स डिस्कवरी रेट (False Discovery Rate) को नियंत्रित करने के लिए एक नवीन ढांचे को प्रस्तुत करता है, जिससे ग्राफ और पदानुक्रम जैसी विविध संरचनाओं को सुव्यवस्थित करने और प्रमाणित एफडीआर (FDR) गारंटियों के साथ सहज, नमूना-कुशल अनुमान सक्षम करने में मदद मिलती है।

Binyamin Perets, Shie Mannor2026-05-19
💻 computer science

Automated Root-Cause Subclassification and No-Code Fix Generation for Invalid Bug Reports

यह शोध पत्र अमान्य बग रिपोर्टों के उप-वर्गीकरण के लिए एक मानकीकृत वर्गीकरण (taxonomy) प्रस्तुत करता है और विभिन्न एआई दृष्टिकोणों का मूल्यांकन करता है, जिसमें यह पाया गया है कि रिट्रीवल ऑगमेंटेड जनरेशन (Retrieval Augmented Generation) मूल-कारण की पहचान करने में उत्कृष्ट है जबकि एजेंटिक वेब सर्च (agentic web search) कार्रवाई योग्य नो-कोड फिक्स (no-code fixes) उत्पन्न करने के लिए सबसे प्रभावी है।

Mahmut Furkan Gon, Emre Dinc, Tevfik Emre Sungur, Eray Tuzun2026-05-19
🤖 machine learning

Beyond Accuracy: Robustness, Interpretability and Expressiveness of EEG Foundation Models

यह अध्ययन आठ डेटासेट्स में छह ईईजी (EEG) फाउंडेशन मॉडल्स के पहले व्यवस्थित बेंचमार्क को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वे आम तौर पर न्यूरोफिजियोलॉजी के अनुरूप हैं और उनमें मजबूत प्रतिनिधित्व क्षमता है, लेकिन उनका प्रदर्शन चैनल ड्रॉपआउट और दूषित सामग्री जैसे विशिष्ट विफलता मोड के प्रति अत्यधिक संवेदनशील है, जिसके लिए उनके विकास में स्वच्छ सटीकता (clean accuracy) से आगे बढ़कर मजबूती (robustness), व्याख्यात्मकता (interpretability) और अभिव्यक्ति (expressiveness) की ओर बदलाव आवश्यक है।

Urban Širca, Maryam Alimardani, Stefanos Zafeiriou, Konstantinos Barmpas2026-05-19
💬 NLP

Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models

यह शोध पत्र इस धारणा को चुनौती देता है कि शतरंज-प्रशिक्षित भाषा मॉडलों में उच्च बेंचमार्क स्कोर वास्तविक नियम समझ का संकेत देते हैं, बल्कि यह तर्क देता है कि उनका प्रदर्शन पैटर्न मिलान (pattern matching) से उत्पन्न होता है और यह प्रदर्शित करता है कि सामान्य LLMs को बाहरी सत्यापनकर्ताओं (external verifiers) के साथ जोड़ना विशिष्ट फाइन-ट्यूनिंग के मुकाबले अधिक लागत प्रभावी और लचीला विकल्प प्रदान करता है।

Ethan Tang2026-05-19
💻 computer science

ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation

यह शोध पत्र ECG-WM को प्रस्तुत करता है, जो एक फिजियोलॉजी-इंफॉर्म्ड वर्ल्ड मॉडल है जो एक्शन-कंडीशन्ड कार्डिएक ट्रेजेक्टरीज को सिम्युलेट करने और अनसर्टेन्टी-अवेयर क्लिनिकल इंटरवेंशन असेसमेंट्स प्रदान करने के लिए लेटेंट डिफ्यूजन डायनेमिक्स में ऑर्डिनरी डिफरेंशियल इक्वेशन प्रायर्स को एकीकृत करता है।

Zhikang Chen, Yue Wang, Sen Cui, Yu Zhang, Changshui Zhang, Tianling Ren, Tingting Zhu2026-05-19
💻 computer science

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

AutoRubric-T2I एक नवीन ढांचा है जो विजन-लैंग्वेज मॉडल जजों को निर्देशित करने के लिए स्पष्ट और व्याख्या योग्य रूब्रिक्स को स्वचालित रूप से संश्लेषित और चयन करता है, जिससे उच्च व्याख्यात्मकता और बड़े पैमाने पर मानव प्राथमिकता डेटा पर न्यूनतम निर्भरता के साथ टेक्स्ट-टू-इमेज संरेखण (alignment) में अत्याधुनिक परिणाम प्राप्त होते हैं।

Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban, Cho-Jui Hsieh2026-05-19
💻 computer science

GraphMind: From Operational Traces to Self-Evolving Workflow Automation

GraphMind एक एंड-टू-एंड, स्व-विकसित होने वाली प्रणाली है जो एक मल्टी-एजेंट ट्रैवर्सल इंजन और एडेप्टिव ट्रैवर्सल रीइन्फोर्समेंट का उपयोग करके ऑपरेशनल ट्रेसेस से स्वतः ही एक्शन-केंद्रित वर्कफ़्लो ग्राफों का निर्माण, निष्पादन और अनुकूलन करती है, जो एंटरप्राइज इंसिडेंट इन्वेस्टिगेशन में बेसलाइन विधियों से काफी बेहतर प्रदर्शन करती है।

Yiwen Zhu, Joyce Cahoon, Anna Pavlenko, Qiushi Bai, Nima Shahbazi, Divya Vermareddy, Meina Wang, Mathieu Demarne, Swati (…)2026-05-19