💻 computer science

GCE-MIL: Faithful and Recoverable Evidence for Multiple Instance Learning in Whole-Slide Imaging

GCE-MIL एक बैकबोन-अज्ञेय (backbone-agnostic) ढांचा है जो होल-स्लाइड इमेजिंग के लिए मल्टीपल इंस्टेंस लर्निंग को सुदृढ़ करने हेतु पर्याप्तता (Sufficiency), आवश्यकता (Necessity) और पुनरुत्पादकता (Recoverability) (S/N/R) के लिए स्पष्ट रूप से अनुकूलित करता है ताकि निष्ठावान, पुनरुत्पादनीय साक्ष्य उत्पन्न किए जा सकें, जिससे वर्गीकरण प्रदर्शन में सुधार होता है और निरंतर अटेंशन स्कोर तथा विविक्त पैच चयन के बीच के अंतर को कम किया जा सके।

Xiangyu Li, Ran Su2026-05-19
💻 computer science

A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle

यह शोधपत्र विजुअल मैकेनिस्टिक इंटरप्रिटेबिलिटी (visual mechanistic interpretability) के लिए एक वितरण संबंधी दृष्टिकोण (distributional view) प्रस्तावित करता है जो मौजूदा प्रतिमानों में सांख्यिकीय पूर्वाग्रहों को हल करने के लिए कार्य को एक KL-न्यूनतम अनुकूलन समस्या (KL-minimal optimization problem) के रूप में सूत्रबद्ध करता है, और व्याख्यात्मकता (interpretability) तथा निष्ठा (faithfulness) के बीच एक सैद्धांतिक संतुलन प्राप्त करने के लिए ऊर्जा-निर्देशित डिफ्यूजन पोस्टीरियर सैंपलिंग (energy-guided diffusion posterior sampling) के माध्यम से साकार एक KL-न्यूनतम सॉफ्ट-कन्स्ट्रेंट सिद्धांत प्रस्तुत करता है।

Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu2026-05-19
💻 computer science

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

यह शोधपत्र SaaSBench प्रस्तुत करता है, जो जटिल, बहु-घटक एंटरप्राइज SaaS परिवेशों में स्वायत्त कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मॉडलों के लिए प्राथमिक बाधा कोड लॉजिक उत्पन्न करने में नहीं, बल्कि विषम सिस्टम घटकों को सफलतापूर्वक कॉन्फ़िगर और एकीकृत करने में निहित है।

Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong W (…)2026-05-19
💻 computer science

Few-Shot Network Intrusion Detection Using Online Triplet Mining

यह शोध पत्र एक फ्यू-शॉट नेटवर्क घुसपैठ पहचान प्रणाली (few-shot network intrusion detection system) का प्रस्ताव करता है जो दुर्भावनापूर्ण ट्रैफ़िक की प्रभावी ढंग से पहचान करने के लिए ऑनलाइन ट्रिपलेट माइनिंग के साथ एक ट्रिपलेट नेटवर्क और एक KNN क्लासिफायर को जोड़ता है, जिससे प्रति अटैक क्लास केवल 10 लेबल किए गए नमूनों के साथ डेटा-दुर्लभ परिदृश्यों में पारंपरिक पर्यवेक्षित (supervised) और विसंगति पहचान (anomaly detection) विधियों की सीमाओं को संबोधित किया जा सके।

Jack Wilkie, Hanan Hindy, Christos Tachtatzis, Miroslav Bures, Robert Atkinson2026-05-19
💻 computer science

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

यह शोध पत्र संज्ञानात्मक जाल (cognitive traps) वाले विषय विशेषज्ञ (SME) द्वारा रचित प्रॉम्प्ट्स का उपयोग करके विशेषज्ञ परामर्श कार्यों पर डीप रिसर्च एजेंटों के मूल्यांकन के लिए एक कठोर बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल (Claude, o3, और Gemini) मतिभ्रम (hallucinations), अंकगणितीय त्रुटियों और असंगत तर्क जैसे विशिष्ट विफलता मोड के कारण समान रूप से निम्न स्वीकृति दर प्राप्त करते हैं।

Tanmay Asthana, Aman Saksena, Divyansh Sahu2026-05-19
📊 statistics

Controlling False Discovery in Arbitrarily Structured Hypothesis Spaces via Reproducing Kernels

यह शोध पत्र किसी रिप्रोड्यूसिंग कर्नेल हिल्बर्ट स्पेस (Reproducing Kernel Hilbert Space) के भीतर एक नियमितकृत शिक्षण कार्य (regularized learning task) के रूप में समस्या को पुनर्गठित करके, मनमाने ढंग से संरचित परिकल्पना स्थानों (hypothesis spaces) में फॉल्स डिस्कवरी रेट (False Discovery Rate) को नियंत्रित करने के लिए एक नवीन ढांचे को प्रस्तुत करता है, जिससे ग्राफ और पदानुक्रम जैसी विविध संरचनाओं को सुव्यवस्थित करने और प्रमाणित एफडीआर (FDR) गारंटियों के साथ सहज, नमूना-कुशल अनुमान सक्षम करने में मदद मिलती है।

Binyamin Perets, Shie Mannor2026-05-19
💻 computer science

Automated Root-Cause Subclassification and No-Code Fix Generation for Invalid Bug Reports

यह शोध पत्र अमान्य बग रिपोर्टों के उप-वर्गीकरण के लिए एक मानकीकृत वर्गीकरण (taxonomy) प्रस्तुत करता है और विभिन्न एआई दृष्टिकोणों का मूल्यांकन करता है, जिसमें यह पाया गया है कि रिट्रीवल ऑगमेंटेड जनरेशन (Retrieval Augmented Generation) मूल-कारण की पहचान करने में उत्कृष्ट है जबकि एजेंटिक वेब सर्च (agentic web search) कार्रवाई योग्य नो-कोड फिक्स (no-code fixes) उत्पन्न करने के लिए सबसे प्रभावी है।

Mahmut Furkan Gon, Emre Dinc, Tevfik Emre Sungur, Eray Tuzun2026-05-19
🤖 machine learning

Beyond Accuracy: Robustness, Interpretability and Expressiveness of EEG Foundation Models

यह अध्ययन आठ डेटासेट्स में छह ईईजी (EEG) फाउंडेशन मॉडल्स के पहले व्यवस्थित बेंचमार्क को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वे आम तौर पर न्यूरोफिजियोलॉजी के अनुरूप हैं और उनमें मजबूत प्रतिनिधित्व क्षमता है, लेकिन उनका प्रदर्शन चैनल ड्रॉपआउट और दूषित सामग्री जैसे विशिष्ट विफलता मोड के प्रति अत्यधिक संवेदनशील है, जिसके लिए उनके विकास में स्वच्छ सटीकता (clean accuracy) से आगे बढ़कर मजबूती (robustness), व्याख्यात्मकता (interpretability) और अभिव्यक्ति (expressiveness) की ओर बदलाव आवश्यक है।

Urban Širca, Maryam Alimardani, Stefanos Zafeiriou, Konstantinos Barmpas2026-05-19
💬 NLP

Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models

यह शोध पत्र इस धारणा को चुनौती देता है कि शतरंज-प्रशिक्षित भाषा मॉडलों में उच्च बेंचमार्क स्कोर वास्तविक नियम समझ का संकेत देते हैं, बल्कि यह तर्क देता है कि उनका प्रदर्शन पैटर्न मिलान (pattern matching) से उत्पन्न होता है और यह प्रदर्शित करता है कि सामान्य LLMs को बाहरी सत्यापनकर्ताओं (external verifiers) के साथ जोड़ना विशिष्ट फाइन-ट्यूनिंग के मुकाबले अधिक लागत प्रभावी और लचीला विकल्प प्रदान करता है।

Ethan Tang2026-05-19
💻 computer science

ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation

यह शोध पत्र ECG-WM को प्रस्तुत करता है, जो एक फिजियोलॉजी-इंफॉर्म्ड वर्ल्ड मॉडल है जो एक्शन-कंडीशन्ड कार्डिएक ट्रेजेक्टरीज को सिम्युलेट करने और अनसर्टेन्टी-अवेयर क्लिनिकल इंटरवेंशन असेसमेंट्स प्रदान करने के लिए लेटेंट डिफ्यूजन डायनेमिक्स में ऑर्डिनरी डिफरेंशियल इक्वेशन प्रायर्स को एकीकृत करता है।

Zhikang Chen, Yue Wang, Sen Cui, Yu Zhang, Changshui Zhang, Tianling Ren, Tingting Zhu2026-05-19