💻 computer science

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

यह शोध पत्र संज्ञानात्मक जाल (cognitive traps) वाले विषय विशेषज्ञ (SME) द्वारा रचित प्रॉम्प्ट्स का उपयोग करके विशेषज्ञ परामर्श कार्यों पर डीप रिसर्च एजेंटों के मूल्यांकन के लिए एक कठोर बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल (Claude, o3, और Gemini) मतिभ्रम (hallucinations), अंकगणितीय त्रुटियों और असंगत तर्क जैसे विशिष्ट विफलता मोड के कारण समान रूप से निम्न स्वीकृति दर प्राप्त करते हैं।

Tanmay Asthana, Aman Saksena, Divyansh Sahu2026-05-19
📊 statistics

Controlling False Discovery in Arbitrarily Structured Hypothesis Spaces via Reproducing Kernels

यह शोध पत्र किसी रिप्रोड्यूसिंग कर्नेल हिल्बर्ट स्पेस (Reproducing Kernel Hilbert Space) के भीतर एक नियमितकृत शिक्षण कार्य (regularized learning task) के रूप में समस्या को पुनर्गठित करके, मनमाने ढंग से संरचित परिकल्पना स्थानों (hypothesis spaces) में फॉल्स डिस्कवरी रेट (False Discovery Rate) को नियंत्रित करने के लिए एक नवीन ढांचे को प्रस्तुत करता है, जिससे ग्राफ और पदानुक्रम जैसी विविध संरचनाओं को सुव्यवस्थित करने और प्रमाणित एफडीआर (FDR) गारंटियों के साथ सहज, नमूना-कुशल अनुमान सक्षम करने में मदद मिलती है।

Binyamin Perets, Shie Mannor2026-05-19
💻 computer science

Automated Root-Cause Subclassification and No-Code Fix Generation for Invalid Bug Reports

यह शोध पत्र अमान्य बग रिपोर्टों के उप-वर्गीकरण के लिए एक मानकीकृत वर्गीकरण (taxonomy) प्रस्तुत करता है और विभिन्न एआई दृष्टिकोणों का मूल्यांकन करता है, जिसमें यह पाया गया है कि रिट्रीवल ऑगमेंटेड जनरेशन (Retrieval Augmented Generation) मूल-कारण की पहचान करने में उत्कृष्ट है जबकि एजेंटिक वेब सर्च (agentic web search) कार्रवाई योग्य नो-कोड फिक्स (no-code fixes) उत्पन्न करने के लिए सबसे प्रभावी है।

Mahmut Furkan Gon, Emre Dinc, Tevfik Emre Sungur, Eray Tuzun2026-05-19
🤖 machine learning

Beyond Accuracy: Robustness, Interpretability and Expressiveness of EEG Foundation Models

यह अध्ययन आठ डेटासेट्स में छह ईईजी (EEG) फाउंडेशन मॉडल्स के पहले व्यवस्थित बेंचमार्क को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वे आम तौर पर न्यूरोफिजियोलॉजी के अनुरूप हैं और उनमें मजबूत प्रतिनिधित्व क्षमता है, लेकिन उनका प्रदर्शन चैनल ड्रॉपआउट और दूषित सामग्री जैसे विशिष्ट विफलता मोड के प्रति अत्यधिक संवेदनशील है, जिसके लिए उनके विकास में स्वच्छ सटीकता (clean accuracy) से आगे बढ़कर मजबूती (robustness), व्याख्यात्मकता (interpretability) और अभिव्यक्ति (expressiveness) की ओर बदलाव आवश्यक है।

Urban Širca, Maryam Alimardani, Stefanos Zafeiriou, Konstantinos Barmpas2026-05-19
💬 NLP

Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models

यह शोध पत्र इस धारणा को चुनौती देता है कि शतरंज-प्रशिक्षित भाषा मॉडलों में उच्च बेंचमार्क स्कोर वास्तविक नियम समझ का संकेत देते हैं, बल्कि यह तर्क देता है कि उनका प्रदर्शन पैटर्न मिलान (pattern matching) से उत्पन्न होता है और यह प्रदर्शित करता है कि सामान्य LLMs को बाहरी सत्यापनकर्ताओं (external verifiers) के साथ जोड़ना विशिष्ट फाइन-ट्यूनिंग के मुकाबले अधिक लागत प्रभावी और लचीला विकल्प प्रदान करता है।

Ethan Tang2026-05-19
💻 computer science

ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation

यह शोध पत्र ECG-WM को प्रस्तुत करता है, जो एक फिजियोलॉजी-इंफॉर्म्ड वर्ल्ड मॉडल है जो एक्शन-कंडीशन्ड कार्डिएक ट्रेजेक्टरीज को सिम्युलेट करने और अनसर्टेन्टी-अवेयर क्लिनिकल इंटरवेंशन असेसमेंट्स प्रदान करने के लिए लेटेंट डिफ्यूजन डायनेमिक्स में ऑर्डिनरी डिफरेंशियल इक्वेशन प्रायर्स को एकीकृत करता है।

Zhikang Chen, Yue Wang, Sen Cui, Yu Zhang, Changshui Zhang, Tianling Ren, Tingting Zhu2026-05-19
💻 computer science

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

AutoRubric-T2I एक नवीन ढांचा है जो विजन-लैंग्वेज मॉडल जजों को निर्देशित करने के लिए स्पष्ट और व्याख्या योग्य रूब्रिक्स को स्वचालित रूप से संश्लेषित और चयन करता है, जिससे उच्च व्याख्यात्मकता और बड़े पैमाने पर मानव प्राथमिकता डेटा पर न्यूनतम निर्भरता के साथ टेक्स्ट-टू-इमेज संरेखण (alignment) में अत्याधुनिक परिणाम प्राप्त होते हैं।

Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban, Cho-Jui Hsieh2026-05-19
💻 computer science

GraphMind: From Operational Traces to Self-Evolving Workflow Automation

GraphMind एक एंड-टू-एंड, स्व-विकसित होने वाली प्रणाली है जो एक मल्टी-एजेंट ट्रैवर्सल इंजन और एडेप्टिव ट्रैवर्सल रीइन्फोर्समेंट का उपयोग करके ऑपरेशनल ट्रेसेस से स्वतः ही एक्शन-केंद्रित वर्कफ़्लो ग्राफों का निर्माण, निष्पादन और अनुकूलन करती है, जो एंटरप्राइज इंसिडेंट इन्वेस्टिगेशन में बेसलाइन विधियों से काफी बेहतर प्रदर्शन करती है।

Yiwen Zhu, Joyce Cahoon, Anna Pavlenko, Qiushi Bai, Nima Shahbazi, Divya Vermareddy, Meina Wang, Mathieu Demarne, Swati (…)2026-05-19
💻 computer science

Prediction of Challenging Behaviors Associated with Profound Autism in a Classroom Setting Using Wearable Sensors

यह अध्ययन प्रदर्शित करता है कि फाइन-ट्यून्ड फाउंडेशन मॉडल्स, एक वास्तविक विशेष शिक्षा कक्षा में नौ व्यक्तियों से एकत्र किए गए मल्टीमॉडल वियरेबल सेंसर डेटा का विश्लेषण करके, 0.78 के AUC-ROC के साथ गंभीर ऑटिज्म (profound autism) में चुनौतीपूर्ण व्यवहारों की 10 मिनट पहले तक भविष्यवाणी कर सकते हैं, जो सक्रिय सुरक्षा हस्तक्षेपों के लिए मार्ग प्रशस्त करता है।

Yadhu Kartha, Conor Anderson, Jenny Foster, Theresa Hamlin, Johanna Lantz, Ryan Lay, Juergen Hahn, Gari D. Clifford, Hye (…)2026-05-19
💻 computer science

SynVA: A Modular Toolkit for Vessel Generation and Aneurysm Editing

यह शोध पत्र SynVA को प्रस्तुत करता है, जो एक मॉड्यूलर टूलकिट है जो बड़े पैमाने पर, शारीरिक रूप से सुसंगत सिंथेटिक इंट्राक्रैनील एन्यूरिज्म डेटासेट उत्पन्न करने के लिए फ्लो-मैचिंग और प्रक्रियात्मक विधियों को जोड़ता है, जिससे सेरेब्रोवैस्कुलर अनुसंधान में डीप लर्निंग मॉडल को प्रशिक्षित करने के लिए डेटा की कमी को दूर किया जा सके।

Marten J. Finck, Niklas C. Koser, Sarker M. Mahfuz, Tameem Jahangir, Jon E. Wilhelm, Daniel Behme, Naomi Larsen, Wojtek (…)2026-05-19