🤖 machine learning

Localizing RL-Induced Tool Use to a Single Crosscoder Feature

यह शोध पत्र प्रदर्शित करता है कि डेडिकेटेड फीचर क्रॉसकोडर्स (DFC), Qwen2.5-3B में RL-प्रेरित (RL-induced) फीचर्स के एक संक्षिप्त सेट को अलग कर सकते हैं जो न केवल टूल-कॉलिंग की सटीकता में महत्वपूर्ण सुधार करते हैं बल्कि इन एजेंटिक क्षमताओं को एक फ्रोजन बेस मॉडल में स्थानांतरित करने में भी सक्षम बनाते हैं, जिससे रिट्रेनिंग-मुक्त व्यवहार नियंत्रण सुगम होता है।

Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman2026-06-26
🤖 machine learning

Retrieval-Warmed Energy-Based Reasoning: A Five-Arm Ablation Methodology for Diffusion-as-Inference on Structured Reasoning Tasks

यह शोध पत्र 'रिट्रीवल-वॉर्मड एनर्जी-बेस्ड रीजनिंग' (RW-EBR) और एक नवीन पांच-आर्म एब्लेशन पद्धति प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि क्लास-प्रायर बायस या स्टोकेस्टिक वार्म-स्टार्टिंग के बजाय, प्रति-ग्राफ संरेखण (per-graph alignment), ग्राफ रीचेबिलिटी और सुडोकू जैसे संरचित कार्यों पर डिफ्यूजन-आधारित रीजनिंग में प्रदर्शन वृद्धि को चलाने वाला प्रमुख कारक है, साथ ही की-क्वालिटी (key quality) जैसे विशिष्ट परिनियोजन बाधाओं की भी पहचान करता है।

Libo Sun, Po-Wei Harn, Zewei Zhang, Peixiong He, Xiao Qin2026-06-26
💬 NLP

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

यह शोध पत्र आउट-ऑफ-बैंड एलएलएम (LLM) एजेंट सुरक्षा प्रणालियों के मूल्यांकन के लिए एक संरचित ढांचे का प्रस्ताव करता है, एक अनुकूली हमला प्रोटोकॉल के माध्यम से यह प्रदर्शित करता है कि प्रोजेंट (Progent) प्रणाली एक स्व-होस्ट किए गए एजेंट पर प्रॉम्प्ट इंजेक्शन की सफलता दर को काफी कम कर देती है, और यह तर्क देता है कि इन-बैंड डिटेक्शन की तुलना में नियत बाहरी प्रवर्तन (deterministic external enforcement) अधिक सुदृढ़ सुरक्षा स्थिति प्रदान करता है।

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu2026-06-26
💬 NLP

Speaking Numbers to LLMs: Multi-Wavelet Number Embeddings for Time Series Forecasting

यह शोध पत्र TempoWave को प्रस्तुत करता है, जो एक नवीन मल्टी-वेवलेट डिजिट एम्बेडिंग इंटरफेस है जो स्केलर टाइम सीरीज़ अवलोकनों को ट्रांसफार्मर-अनुकूल निरूपणों में मैप करता है ताकि लार्ज लैंग्वेज मॉडल्स में संख्यात्मक मिसअलाइनमेंट (numerical misalignment) को दूर किया जा सके, जिससे संदर्भ-जागरूक टाइम सीरीज़ पूर्वानुमान में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Defu Cao, Zijie Lei, Muyan Weng, Jiao Sun, Yan Liu2026-06-26
🤖 AI

An Empirical Study of LLM-Generated Specifications for VeriFast

यह शोध पत्र 303 C फलनों (functions) के लिए VeriFast विनिर्देशों (specifications) को उत्पन्न करने में आठ प्रॉम्प्टिंग रणनीतियों के माध्यम से दस लार्ज लैंग्वेज मॉडल्स की प्रभावशीलता का अनुभवजन्य मूल्यांकन करता है, जिससे यह स्पष्ट होता है कि जबकि LLMs कार्यात्मक व्यवहार को बनाए रखते हैं, वे मुख्य रूप से डोमेन-विशिष्ट सेपरेशन लॉजिक ज्ञान में त्रुटियों के कारण केवल मामूली सत्यापन सफलता (31.4%) ही प्राप्त करते हैं।

Wen Fan, Minh Tran, Sanya Dod, Xin Hu, Marilyn Rego, Danning Xie, Jenna DiVincenzo, Lin Tan2026-06-26
🤖 machine learning

Evaluation-Strategy Gap in Fault Diagnosis of Deep Learning Programs

यह शोध पत्र 5,542 ट्रेसेस के एक विशाल संग्रह का उपयोग करते हुए 'विदिन-प्रोग्राम' और 'अनसीन-प्रोग्राम' सेटिंग्स के बीच डीप लर्निंग फॉल्ट डायग्नोसिस में प्रदर्शन अंतराल की जांच करता है, जो यह प्रकट करता है कि जहाँ मौजूदा तकनीकें प्रोग्राम-स्तरीय फीचर संरचनाओं के कारण नए प्रोग्रामों पर सटीकता में महत्वपूर्ण गिरावट का सामना करती हैं, वहीं कर्वेचर फीचर्स विशेष रूप से अनसीन परिदृश्यों के लिए प्रभावी अस्थिरता का पता लगाने की क्षमता प्रदान करते हैं।

Sigma Jahan2026-06-26
🤖 AI

Clinical Harness for Governable Medical AI Skill Ecosystems

यह शोध पत्र "क्लिनिकल हार्नेस" (Clinical Harness) का प्रस्ताव करता है, जो एक रनटाइम गवर्नेंस आर्किटेक्चर है जो जीवनचक्र देखभाल (lifecycle care) का समर्थन करने के लिए अलग-थलग मेडिकल एआई मॉडल्स को जवाबदेह, निरंतर "क्लिनिकल स्किल्स" में व्यवस्थित करता है, जिसे ज्ञान-संचालित, डेटा-संचालित और भौतिकी-संवर्धित क्षमताओं को एकीकृत करने वाले ऑस्टियोपोरोसिस के एक उदाहरण के माध्यम से प्रदर्शित किया गया है।

Tianhan Xu, Lei Bao, Yongxiang Wang2026-06-26
🤖 AI

Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation

यह शोध पत्र यह प्रकट करता है कि जहाँ बड़े रीजनिंग मॉडल और मनुष्य दोनों ही कुल मिलाकर कठिन समस्याओं पर अधिक समय आवंटित करते हैं, वहीं वे विपरीत आंतरिक रणनीतियाँ प्रदर्शित करते हैं: मनुष्य उन समस्याओं पर कम समय बिताते हैं जिनमें वे अंततः विफल हो जाते हैं (जो रणनीतिक विसंयोजन का संकेत देता है), जबकि मॉडल अपनी विफलताओं पर अधिक टोकन खर्च करते हैं (जो अनिश्चितता-प्रेरित विचार-विमर्श का संकेत देता है), जो एक महत्वपूर्ण विचलन है जिसे मानक कठिनाई-सहसंबंध मेट्रिक्स द्वारा छिपा दिया जाता है।

Han-yu Wang2026-06-26
🤖 AI

NeuraDock Visual Cognitive Load Agent Tutorial: A Quality-Gated Open-Source EEG Workflow for Alpha Dynamics and Real-Time Applications

यह ट्यूटोरियल पेपर NeuraDock प्रस्तुत करता है, जो एक ओपन-सोर्स, क्वालिटी-गेटेड ईईजी (EEG) एजेंट है जो अल्फा डायनेमिक्स के माध्यम से विजुअल कॉग्निटिव लोड का विश्लेषण करने के लिए एक पुनरुत्पादक (reproducible), एंड-टू-एंड वर्कफ़्लो प्रदान करता है, जो ऑफलाइन प्रीप्रोसेसिंग और रियल-टाइम एप्लिकेशन डिप्लॉयमेंट के बीच के अंतर को पाटता है।

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo2026-06-26
🤖 AI

Boundary-Aware Context Grounding for A Low-Channel EEG Agent

यह शोधपत्र NeuraDock Agent को प्रस्तुत करता है, जो एक ओपन-सोर्स आर्किटेक्चर है जो एक नियत (deterministic) स्थानीय संख्यात्मक इंजन को हार्डवेयर-जागरूक भाषा परत से अलग करके कम-चैनल वाले EEG विश्लेषण की विश्वसनीयता को बढ़ाता है, जिससे यह सुनिश्चित होता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) केवल सत्यापित कार्यान्वयन सीमाओं और वैज्ञानिक सीमाओं के भीतर ही कार्य करें ताकि असमर्थ व्याख्याओं को रोका जा सके।

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo2026-06-26