🤖 machine learning

Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization

KernelPro एक क्लोज्ड-लूप मल्टी-एजेंट सिस्टम है जो विशेषज्ञ-प्रेरित माइक्रो-प्रोफाइलिंग टूल्स और एक डोमेन-अनुकूलित MCTS सर्च के साथ LLMs को एकीकृत करता है ताकि स्वचालित रूप से उच्च-प्रदर्शन, ऊर्जा-कुशल CUDA कर्नेल उत्पन्न और पुनरावृत्ति के माध्यम से अनुकूलित किया जा सके, जिससे विविध बेंचमार्क पर स्टेट-ऑफ-द-आर्ट स्पीडअप प्राप्त होता है।

Jiading Gai, Shuai Zhang, Kaj Bostrom, Jin Huang, Vihang Patil, Haoyang Fang, Bernie Wang, Huzefa Rangwala, George Karyp (…)2026-06-26
🤖 machine learning

Finding the Time to Think: Learning Planning Budgets in Real-Time RL

यह शोध पत्र वेरिएबल-डिले रियल-टाइम रीइन्फोर्समेंट लर्निंग पेश करता है, जहाँ एजेंटों को पर्यावरण के आगे बढ़ने के साथ विचार-विमर्श का समय चुनना होता है, और एक लाइटवेट गेटिंग पॉलिसी को प्रशिक्षित करने का प्रस्ताव देता है जो गतिशील रूप से स्टेट-डिपेंडेंट प्लानिंग बजट का चयन करती है, जो कई रियल-टाइम गेम्स में फिक्स्ड और ह्यूरिस्टिक बेसलाइन की तुलना में बेहतर प्रदर्शन करती है।

Aneesh Muppidi, Firas Darwish, Dylan Cope, João F. Henriques, Jakob Nicolaus Foerster2026-06-26
🤖 machine learning

A Causal Foundation Model for Structure and Outcome Prediction

यह शोध पत्र TabPFN-CFM को प्रस्तुत करता है, जो एक सिंथेटिक डेटा पर प्रशिक्षित कॉज़ल फाउंडेशन मॉडल है जो वास्तविक दुनिया के डेटासेट पर सामान्यीकरण करता है ताकि पर्ल के कॉज़ल पदानक्रम (Pearl's Causal Hierarchy) के सभी स्तरों पर प्रश्नों का समर्थन करते हुए, साथ ही कॉज़ल संरचनाओं और परिणामों की भविष्यवाणी कर सके।

Max Zhu, Martino Mansoldo, Ching-Hao Wang, Stefan Groha2026-06-26
🤖 machine learning

Epiphany-Aware KV Cache Eviction Without the Attention Matrix

यह शोध पत्र EpiKV प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) KV कैश इविक्शन विधि है जो शोर वाले अटेंशन-आधारित स्कोरिंग को आंतरिक प्रतिनिधित्व परिवर्तनों से प्राप्त एक "एपिफनी स्कोर" (epiphany score) से बदल देता है, जिससे अटेंशन मैट्रिक्स भौतिकीकरण (materialization) या कस्टम कर्नेल की आवश्यकता के बिना काफी लंबे कॉन्टेक्स्ट विंडो और तेज़ इन्फरेंस गति सक्षम होती है।

Steven Kolawole, Virginia Smith2026-06-26
🤖 machine learning

Localizing RL-Induced Tool Use to a Single Crosscoder Feature

यह शोध पत्र प्रदर्शित करता है कि डेडिकेटेड फीचर क्रॉसकोडर्स (DFC), Qwen2.5-3B में RL-प्रेरित (RL-induced) फीचर्स के एक संक्षिप्त सेट को अलग कर सकते हैं जो न केवल टूल-कॉलिंग की सटीकता में महत्वपूर्ण सुधार करते हैं बल्कि इन एजेंटिक क्षमताओं को एक फ्रोजन बेस मॉडल में स्थानांतरित करने में भी सक्षम बनाते हैं, जिससे रिट्रेनिंग-मुक्त व्यवहार नियंत्रण सुगम होता है।

Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman2026-06-26
🤖 machine learning

Retrieval-Warmed Energy-Based Reasoning: A Five-Arm Ablation Methodology for Diffusion-as-Inference on Structured Reasoning Tasks

यह शोध पत्र 'रिट्रीवल-वॉर्मड एनर्जी-बेस्ड रीजनिंग' (RW-EBR) और एक नवीन पांच-आर्म एब्लेशन पद्धति प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि क्लास-प्रायर बायस या स्टोकेस्टिक वार्म-स्टार्टिंग के बजाय, प्रति-ग्राफ संरेखण (per-graph alignment), ग्राफ रीचेबिलिटी और सुडोकू जैसे संरचित कार्यों पर डिफ्यूजन-आधारित रीजनिंग में प्रदर्शन वृद्धि को चलाने वाला प्रमुख कारक है, साथ ही की-क्वालिटी (key quality) जैसे विशिष्ट परिनियोजन बाधाओं की भी पहचान करता है।

Libo Sun, Po-Wei Harn, Zewei Zhang, Peixiong He, Xiao Qin2026-06-26
💬 NLP

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

यह शोध पत्र आउट-ऑफ-बैंड एलएलएम (LLM) एजेंट सुरक्षा प्रणालियों के मूल्यांकन के लिए एक संरचित ढांचे का प्रस्ताव करता है, एक अनुकूली हमला प्रोटोकॉल के माध्यम से यह प्रदर्शित करता है कि प्रोजेंट (Progent) प्रणाली एक स्व-होस्ट किए गए एजेंट पर प्रॉम्प्ट इंजेक्शन की सफलता दर को काफी कम कर देती है, और यह तर्क देता है कि इन-बैंड डिटेक्शन की तुलना में नियत बाहरी प्रवर्तन (deterministic external enforcement) अधिक सुदृढ़ सुरक्षा स्थिति प्रदान करता है।

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu2026-06-26
🤖 machine learning

What Survives When You Compress a Recursive Reasoner for the Edge?

यह शोध पत्र प्रकट करता है कि एज डिप्लॉयमेंट के लिए रिकर्सिव रीजनिंग मॉडल्स को कंप्रेस करने से स्थानीय सटीकता (local accuracy) सुरक्षित रहने के बावजूद वैश्विक तर्क क्षमताओं (global reasoning capabilities) का विनाश हो जाता है, लेकिन यह पहचानता है कि यह पतन संरचनात्मक (architectural) है न कि मौलिक, और इसे प्रति-चैनल कैलिब्रेटेड INT4 क्वांटाइजेशन (per-channel calibrated INT4 quantization) तथा कैरी-ट्रैजेक्टरी फिडेलिटी मेट्रिक्स (carry-trajectory fidelity metrics) का उपयोग करके उलटा जा सकता है ताकि माइक्रोकंट्रोलर्स पर कुशल डिप्लॉयमेंट सक्षम किया जा सके।

Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye, Glory Bagai, Virginia Smith2026-06-26
🤖 machine learning

Evaluation-Strategy Gap in Fault Diagnosis of Deep Learning Programs

यह शोध पत्र 5,542 ट्रेसेस के एक विशाल संग्रह का उपयोग करते हुए 'विदिन-प्रोग्राम' और 'अनसीन-प्रोग्राम' सेटिंग्स के बीच डीप लर्निंग फॉल्ट डायग्नोसिस में प्रदर्शन अंतराल की जांच करता है, जो यह प्रकट करता है कि जहाँ मौजूदा तकनीकें प्रोग्राम-स्तरीय फीचर संरचनाओं के कारण नए प्रोग्रामों पर सटीकता में महत्वपूर्ण गिरावट का सामना करती हैं, वहीं कर्वेचर फीचर्स विशेष रूप से अनसीन परिदृश्यों के लिए प्रभावी अस्थिरता का पता लगाने की क्षमता प्रदान करते हैं।

Sigma Jahan2026-06-26
🔢 mathematics

Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

यह शोधपत्र निरंतर-समय मीन-फील्ड सुदृढीकरण शिक्षण (mean-field reinforcement learning) के लिए एक मॉडल-मुक्त एक्टर-क्रिटिक ढांचे को प्रस्तुत करता है जो एक 'मीन-फील्ड-फाईबीई' (Mean-Field-PhiBE) समीकरण को परिभाषित करके डिस्क्रीट-टाइम डेटा को निरंतर-समय गतिकी (continuous-time dynamics) से जोड़ता है, जो अज्ञात ड्रिफ्ट और डिफ्यूजन गुणांकों को डेटा-संचालित अनुमानकों (data-driven estimators) से प्रतिस्थापित करते हुए अंतर्निहित जनरेटर संरचना को संरक्षित करता है ताकि लीनियर-क्वाड्रैटिक सेटिंग्स में प्रथम-क्रम की निरंतरता (first-order consistency) और द्वितीय-क्रम की सटीकता (second-order accuracy) प्राप्त की जा सके।

Erhan Bayraktar, Martin Hernandez, Qinxin Yan, Yuhua Zhu2026-06-26