🤖 machine learning

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

इर्मिन्सुल (Irminsul) एजेंटिक एलएलएम (Agentic LLMs) के लिए एक नेटिव पोजीशन-इंडिपेंडेंट कैशिंग सिस्टम पेश करता है जो कंटेंट-एड्रेस्ड की-वैल्यू कैशिंग को सक्षम करने के लिए मल्टी-हेड लेटेंट अटेंशन (Multi-Head Latent Attention) की आर्किटेक्चरल संरचना का लाभ उठाता है, जिससे पारंपरिक प्रीफिक्स-मैचिंग दृष्टिकोणों में निहित कैश इनवैलिडेशन समस्याओं को दूर करते हुए 83% तक प्रॉम्प्ट टोकन रिकवरी और 63% प्रीफिल ऊर्जा बचत प्राप्त होती है।

Bole Ma, Jan Eitzinger, Harald Köstler2026-05-08
🤖 AI

When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon

यह शोध पत्र प्रदर्शित करता है कि Apple Silicon पर, int4 KV कैश क्वांटाइजेशन के लिए एक विशेष फ्यूज्ड मेटल कर्नेल न केवल मॉडल की गुणवत्ता को बनाए रखता है, बल्कि यूनिफाइड मेमोरी बैंडविड्थ और उन्नत रोटेशन तकनीकों का लाभ उठाकर प्रति-टोकन गिरावट को समाप्त करते हुए लेटेंसी में fp16 से बेहतर प्रदर्शन भी करता है।

Mohamed Amine Bergach2026-05-08
🤖 AI

Inference-Time Budget Control for LLM Search Agents

यह शोध पत्र एक 'वैल्यू-ऑफ-इन्फॉर्मेशन-ड्रिवन' सर्च कंट्रोलर और एक चयनात्मक साक्ष्य-आधारित फाइनलाइज़र के माध्यम से मल्टी-हॉप क्यू-एंड-ए (QA) के दौरान दोहरे बजट (टूल कॉल्स और टोकन) को गतिशील रूप से आवंटित करने वाले एलएलएम (LLM) सर्च एजेंटों के लिए एक द्वि-चरणीय इन्फरेंस-टाइम बजट नियंत्रण ढांचे का प्रस्ताव करता है, जो कई बेंचमार्क और मॉडलों में बेसलाइन की तुलना में निरंतर प्रदर्शन लाभ प्राप्त करता है।

Zhengru Fang, Senkang Forest Hu, Zhonghao Chang, Yu Guo, Yihang Tao, Hongyao Liu, Mengzhe Ruan, Jun Huang, Yuguang Fang2026-05-08
🤖 AI

Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में इंटेंट-ओब्फस्केशन (इरादा छिपाने वाले) जेलब्रेक्स को नियंत्रित करने वाले एक रिकंस्ट्रक्शन-कंसीलमेंट (पुनर्निर्माण-गोपन) ट्रेडऑफ की पहचान करता है और एक नई हमला रणनीति प्रस्तावित करता है जो इरादे को छिपाने और पुनर्निर्माण क्षमता के बीच प्रभावी ढंग से संतुलन बनाने के लिए कैरेक्टर-रिमूव्ड वेरिएंट्स और कीवर्ड-संबंधित डिस्ट्रैक्टर इमेजेस का लाभ उठाती है, जिससे मौजूदा तरीकों से बेहतर प्रदर्शन होता है।

Md Farhamdur Reza, Richeng Jin, Tianfu Wu, Huaiyu Dai2026-05-08
💬 NLP

Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes

यह शोध पत्र प्रदर्शित करता है कि यद्यपि मेडिकल LLMs में एक विशिष्ट "ओवरथिंकिंग" विफलता मोड (failure mode) को हिडन स्टेट्स (hidden states) से रैखिक रूप से डिकोड (linearly decodable) किया जा सकता है, फिर भी इसे कार्य-महत्वपूर्ण गणनाओं के साथ प्रतिनिधित्व संबंधी उलझाव (representational entanglement) के कारण फिक्स्ड लीनियर स्टीयरिंग (fixed linear steering) के माध्यम से सुधारा नहीं जा सकता है, हालांकि यही प्रोब (probe) चयनात्मक परहेज (selective abstention) को सक्षम करने के लिए विफलताओं का पता लगाने में प्रभावी बना रहता है।

Ming Liu2026-05-08
💬 NLP

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

यह शोध पत्र प्रदर्शित करता है कि LLM एजेंटों में अधिक स्कैफोल्डिंग घटकों को जोड़ने से अक्सर विनाशकारी क्रॉस-कंपोनेंट हस्तक्षेप होता है, जो यह सिद्ध करता है कि पारंपरिक "ऑल-इन" दृष्टिकोण की तुलना में कार्य-विशिष्ट उपसमुच्चय चयन (task-specific subset selection) बेहतर प्रदर्शन करता है और ग्रीडी चयन विधियाँ बार-बार होने वाले सबमॉड्यूलरिटी उल्लंघन के कारण अविश्वसनीय हैं।

Ming Liu2026-05-08
🤖 AI

Detecting Time Series Anomalies Like an Expert: A Multi-Agent LLM Framework with Specialized Analyzers

यह शोध पत्र SAGE को प्रस्तुत करता है, जो एक मल्टी-एजेंट LLM फ्रेमवर्क है जो विभिन्न प्रकार के विसंगतियों (anomalies) के लिए चार विशिष्ट विश्लेषकों में कार्य को विभाजित करके टाइम सीरीज़ विसंगति पहचान (time series anomaly detection) को बढ़ाता है, और मौजूदा बेसलाइनों की तुलना में बेहतर प्रदर्शन और व्याख्यात्मकता प्राप्त करने के लिए साक्ष्य-आधारित समेकन (evidence-grounded consolidation) और सिंथेटिक इन-कॉन्टेक्स्ट लर्निंग का उपयोग करता है।

Hyeongwon Kang, Jeongseob Kim, Jinwoo Park, Pilsung Kang2026-05-08
⚡ electrical engineering

WARP: A Benchmark for Primal-Dual Warm-Starting of Interior-Point Solvers

यह शोध पत्र WARP प्रस्तुत करता है, जो एक बेंचमार्क और न्यूरल नेटवर्क फ्रेमवर्क है जो यह प्रदर्शित करता है कि AC ऑप्टिमल पावर फ्लो सॉल्वर में महत्वपूर्ण इटरेशन कटौती प्राप्त करने के लिए केवल प्राइमल वेरिएबल्स के बजाय पूर्ण प्राइमल-डुअल-बैरियर अवस्थाओं (primal-dual-barrier states) की भविष्यवाणी करना आवश्यक है, जो पिछले मूल्यांकन बेसलाइनों को सुधारता है जिन्होंने प्राइमल-ओनली वार्म-स्टार्टिंग की प्रभावकारिता को बढ़ाकर दिखाया था।

Dhruv Suri, Helgi Hilmarsson, Shourya Bose2026-05-08
🤖 machine learning

CRAFT: Forgetting-Aware Intervention-Based Adaptation for Continual Learning

CRAFT एक निरंतर सीखने वाला (continual learning) फ्रेमवर्क है जो बड़े भाषा मॉडलों (large language models) के लिए है, जो टास्क रूटिंग, KL-डाइवर्जेंस-आधारित फाइन-ट्यूनिंग और इंटरवेंशन मर्जिंग की एक एकीकृत तीन-चरणीय प्रक्रिया के माध्यम से हिडन रिप्रेजेंटेशन पर लो-रैंक इंटरवेंशन सीखकर कैटास्ट्रोफिक फॉरगेटिंग को कम करता है, जिससे यह कई बेंचमार्क पर मजबूत LoRA-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Md Anwar Hossen, Fatema Siddika, Juan Pablo Munoz, Tanya Roosta, Ali Jannesari2026-05-08
🤖 machine learning

CoMemNet: Contrastive Sampling with Memory Replay Network for Continual Traffic Prediction

CoMemNet एक ड्यूल-ब्रांच कंटीन्यूअल लर्निंग फ्रेमवर्क है जो विकसित होते ट्रैफिक पैटर्न को प्रभावी ढंग से कैप्चर करने और कैटास्ट्रोफिक फॉरगेटिंग को कम करने के लिए मोमेंटम-अपडेटेड टारगेट ब्रांच को डायनेमिक कॉन्ट्रास्टिव सैंपलर और एक लाइटवेट टेम्पोरल मेमोरी बफर के साथ जोड़ता है, जिससे बड़े पैमाने के वास्तविक दुनिया के डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Mei Wu, Wenchao Weng, Wenxin Su, Wenjie Tang, Wei Zhou2026-05-08