💻 computer science

VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

VeriCache एक इन्फरेंस फ्रेमवर्क है जो कंप्रेस्ड KV-कैश का उपयोग करके टोकन ड्राफ्ट करने और उन्हें फुल कैश के विरुद्ध सत्यापित करने के माध्यम से लॉसलेस (lossless) LLM आउटपुट प्राप्त करता है जो फुल-KV-कैश डिकोडिंग के समान होता है, जबकि यह थ्रूपुट को महत्वपूर्ण रूप से बढ़ाता है क्योंकि फुल कैश को GPU मेमोरी से बाहर रखा जाता है और केवल आवश्यकता होने पर ही स्वैप किया जाता है।

Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jian (…)2026-05-19
💻 computer science

SynVA: A Modular Toolkit for Vessel Generation and Aneurysm Editing

यह शोध पत्र SynVA को प्रस्तुत करता है, जो एक मॉड्यूलर टूलकिट है जो बड़े पैमाने पर, शारीरिक रूप से सुसंगत सिंथेटिक इंट्राक्रैनील एन्यूरिज्म डेटासेट उत्पन्न करने के लिए फ्लो-मैचिंग और प्रक्रियात्मक विधियों को जोड़ता है, जिससे सेरेब्रोवैस्कुलर अनुसंधान में डीप लर्निंग मॉडल को प्रशिक्षित करने के लिए डेटा की कमी को दूर किया जा सके।

Marten J. Finck, Niklas C. Koser, Sarker M. Mahfuz, Tameem Jahangir, Jon E. Wilhelm, Daniel Behme, Naomi Larsen, Wojtek (…)2026-05-19
🤖 machine learning

Verifier-Guided Code Translation via Meta-Step Decoding

यह शोध पत्र डिकोडिंग टाइम वेरिफिकेशन (DTV) को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो त्रुटि प्रसार (error propagation) को रोकने के लिए कोड जनरेशन को स्ट्रक्चरल बाउंड्री चेक्स और वेरीफायर के साथ इंटरलीव करता है, जो पोस्ट-हॉक वेरिफिकेशन या सेल्फ-रिफाइनमेंट बेसलाइन्स की तुलना में ट्रांसलेशन सटीकता और टोकन दक्षता में महत्वपूर्ण सुधार करता है।

Tianyang Zhou, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran2026-05-19
⚛️ high-energy experiments

ML-based Fast Simulation of FARICH Responses

यह शोध पत्र एक हल्का (lightweight) कंडीशनल जेनेरेटिव एडवरसैरियल नेटवर्क (cGAN) प्रस्तुत करता है जो पार्टिकल ट्रैक्स और मोमेंटम के आधार पर यथार्थवादी फोटॉन हिट सैंपल्स उत्पन्न करके FARICH डिटेक्टर रिस्पॉन्स के सिमुलेशन को महत्वपूर्ण रूप से तेज करता है, जो सटीकता बनाए रखते हुए गति में पारंपरिक मोंटे कार्लो (Monte-Carlo) विधियों से बेहतर प्रदर्शन करता है।

Foma Shipilov, Alexander Barnyakov, Vladimir Bobrovnikov, Artem Ivanov, Sergey Kononov, Fedor Ratnikov2026-05-19
🤖 machine learning

TabKDE: Simple and Scalable Tabular Data Generation with Kernel Density Estimates

TabKDE को कोपुला ट्रांसफॉर्मेशन (copula transformations) को कर्नेल डेंसिटी एस्टीमेट्स (kernel density estimates) के साथ जोड़कर सिंथेटिक सारणीबद्ध डेटा (synthetic tabular data) उत्पन्न करने के लिए एक अत्यधिक स्केलेबल और कुशल विधि पेश करता है, जो नगण्य प्रशिक्षण समय और भंडारण स्थान की आवश्यकता के साथ जटिल डीप लर्निंग मॉडलों के तुलनीय सटीकता प्राप्त करता है।

Meysam Alishahi, Yan Zheng, Junpeng Wang, Chin-Chia Michael Yeh, Jeff M. Phillips2026-05-19
🤖 machine learning

Counterfactual Explanations Under Concept Drift

यह शोध पत्र एक हल्के, मॉडल-अज्ञेय (model-agnostic) अपडेट स्कीम का प्रस्ताव करके डेटा स्ट्रीम में कॉन्सेप्ट ड्रिफ्ट (concept drift) के तहत काउंटरफैक्चुअल स्पष्टीकरणों के अमान्य होने की समस्या को संबोधित करता है, जो मौजूदा स्पष्टीकरणों को पुन: उत्पन्न करने की तुलना में उन्हें अधिक कुशलता से सुधारता है, जिससे उनकी वैधता और तर्कसंगतता बनी रहती है।

Marcin Kostrzewa, Jerzy Stefanowski, Maciej Zięba2026-05-19
🤖 machine learning

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge एक हार्डवेयर-जागरूक न्यूरल आर्किटेक्चर सर्च फ्रेमवर्क है जो विशिष्ट एज डिवाइस बाधाओं के अनुरूप अनुकूलित सब-बिलियन-पैरामीटर लैंग्वेज मॉडल्स को स्वचालित रूप से उत्पन्न करने के लिए इनफिनिट-हेड अटेंशन और एक मल्टी-बैकएंड कॉस्ट मॉडल का लाभ उठाता है, जो मौजूदा बेसलाइनों की तुलना में ऊर्जा दक्षता, लेटेंसी और मॉडल सटीकता में महत्वपूर्ण सुधार प्राप्त करता है।

Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane2026-05-19
🤖 machine learning

Bug or Feature2^2: Weight Drift, Activation Sparsity, and Spikes

यह शोध पत्र मानक नुकसान (losses) और धनात्मक रूप से पक्षपाती सक्रियणों (positively biased activations) के बीच की अंतःक्रिया के कारण होने वाले एक मौलिक ऋणात्मक भार विचलन (negative weight drift) की पहचान करता है, जो गहरे नेटवर्क में उच्च सक्रियण विरलता (activation sparsity) और सटीकता की गिरावट (accuracy cliffs) को प्रेरित करता है, जिससे लेखक विरलता, स्थिरता और प्रदर्शन को संतुलित करने वाले प्रभावी समाधान के रूप में क्लिप्ड ReLU2^2 और GELU2^2 का प्रस्ताव करते हैं।

Egor Shvetsov, Aleksandr Serkov, Shokorov Viacheslav, Redko Dmitry, Vladislav Goloshchapov, Evgeny Burnaev2026-05-19
📊 statistics

Training Infinitely Deep and Wide Transformers

यह शोध पत्र उनके गतिकी को एक न्यूरल PDE के रूप में मॉडल करके, फॉरवर्ड और बैकवर्ड पास की सुव्यवस्थितता (well-posedness) को सिद्ध करते हुए और यह प्रदर्शित करते हुए कि न्यूरल टेंगेंट कर्नेल (Neural Tangent Kernel) की इंजेक्टिविटी की विशिष्ट स्थितियों के तहत ग्रेडिएंट फ्लो वैश्विक न्यूनतम (global minima) की ओर अभिसरित होता है, मीन-फील्ड रिजीम में अनंत रूप से गहरे और चौड़े ट्रांसफॉर्मर्स को प्रशिक्षित करने के लिए एक कठोर गणितीय ढांचा स्थापित करता है।

Raphaël Barboni, Maarten V. de Hoop, Takashi Furuya, Gabriel Peyré2026-05-19
🤖 machine learning

PEIRA: Learning Predictive Encoders through Inter-View Regressor Alignment

यह शोध पत्र PEIRA को प्रस्तुत करता है, जो एक नॉन-कॉन्ट्रास्टिव सेल्फ-सुपरवाइज्ड लर्निंग विधि है जो एक इष्टतम लीनियर रिग्रेसर के ट्रेस (trace) के माध्यम से एक सुपरिभाषित उद्देश्य स्थापित करती है ताकि स्थिर, नॉन-कोलैप्स्ड ट्रेनिंग डायनेमिक्स सुनिश्चित किया जा सके जो अग्रणी नॉनलीनियर कैनोनिकल कोरिलेशन सबस्पेस के साथ संरेखित हो, जिससे ImageNet-1K और CIFAR-10 पर प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Michael Arbel, Basile Terver, Jean Ponce2026-05-19