🤖 machine learning

Tile-Level Activation Overlap for Efficient LLM Inference

यह शोध पत्र दो विशिष्ट CUTLASS-आधारित SM90 कर्नेल पेश करता है जो मध्यवर्ती टेंसर मटेरियलिज़ेशन ओवरहेड को समाप्त करने के लिए टाइल स्तर पर मैट्रिक्स गुणन के साथ SwiGLU एक्टिवेशन को फ्यूज करते हैं, जिससे NVIDIA H100 GPU पर 2.47x तक की गति वृद्धि और 79.5% पीक यूटिलाइजेशन प्राप्त होता है और यह दक्षता एवं संख्यात्मक सटीकता में PyTorch और cuBLAS दोनों से बेहतर प्रदर्शन करता है।

Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta2026-07-07
🧬 biology

Interpretable machine learning predicts Parkinson's disease severity using motion-corrected QSM MRI and multiband multiecho fMRI features

यह अध्ययन प्रदर्शित करता है कि मोशन-करेक्टेड QSM MRI और मल्टीबैंड मल्टीइको fMRI विशेषताओं को एकीकृत करने वाले व्याख्यात्मक मशीन लर्निंग मॉडल पार्किंसंस रोग की मोटर गंभीरता की प्रभावी ढंग से भविष्यवाणी कर सकते हैं, जिसमें संयुक्त संरचनात्मक और नैदानिक चर सबसे सटीक और नैदानिक रूप से प्रासंगिक भविष्यवाणियां प्रदान करते हैं।

Aixa X. Andrade2026-07-07
🤖 machine learning

MLSYSIM: First-Principles Infrastructure Modeling for Machine Learning Systems

यह शोध पत्र MLSYSIM को प्रस्तुत करता है, जो एक प्रथम-सिद्धांतों (first-principles) वाला विश्लेषणात्मक ढांचा है जो सिस्टम भौतिकी को एक आयामी रूप से-सख्त इंजन में औपचारिक रूप देकर मशीन लर्निंग सिस्टम के लिए तीव्र, फुल-स्टैक आर्किटेक्चरल तर्क को सक्षम बनाता है, जो यूनिट अखंडता और उत्पत्ति ट्रैकिंग सुनिश्चित करते हुए कम्प्यूटेशनल मांग को हार्डवेयर आपूर्ति से अलग करता है।

Vijay Janapa Reddi2026-07-07
🤖 AI

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

यह सर्वेक्षण चार प्रमुख अक्षों के आधार पर LLM सर्विंग के लिए तीस से अधिक KV कैश प्रबंधन प्रणालियों को पांच वास्तुशिल्प प्रोटोटाइप (archetypes) में वर्गीकृत करता है, स्वामित्व को डिजाइन भिन्नता के प्राथमिक चालक के रूप में पहचानता है, और सात महत्वपूर्ण मापन अंतराल को रेखांकित करता है जो फॉल्ट टॉलरेंस, आइसोलेशन और उन्नत सर्विंग तकनीकों की प्रगति में बाधा डालते हैं।

Jie Li, Tongyang Wang, Yong Chen2026-07-07
📊 statistics

CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation

CORA एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है जो SVD आधारों (bases) पर प्रति-स्लाइस सुसंगत ऑर्थोगोनल रोटेशन और डायगोनल स्पेक्ट्रम शिफ्ट लागू करके प्रीट्रेन्ड वेट्स को अनुकूलित करती है, जिससे कम से कम प्रशिक्षण योग्य पैरामीटर्स का उपयोग करते हुए LoRA जैसी मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Pengcheng Wang, Ziran Liu, Wei Wang, Wei Jiang2026-07-07
🤖 machine learning

Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits

यह शोध पत्र तर्क देता है कि एआई (AI) मॉडलों के लिए विक्षोभ-आधारित (perturbation-based) रचना-वैधता ऑडिट (construct-validity audits) नाजुक हैं और मौन कार्यान्वयन विफलताओं के प्रति संवेदनशील हैं, जो गैर-पुष्टिपरक साक्ष्य को रोकने के लिए एक छह-बिंदु ड्यू-डिलिजेंस गेट का प्रस्ताव करता है और साथ ही यह प्रदर्शित करता है कि सुरक्षा बेंचमार्क और ओपन-वेट मॉडलों का एक विशिष्ट केस स्टडी ऑडिट विफलता के पांच मोड के इस नए वर्गीकरण के तहत पुष्टि मानकों को पूरा करने में विफल रहता है।

Yanhang Li, Zhichao Fan, Zexin Zhuang2026-07-07
🤖 machine learning

The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

यह शोध पत्र चार ओपन-सोर्स एलएलएम (LLM) रिलीज़ लाइनों के एक अनुदैर्ध्य ऑडिट (longitudinal audit) के माध्यम से यह प्रदर्शित करता है कि विश्वसनीयता स्कोर (trustworthiness scores) क्रमिक चेकपॉइंट्स के दौरान महत्वपूर्ण रूप से विचलित होते हैं, और यह तर्क देता है कि ऐसे मेट्रिक्स को पुनर्मूल्यांकन के बिना आगे ले जाए जाने वाले स्थिर गुणों के बजाय, दिनांकित और चेकपॉइंट-विशिष्ट आर्टिफ़ैक्ट्स के रूप में माना जाना चाहिए।

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang2026-07-07
🤖 machine learning

Scaling Weisfeiler-Leman Expressiveness Analysis to Massive Graphs with GPUs

यह शोध पत्र एक रैंडमाइज्ड रिफाइनमेंट एल्गोरिदम और एक शुद्धता-संरक्षण बैचिंग स्कीम को पेश करते हुए विशाल ग्राफों के लिए वीज़फाइलर-लेमैन स्थिर कलरिंग की गणना करने हेतु एक GPU-त्वरित दृष्टिकोण प्रस्तुत करता है, जो दो क्रमों (orders of magnitude) तक की गति वृद्धि प्राप्त करता है और 30 बिलियन से अधिक किनारों वाले वेब-स्केल ग्राफों के विश्लेषण को सक्षम बनाता है जो पहले अव्यवहार्य थे।

Filippo Biondi, Mirco Tribastone, Max Tschaikowski2026-07-07
⚡ electrical engineering

Evaluating Time Series Foundation Models for Electricity Price Forecasting: Contamination Risk, Distributional Shifts, and Covariate Dependence

यह शोध पत्र बिजली की कीमतों के पूर्वानुमान के लिए टाइम सीरीज़ फाउंडेशन मॉडल्स का मूल्यांकन करने हेतु एक संदूषण-न्यूनतम (contamination-mitigated) बेंचमार्किंग फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि ये मॉडल प्रतिस्पर्धी हैं और कोवेरिएट सपोर्ट से लाभान्वित होते हैं, वे लगातार डोमेन-विशिष्ट विधियों से बेहतर प्रदर्शन नहीं करते हैं, जिससे यह सुझाव मिलता है कि दोनों दृष्टिकोणों का संयोजन सबसे आशाजनक परिणाम देता है।

Zhenghua Pan, Ahmed Aziz Ezzat2026-07-07
💬 NLP

GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech

GRAFT एक ज़ीरो-शॉट टेक्स्ट-टू-स्पीच सिस्टम है जो दुर्लभ और कठिन शब्दों के उच्चारण की सटीकता को महत्वपूर्ण रूप से सुधारने के लिए ग्राफ़्टेड रेफरेंस ऑडियो के साथ प्रति-शब्द कंडिशनिंग मैकेनिज्म का उपयोग करता है, जबकि प्राकृतिकता और वक्ता की समानता को बनाए रखता है।

Antonis Asonitis, Francesco Verdini, Aref Farhadipour, Vijeta Avijeet, Pierre-Edouard Honnet, Marzieh Razavi, Juan Pablo (…)2026-07-07