🤖 machine learning

Vegas: Self-Speculative Decoding with Verification-Guided Sparse Attention

वेगास (Vegas) एक स्व-अनुमानित डिकोडिंग (self-speculative decoding) विधि है जो सत्यापन-निर्देशित विरल ध्यान (verification-guided sparse attention) का लाभ उठाकर सत्यापन प्रक्रिया के एक उपोत्पाद के रूप में महत्वपूर्ण KV कैश प्रविष्टियों की पहचान करती है, जिससे मौजूदा दृष्टिकोणों की तुलना में न्यूनतम ओवरहेड के साथ ड्राफ्ट टोकन स्वीकृति दरों और डिकोडिंग थ्रूपुट में सुधार होता है।

Yikang Yue, Yuqi Xue, Jian Huang2026-06-02
🤖 machine learning

Learning To Sample From Diffusion Models Via Inverse Reinforcement Learning

यह शोध पत्र एक इनवर्स रिइन्फोर्समेंट लर्निंग फ्रेमवर्क पेश करता है जो डिफ्यूजन मॉडल सैंपलिंग को एक मार्कोव डिसीजन प्रोसेस के रूप में स्वरूपित करता है ताकि बिना डिनॉइज़र को पुन: प्रशिक्षित किए स्वचालित रूप से इष्टतम सैंपलिंग रणनीतियों को सीखा जा सके, जिससे पारंपरिक ग्रिड सर्च की तुलना में काफी कम लागत पर फाइन-ट्यून किए गए सैंपलर्स के समान प्रदर्शन प्राप्त होता है।

Constant Bourdrez, Alexandre Vérine, Olivier Cappé2026-06-02
📊 statistics

The Entropic Signature of Class Speciation in Diffusion Models

यह शोध पत्र उन विशिष्ट शोर व्यवस्थाओं (noise regimes) की पहचान करने के लिए एक क्लास-कंडीशनल एंट्रॉपी मीट्रिक प्रस्तुत करता है जहाँ डिफ्यूजन मॉडल सिमेंटिक स्पीशिएशन (semantic speciation) से गुजरते हैं, जो उच्च-आयामी गॉसियन मिश्रणों और EDM2-XS एवं स्टेबल डिफ्यूजन 1.5 जैसे वास्तविक दुनिया के मॉडलों में सिमेंटिक संरचना निर्माण के सिद्धांतपूर्ण, समय-स्थानीय नियंत्रण को सक्षम करने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Florian Handke, Dejan Stančević, Felix Koulischer, Thomas Demeester, Luca Ambrogioni2026-06-02
📊 statistics

WildCat: Near-Linear Attention in Theory and Practice

WildCat एक उच्च-सटीक, कम-लागत वाली अटेंशन कम्प्रेशन विधि है जो रैंडमली पिवोटेड चोलेस्की सबसैंपलिंग के माध्यम से एक छोटे कोरेसेट (coreset) का चयन और उसे भारित करके लगभग रैखिक समय जटिलता (near-linear time complexity) और सुपर-पॉलीनोमियल एरर डिके (super-polynomial error decay) प्राप्त करती है, जो इमेज और लैंग्वेज टास्क में सैद्धांतिक गारंटी और व्यावहारिक प्रदर्शन दोनों में पूर्ववर्ती एप्रोक्सिमेशन से बेहतर प्रदर्शन करती है।

Tobias Schröder, Lester Mackey2026-06-02
🤖 machine learning

Both Topology and Text Matter: Revisiting LLM-guided Out-of-Distribution Detection on Text-attributed Graphs

यह शोध पत्र LG-Plug का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो टोपोलॉजी और टेक्स्ट रिप्रजेंटेशन को प्रभावी ढंग से संरेखित करने के लिए LLM-निर्देशित, सर्वसम्मति-संचालित OOD एक्सपोज़र का लाभ उठाता है, जिससे टेक्स्ट-एट्रिब्यूटेड ग्राफ पर आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन प्रदर्शन में महत्वपूर्ण सुधार होता है और मौजूदा विधियों की विश्वसनीयता और अनुकूलता संबंधी सीमाओं को दूर किया जाता है।

Yinlin Zhu, Di Wu, Xu Wang, Guocong Quan, Miao Hu2026-06-02
💬 NLP

Prototype Transformer: Towards Language Model Architectures Interpretable by Design

यह शोध पत्र प्रोटोटाइप ट्रांसफॉर्मर (ProtoT) को प्रस्तुत करता है, जो एक नवीन ऑटोरेग्रेसिव लैंग्वेज मॉडल आर्किटेक्चर है जो नामकरण योग्य अवधारणाओं (nameable concepts) को स्वतः कैप्चर करने के लिए क्वाड्रेटिक-कॉस्ट सेल्फ-अटेंशन को लीनियर-कॉस्ट प्रोटोटाइप-आधारित मॉड्यूल से बदल देता है, जिससे मजबूत प्रदर्शन और स्केलेबिलिटी बनाए रखते हुए व्याख्यात्मक तर्क (interpretable reasoning) सक्षम होता है।

Yordan Yordanov, Matteo Forasassi, Bayar Menzat, Ruizhi Wang, Chang Qi, Markus Kaltenberger, Amine M'Charrak, Tommaso Sa (…)2026-06-02
🤖 machine learning

PathCRF: Ball-Free Soccer Event Detection via Possession Path Inference from Player Trajectories

यह शोध पत्र PathCRF को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो केवल खिलाड़ी के प्रक्षेपवक्र (ट्रैजेक्टरी) डेटा का उपयोग करके ऑन-बॉल सॉकर घटनाओं का पता लगाता है और पजेशन पथों का पुनर्निर्माण करता है, जो इस समस्या को कंडीशनल रैंडम फील्ड्स के माध्यम से हल किए जाने वाले एक डायनेमिक ग्राफ सिलेक्शन कार्य के रूप में मॉडल करता है, जिससे महंगी और स्केल करने में कठिन बॉल ट्रैकिंग की आवश्यकता समाप्त हो जाती है।

Hyunsung Kim, Kunhee Lee, Sangwoo Seo, Sang-Ki Ko, Jinsung Yoon, Chanyoung Park2026-06-02
🤖 machine learning

Towards Sparse Video Understanding and Reasoning

यह शोध पत्र \revise को प्रस्तुत करता है, जो वीडियो प्रश्न उत्तर (video question answering) के लिए एक मल्टी-राउंड एजेंट है जो विरल सूचनात्मक फ्रेम (sparse informative frames) चुनने, एक सारांश अवस्था (summary state) बनाए रखने और अर्ली स्टॉपिंग (early stopping) को नियोजित करने के साथ-साथ सुदृढीकरण फाइन-ट्यूनिंग (reinforcement fine-tuning) के लिए EAGER एनोटेशन-फ्री रिवॉर्ड मैकेनिज्म के माध्यम से दक्षता और सटीकता में सुधार करता है।

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Li (…)2026-06-02
📊 statistics

How Accurately Can a Gaussian Approximate Stochastic Approximation Iterates?

यह शोधपत्र इटरेट्स (iterates) और पुनरावर्ती रूप से परिभाषित गासियनों (Gaussians) की एक श्रृंखला के बीच त्रुटि गतिकी (error dynamics) का विश्लेषण करके, इटरेट्स और एक विविक्त ऑर्नस्टीन-उलेंबैक प्रक्रिया (discrete Ornstein-Uhlenbeck process) के बीच त्रुटि का विश्लेषण करते हुए, स्टोकेस्टिक एप्रोक्सिमेशन इटरेट्स के सन्निकटन के लिए स्पष्ट परिमित-समय वासरस्टीन-1 (Wasserstein-1) सीमाएं स्थापित करता है, जिससे एसिम्प्टोटिक नॉर्मैलिटी (asymptotic normality) के लिए तीक्ष्ण टेल बाउंड्स (tail bounds) और अभिसरण दरें (convergence rates) प्राप्त होती हैं।

Shaan Ul Haque, Zedong Wang, Zixuan Zhang, Siva Theja Maguluri2026-06-02