cs.LG
22999 पेपर
Vegas: Self-Speculative Decoding with Verification-Guided Sparse Attention
वेगास (Vegas) एक स्व-अनुमानित डिकोडिंग (self-speculative decoding) विधि है जो सत्यापन-निर्देशित विरल ध्यान (verification-guided sparse attention) का लाभ उठाकर सत्यापन प्रक्रिया के एक उपोत्पाद के रूप में महत्वपूर्ण KV कैश प्रविष्टियों की पहचान करती है, जिससे मौजूदा दृष्टिकोणों की तुलना में न्यूनतम ओवरहेड के साथ ड्राफ्ट टोकन स्वीकृति दरों और डिकोडिंग थ्रूपुट में सुधार होता है।
Learning To Sample From Diffusion Models Via Inverse Reinforcement Learning
यह शोध पत्र एक इनवर्स रिइन्फोर्समेंट लर्निंग फ्रेमवर्क पेश करता है जो डिफ्यूजन मॉडल सैंपलिंग को एक मार्कोव डिसीजन प्रोसेस के रूप में स्वरूपित करता है ताकि बिना डिनॉइज़र को पुन: प्रशिक्षित किए स्वचालित रूप से इष्टतम सैंपलिंग रणनीतियों को सीखा जा सके, जिससे पारंपरिक ग्रिड सर्च की तुलना में काफी कम लागत पर फाइन-ट्यून किए गए सैंपलर्स के समान प्रदर्शन प्राप्त होता है।
The Entropic Signature of Class Speciation in Diffusion Models
यह शोध पत्र उन विशिष्ट शोर व्यवस्थाओं (noise regimes) की पहचान करने के लिए एक क्लास-कंडीशनल एंट्रॉपी मीट्रिक प्रस्तुत करता है जहाँ डिफ्यूजन मॉडल सिमेंटिक स्पीशिएशन (semantic speciation) से गुजरते हैं, जो उच्च-आयामी गॉसियन मिश्रणों और EDM2-XS एवं स्टेबल डिफ्यूजन 1.5 जैसे वास्तविक दुनिया के मॉडलों में सिमेंटिक संरचना निर्माण के सिद्धांतपूर्ण, समय-स्थानीय नियंत्रण को सक्षम करने में इसकी प्रभावशीलता को प्रदर्शित करता है।
WildCat: Near-Linear Attention in Theory and Practice
WildCat एक उच्च-सटीक, कम-लागत वाली अटेंशन कम्प्रेशन विधि है जो रैंडमली पिवोटेड चोलेस्की सबसैंपलिंग के माध्यम से एक छोटे कोरेसेट (coreset) का चयन और उसे भारित करके लगभग रैखिक समय जटिलता (near-linear time complexity) और सुपर-पॉलीनोमियल एरर डिके (super-polynomial error decay) प्राप्त करती है, जो इमेज और लैंग्वेज टास्क में सैद्धांतिक गारंटी और व्यावहारिक प्रदर्शन दोनों में पूर्ववर्ती एप्रोक्सिमेशन से बेहतर प्रदर्शन करती है।
Both Topology and Text Matter: Revisiting LLM-guided Out-of-Distribution Detection on Text-attributed Graphs
यह शोध पत्र LG-Plug का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो टोपोलॉजी और टेक्स्ट रिप्रजेंटेशन को प्रभावी ढंग से संरेखित करने के लिए LLM-निर्देशित, सर्वसम्मति-संचालित OOD एक्सपोज़र का लाभ उठाता है, जिससे टेक्स्ट-एट्रिब्यूटेड ग्राफ पर आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन प्रदर्शन में महत्वपूर्ण सुधार होता है और मौजूदा विधियों की विश्वसनीयता और अनुकूलता संबंधी सीमाओं को दूर किया जाता है।
Prototype Transformer: Towards Language Model Architectures Interpretable by Design
यह शोध पत्र प्रोटोटाइप ट्रांसफॉर्मर (ProtoT) को प्रस्तुत करता है, जो एक नवीन ऑटोरेग्रेसिव लैंग्वेज मॉडल आर्किटेक्चर है जो नामकरण योग्य अवधारणाओं (nameable concepts) को स्वतः कैप्चर करने के लिए क्वाड्रेटिक-कॉस्ट सेल्फ-अटेंशन को लीनियर-कॉस्ट प्रोटोटाइप-आधारित मॉड्यूल से बदल देता है, जिससे मजबूत प्रदर्शन और स्केलेबिलिटी बनाए रखते हुए व्याख्यात्मक तर्क (interpretable reasoning) सक्षम होता है।
PathCRF: Ball-Free Soccer Event Detection via Possession Path Inference from Player Trajectories
यह शोध पत्र PathCRF को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो केवल खिलाड़ी के प्रक्षेपवक्र (ट्रैजेक्टरी) डेटा का उपयोग करके ऑन-बॉल सॉकर घटनाओं का पता लगाता है और पजेशन पथों का पुनर्निर्माण करता है, जो इस समस्या को कंडीशनल रैंडम फील्ड्स के माध्यम से हल किए जाने वाले एक डायनेमिक ग्राफ सिलेक्शन कार्य के रूप में मॉडल करता है, जिससे महंगी और स्केल करने में कठिन बॉल ट्रैकिंग की आवश्यकता समाप्त हो जाती है।
Towards Sparse Video Understanding and Reasoning
यह शोध पत्र \revise को प्रस्तुत करता है, जो वीडियो प्रश्न उत्तर (video question answering) के लिए एक मल्टी-राउंड एजेंट है जो विरल सूचनात्मक फ्रेम (sparse informative frames) चुनने, एक सारांश अवस्था (summary state) बनाए रखने और अर्ली स्टॉपिंग (early stopping) को नियोजित करने के साथ-साथ सुदृढीकरण फाइन-ट्यूनिंग (reinforcement fine-tuning) के लिए EAGER एनोटेशन-फ्री रिवॉर्ड मैकेनिज्म के माध्यम से दक्षता और सटीकता में सुधार करता है।
How Accurately Can a Gaussian Approximate Stochastic Approximation Iterates?
यह शोधपत्र इटरेट्स (iterates) और पुनरावर्ती रूप से परिभाषित गासियनों (Gaussians) की एक श्रृंखला के बीच त्रुटि गतिकी (error dynamics) का विश्लेषण करके, इटरेट्स और एक विविक्त ऑर्नस्टीन-उलेंबैक प्रक्रिया (discrete Ornstein-Uhlenbeck process) के बीच त्रुटि का विश्लेषण करते हुए, स्टोकेस्टिक एप्रोक्सिमेशन इटरेट्स के सन्निकटन के लिए स्पष्ट परिमित-समय वासरस्टीन-1 (Wasserstein-1) सीमाएं स्थापित करता है, जिससे एसिम्प्टोटिक नॉर्मैलिटी (asymptotic normality) के लिए तीक्ष्ण टेल बाउंड्स (tail bounds) और अभिसरण दरें (convergence rates) प्राप्त होती हैं।