📊 statistics

Inverse Depth Scaling From Most Layers Being Similar

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में लॉस (loss) गहराई के साथ व्युत्क्रमानुपाती (inversely) रूप से घटता है क्योंकि कार्यात्मक रूप से समान परतें एक अक्षम लेकिन सुदृढ़ एन्सेम्बल (ensemble) के रूप में कार्य करती हैं, जो यह सुझाव देता है कि अधिक प्रभावी संरचनात्मक गहराई उपयोग को सक्षम करने के लिए भविष्य के आर्किटेक्चरल नवाचारों की आवश्यकता है।

Yizhou Liu, Sara Kangaslahti, Ziming Liu, Jeff Gore2026-06-02
📊 statistics

Sharpness-Aware Hybrid Model Learning for Architecture-Agnostic Parameter Estimation

यह शोध पत्र एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) हाइब्रिड मॉडलिंग फ्रेमवर्क प्रस्तावित करता है जो लॉस लैंडस्केप की सपाटता को लागू करने के लिए शार्पनेस-अवेयर मिनिमाइजेशन (Sharpness-Aware Minimization) का लाभ उठाता है, जिससे वैज्ञानिक मापदंडों का सटीक अनुमान सुनिश्चित होता है और मशीन लर्निंग घटकों को अंतर्निहित भौतिक मॉडलों पर हावी होने से रोका जा सके।

Naoya Takeishi2026-06-02
🤖 machine learning

Vegas: Self-Speculative Decoding with Verification-Guided Sparse Attention

वेगास (Vegas) एक स्व-अनुमानित डिकोडिंग (self-speculative decoding) विधि है जो सत्यापन-निर्देशित विरल ध्यान (verification-guided sparse attention) का लाभ उठाकर सत्यापन प्रक्रिया के एक उपोत्पाद के रूप में महत्वपूर्ण KV कैश प्रविष्टियों की पहचान करती है, जिससे मौजूदा दृष्टिकोणों की तुलना में न्यूनतम ओवरहेड के साथ ड्राफ्ट टोकन स्वीकृति दरों और डिकोडिंग थ्रूपुट में सुधार होता है।

Yikang Yue, Yuqi Xue, Jian Huang2026-06-02
🤖 machine learning

Learning To Sample From Diffusion Models Via Inverse Reinforcement Learning

यह शोध पत्र एक इनवर्स रिइन्फोर्समेंट लर्निंग फ्रेमवर्क पेश करता है जो डिफ्यूजन मॉडल सैंपलिंग को एक मार्कोव डिसीजन प्रोसेस के रूप में स्वरूपित करता है ताकि बिना डिनॉइज़र को पुन: प्रशिक्षित किए स्वचालित रूप से इष्टतम सैंपलिंग रणनीतियों को सीखा जा सके, जिससे पारंपरिक ग्रिड सर्च की तुलना में काफी कम लागत पर फाइन-ट्यून किए गए सैंपलर्स के समान प्रदर्शन प्राप्त होता है।

Constant Bourdrez, Alexandre Vérine, Olivier Cappé2026-06-02
📊 statistics

The Entropic Signature of Class Speciation in Diffusion Models

यह शोध पत्र उन विशिष्ट शोर व्यवस्थाओं (noise regimes) की पहचान करने के लिए एक क्लास-कंडीशनल एंट्रॉपी मीट्रिक प्रस्तुत करता है जहाँ डिफ्यूजन मॉडल सिमेंटिक स्पीशिएशन (semantic speciation) से गुजरते हैं, जो उच्च-आयामी गॉसियन मिश्रणों और EDM2-XS एवं स्टेबल डिफ्यूजन 1.5 जैसे वास्तविक दुनिया के मॉडलों में सिमेंटिक संरचना निर्माण के सिद्धांतपूर्ण, समय-स्थानीय नियंत्रण को सक्षम करने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Florian Handke, Dejan Stančević, Felix Koulischer, Thomas Demeester, Luca Ambrogioni2026-06-02
📊 statistics

WildCat: Near-Linear Attention in Theory and Practice

WildCat एक उच्च-सटीक, कम-लागत वाली अटेंशन कम्प्रेशन विधि है जो रैंडमली पिवोटेड चोलेस्की सबसैंपलिंग के माध्यम से एक छोटे कोरेसेट (coreset) का चयन और उसे भारित करके लगभग रैखिक समय जटिलता (near-linear time complexity) और सुपर-पॉलीनोमियल एरर डिके (super-polynomial error decay) प्राप्त करती है, जो इमेज और लैंग्वेज टास्क में सैद्धांतिक गारंटी और व्यावहारिक प्रदर्शन दोनों में पूर्ववर्ती एप्रोक्सिमेशन से बेहतर प्रदर्शन करती है।

Tobias Schröder, Lester Mackey2026-06-02
🤖 machine learning

Both Topology and Text Matter: Revisiting LLM-guided Out-of-Distribution Detection on Text-attributed Graphs

यह शोध पत्र LG-Plug का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो टोपोलॉजी और टेक्स्ट रिप्रजेंटेशन को प्रभावी ढंग से संरेखित करने के लिए LLM-निर्देशित, सर्वसम्मति-संचालित OOD एक्सपोज़र का लाभ उठाता है, जिससे टेक्स्ट-एट्रिब्यूटेड ग्राफ पर आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन प्रदर्शन में महत्वपूर्ण सुधार होता है और मौजूदा विधियों की विश्वसनीयता और अनुकूलता संबंधी सीमाओं को दूर किया जाता है।

Yinlin Zhu, Di Wu, Xu Wang, Guocong Quan, Miao Hu2026-06-02
💬 NLP

Prototype Transformer: Towards Language Model Architectures Interpretable by Design

यह शोध पत्र प्रोटोटाइप ट्रांसफॉर्मर (ProtoT) को प्रस्तुत करता है, जो एक नवीन ऑटोरेग्रेसिव लैंग्वेज मॉडल आर्किटेक्चर है जो नामकरण योग्य अवधारणाओं (nameable concepts) को स्वतः कैप्चर करने के लिए क्वाड्रेटिक-कॉस्ट सेल्फ-अटेंशन को लीनियर-कॉस्ट प्रोटोटाइप-आधारित मॉड्यूल से बदल देता है, जिससे मजबूत प्रदर्शन और स्केलेबिलिटी बनाए रखते हुए व्याख्यात्मक तर्क (interpretable reasoning) सक्षम होता है।

Yordan Yordanov, Matteo Forasassi, Bayar Menzat, Ruizhi Wang, Chang Qi, Markus Kaltenberger, Amine M'Charrak, Tommaso Sa (…)2026-06-02
🤖 machine learning

PathCRF: Ball-Free Soccer Event Detection via Possession Path Inference from Player Trajectories

यह शोध पत्र PathCRF को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो केवल खिलाड़ी के प्रक्षेपवक्र (ट्रैजेक्टरी) डेटा का उपयोग करके ऑन-बॉल सॉकर घटनाओं का पता लगाता है और पजेशन पथों का पुनर्निर्माण करता है, जो इस समस्या को कंडीशनल रैंडम फील्ड्स के माध्यम से हल किए जाने वाले एक डायनेमिक ग्राफ सिलेक्शन कार्य के रूप में मॉडल करता है, जिससे महंगी और स्केल करने में कठिन बॉल ट्रैकिंग की आवश्यकता समाप्त हो जाती है।

Hyunsung Kim, Kunhee Lee, Sangwoo Seo, Sang-Ki Ko, Jinsung Yoon, Chanyoung Park2026-06-02