💬 NLP

Fast Byte Latent Transformer

बाइट लेटेंट ट्रांसफॉर्मर (BLT), BLT-Diffusion, BLT-Self-speculation और BLT-Diffusion+Verification जैसे तीन नवीन वेरिएंट्स को पेश करके बाइट-लेवल लैंग्वेज मॉडल्स की धीमी जनरेशन बाधा को संबोधित करता है, जो उच्च गुणवत्ता बनाए रखते हुए इन्फरेंस लेटेंसी और मेमोरी-बैंडविड्थ लागत को महत्वपूर्ण रूप से कम करने के लिए समानांतर जनरेशन और स्पेक्युलेटिव डिकोडिंग तकनीकों का लाभ उठाते हैं।

Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, S (…)2026-05-11
🤖 machine learning

GRAPHLCP: Structure-Aware Localized Conformal Prediction on Graphs

यह शोध पत्र GRAPHLCP का प्रस्ताव करता है, जो ग्राफ न्यूरल नेटवर्क के लिए एक संरचना-जागरूक स्थानीयकृत कॉन्फॉर्मल प्रेडिक्शन फ्रेमवर्क है, जो बेहतर सशर्त कवरेज के साथ कुशल, परिमित-नमूना गारंटीकृत अनिश्चितता परिमाणीकरण प्राप्त करने के लिए फीचर-जागरूक डेंसिफिकेशन और पर्सनलाइज्ड पेजरैंक-आधारित कर्नेल के माध्यम से ग्राफ टोपोलॉजी और इंटर-नोड निर्भरताओं को एकीकृत करता है।

Peyman Baghershahi, Fangxin Wang, Debmalya Mandal, Sourav Medya2026-05-11
🤖 machine learning

Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols

यह शोध पत्र "AI-Control Games" प्रस्तुत करता है, जो एक औपचारिक बहु-उद्देश्यीय आंशिक रूप से अवलोकन योग्य स्टोकेस्टिक गेम फ्रेमवर्क है, जो अविश्वसनीय AI प्रणालियों को तैनात करने के लिए इष्टतम सुरक्षा प्रोटोकॉल का गणितीय मूल्यांकन और संश्लेषण करने हेतु रेड-टीमिंग अभ्यासों को मॉडल करता है, और प्रोग्रामिंग सहायता जैसे परिदृश्यों में अनुभवजन्य विधियों की तुलना में बेहतर प्रभावकारिता प्रदर्शित करता है।

Charlie Griffin, Louis Thomson, Buck Shlegeris, Alessandro Abate2026-05-08
🔬 applied physics

An information-matching approach to optimal experimental design and active learning

यह योगदान एक स्केलेबल, कॉनवेक्स ऑप्टिमाइज़ेशन-आधारित सूचना संरेखण दृष्टिकोण प्रस्तुत करता है जो रुचि की मात्राओं (quantities of interest) की सटीक भविष्यवाणी करने के लिए न्यूनतम, उच्च-गुणवत्ता वाले प्रशिक्षण डेटा का चयन करने हेतु फिशर सूचना मैट्रिक्स का लाभ उठाता है, जिससे विविध वैज्ञानिक मॉडलिंग और सक्रिय शिक्षण अनुप्रयोगों में डेटा की कमी और पैरामीटर गैर-पहचान क्षमता (parameter non-identifiability) को संबोधित किया जा सके।

Yonatan Kurniawan, Tracianne B. Neilsen, Benjamin L. Francis, Alex M. Stankovic, Mingjian Wen, Ilia Nikiforov, Ellad B. (…)2026-05-08
⚛️ phenomenology

Pretrained Event Classification Model for High Energy Physics Analysis

यह शोध पत्र एक ग्राफ न्यूरल नेटवर्क-आधारित फाउंडेशन मॉडल पेश करता है जिसे 120 मिलियन सिम्युलेटेड हाई-एनर्जी फिजिक्स इवेंट्स पर प्रीट्रेन किया गया है, जो फाइन-ट्यून होने पर विविध कार्यों और सिमुलेशन फ्रेमवर्क में इवेंट क्लासिफिकेशन की सटीकता और दक्षता में महत्वपूर्ण सुधार करता है और यह प्रकट करता है कि प्रदर्शन में लाभ सामान्य-उद्देश्य वाले एनकोडर्स को संरक्षित करते हुए नए मैसेज-पासिंग पाथवे विकसित करने से उत्पन्न होते हैं।

Joshua Ho, Benjamin Ryan Roberts, Shuo Han, Haichen Wang2026-05-08
🤖 machine learning

Mono-Forward: Revisiting Forward-Forward through Objective-Locality Decomposition

यह शोध पत्र Mono-Forward को प्रस्तुत करता है, जो एक स्थानीय शिक्षण एल्गोरिदम है जो फॉरवर्ड-फॉरवर्ड एल्गोरिदम के कंट्रास्टिव गुडनेस ऑब्जेक्टिव को एक मानक क्रॉस-एन्ट्रॉपी लॉस से बदल देता है, यह प्रदर्शित करते हुए कि यह संशोधन न केवल वैनिला फॉरवर्ड-फॉरवर्ड की तुलना में सटीकता में सुधार करता है बल्कि बैकप्रोपैगेशन के साथ प्रतिस्पर्धी या बेहतर प्रदर्शन भी प्राप्त करता है और मेमोरी ओवरहेड को काफी कम करता है।

James Gong, Bruce Li, Waleed Abdulla2026-05-08
📊 statistics

Two-Point Deterministic Equivalence for Stochastic Gradient Dynamics in Linear Models

यह लेख रैंडम मैट्रिसेस के रेज़ोल्वेंट्स (resolvents) के टू-पॉइंट फंक्शन के लिए एक नए डिटरमिनिस्टिक इक्विवेलेंट (deterministic equivalent) को प्रस्तुत करता है ताकि स्टोकेस्टिक ग्रेडिएंट डिसेंट के साथ प्रशिक्षित विभिन्न उच्च-आयामी रैखिक मॉडलों के प्रदर्शन का विश्लेषण करने के लिए एक एकीकृत ढांचा स्थापित किया जा सके।

Alexander Atanasov, Blake Bordelon, Jacob A. Zavatone-Veth, Courtney Paquette, Cengiz Pehlevan2026-05-08
🤖 machine learning

Learning the symmetric group: large from small

यह लेख एक स्केलेबल मशीन लर्निंग पद्धति प्रस्तावित करता है जिसमें विशिष्ट ट्रांसपोज़िशन रणनीतियों का उपयोग करके छोटे सममित समूहों (जैसे कि S10S_{10}) में क्रमपरिवर्तन (permutations) की भविष्यवाणी करने के लिए प्रशिक्षित ट्रांसफॉर्मर मॉडल, डेटा जनरेशन और व्याख्यात्मकता की चुनौतियों को संबोधित करने के लिए आइडेंटिटी ऑग्मेंटेशन और पार्टीशन विंडो जैसी तकनीकों का उपयोग करते हुए, काफी बड़े समूहों (जैसे कि S25S_{25}) में लगभग पूर्ण सटीकता के साथ सामान्यीकरण करते हैं।

Max Petschack, Alexandr Garbali, Jan de Gier2026-05-08
🤖 machine learning

Teaching Metric Distance to Discrete Autoregressive Language Models

यह शोध पत्र DIST2Loss प्रस्तुत करता है, जो एक दूरी-जागरूक (distance-aware) ऑब्जेक्टिव फंक्शन है जो डिस्क्रीट ऑटोरेग्रेसिव लैंग्वेज मॉडल्स के लिए पारंपरिक वन-हॉट लक्ष्यों को रिवॉर्ड-वेटेड डिस्ट्रीब्यूशंस से बदल देता है ताकि टोकन्स के बीच मेट्रिक संबंधों का लाभ उठाकर विजुअल ग्राउंडिंग, रोबोटिक्स और इमेज जनरेशन जैसे विविध कार्यों में डेटा दक्षता और प्रदर्शन में सुधार किया जा सके।

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu2026-05-08
🤖 machine learning

Local-Order Auxiliary Losses Can Improve Autoencoder Reconstruction

यह शोध पत्र यह प्रदर्शित करता है कि मीन-स्क्वेयर्ड एरर (mean-squared error) के साथ 'फाइनाइट-डिफरेंस साइन एरर' (FDSE) नामक एक सरल, अवकलनीय (differentiable) स्थानीय-क्रम सहायक हानि (local-order auxiliary loss) को शामिल करने से सुसंगत स्थानिक क्षेत्रों (coherent spatial fields) के लिए सीमित-क्षमता वाले ऑटोएनकोडर्स में पॉइंटवाइज पुनर्निर्माण सटीकता में महत्वपूर्ण सुधार होता है, जो इस धारणा को चुनौती देता है कि संरचनात्मक उद्देश्यों को पिक्सेल-स्तरीय परिशुद्धता के विरुद्ध समझौता करना चाहिए।

Harvey Dam, Martin Burtscher, Tripti Agarwal, Ganesh Gopalakrishnan2026-05-08