🤖 machine learning

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge एक हार्डवेयर-जागरूक न्यूरल आर्किटेक्चर सर्च फ्रेमवर्क है जो विशिष्ट एज डिवाइस बाधाओं के अनुरूप अनुकूलित सब-बिलियन-पैरामीटर लैंग्वेज मॉडल्स को स्वचालित रूप से उत्पन्न करने के लिए इनफिनिट-हेड अटेंशन और एक मल्टी-बैकएंड कॉस्ट मॉडल का लाभ उठाता है, जो मौजूदा बेसलाइनों की तुलना में ऊर्जा दक्षता, लेटेंसी और मॉडल सटीकता में महत्वपूर्ण सुधार प्राप्त करता है।

Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane2026-05-19
🤖 machine learning

Bug or Feature2^2: Weight Drift, Activation Sparsity, and Spikes

यह शोध पत्र मानक नुकसान (losses) और धनात्मक रूप से पक्षपाती सक्रियणों (positively biased activations) के बीच की अंतःक्रिया के कारण होने वाले एक मौलिक ऋणात्मक भार विचलन (negative weight drift) की पहचान करता है, जो गहरे नेटवर्क में उच्च सक्रियण विरलता (activation sparsity) और सटीकता की गिरावट (accuracy cliffs) को प्रेरित करता है, जिससे लेखक विरलता, स्थिरता और प्रदर्शन को संतुलित करने वाले प्रभावी समाधान के रूप में क्लिप्ड ReLU2^2 और GELU2^2 का प्रस्ताव करते हैं।

Egor Shvetsov, Aleksandr Serkov, Shokorov Viacheslav, Redko Dmitry, Vladislav Goloshchapov, Evgeny Burnaev2026-05-19
📊 statistics

Training Infinitely Deep and Wide Transformers

यह शोध पत्र उनके गतिकी को एक न्यूरल PDE के रूप में मॉडल करके, फॉरवर्ड और बैकवर्ड पास की सुव्यवस्थितता (well-posedness) को सिद्ध करते हुए और यह प्रदर्शित करते हुए कि न्यूरल टेंगेंट कर्नेल (Neural Tangent Kernel) की इंजेक्टिविटी की विशिष्ट स्थितियों के तहत ग्रेडिएंट फ्लो वैश्विक न्यूनतम (global minima) की ओर अभिसरित होता है, मीन-फील्ड रिजीम में अनंत रूप से गहरे और चौड़े ट्रांसफॉर्मर्स को प्रशिक्षित करने के लिए एक कठोर गणितीय ढांचा स्थापित करता है।

Raphaël Barboni, Maarten V. de Hoop, Takashi Furuya, Gabriel Peyré2026-05-19
🤖 machine learning

PEIRA: Learning Predictive Encoders through Inter-View Regressor Alignment

यह शोध पत्र PEIRA को प्रस्तुत करता है, जो एक नॉन-कॉन्ट्रास्टिव सेल्फ-सुपरवाइज्ड लर्निंग विधि है जो एक इष्टतम लीनियर रिग्रेसर के ट्रेस (trace) के माध्यम से एक सुपरिभाषित उद्देश्य स्थापित करती है ताकि स्थिर, नॉन-कोलैप्स्ड ट्रेनिंग डायनेमिक्स सुनिश्चित किया जा सके जो अग्रणी नॉनलीनियर कैनोनिकल कोरिलेशन सबस्पेस के साथ संरेखित हो, जिससे ImageNet-1K और CIFAR-10 पर प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Michael Arbel, Basile Terver, Jean Ponce2026-05-19
🤖 machine learning

Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces

यह शोध पत्र मार्केटप्लेस में स्वायत्त एलएलएम (LLM) एजेंटों के आर्थिक संरेखण का मूल्यांकन करने और उसे सुधारने के लिए 'एजेंट बाज़ार' (Agent Bazaar) ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जबकि अत्याधुनिक मॉडल अक्सर एल्गोरिदम संबंधी अस्थिरता और सिबिल धोखे (Sybil deception) जैसे प्रणालीगत जोखिमों को रोकने में विफल रहते हैं, एक अनुकूलनशील पाठ्यक्रम (adaptive curriculum) के साथ लक्षित सुदृढीकरण शिक्षण (reinforcement learning) एक 9B मॉडल का निर्माण कर सकता है जो बाजार की स्थिरता और अखंडता को बनाए रखने में मौजूदा मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है।

Seth Karten, Cameron Crow, Chi Jin2026-05-19
🤖 machine learning

Toy Combinatorial Interpretability Models Reveal Lottery Tickets in Early Feature Space

यह शोधपत्र यह प्रदर्शित करता है कि एक कॉम्बिनेटोरियल टॉय सेटिंग में, विनिंग लॉटरी टिकट फीचर-स्पेस के उन संगत स्थानों के परिवारों के अनुरूप होते हैं जो इनिशियलाइजेशन के समय ही अंतिम कोड्स के समीप होते हैं, जिससे यह सुझाव मिलता है कि लॉटरी टिकट घटना विशिष्ट वेट-स्पेस सबनेटवर्क पहचानों के बजाय छिपी हुई फीचर-स्पेस ज्यामिति द्वारा नियंत्रित होती है।

Alon Bebchuk, Nir Shavit2026-05-19
📊 statistics

How does feature learning reshape the function space?

यह शोधपत्र यह प्रदर्शित करता है कि दो-परत वाले न्यूरल नेटवर्क में प्रारंभिक-चरण का फीचर लर्निंग (feature learning), फीचर वितरण को एक लक्ष्य-निर्भर स्पाइक्ड गॉसियन (target-dependent spiked Gaussian) में परिवर्तित करके प्रेरित फंक्शन स्पेस (induced function space) को मौलिक रूप से नया रूप देता है, जो एक डेटा-अनुकूलित कर्नेल (data-adaptive kernel) निर्मित करता है जो केवल एक निश्चित कर्नेल को पुन: स्केल करने के बजाय सिग्नल-संरेखित दिशाओं को चुनिंदा रूप से प्रवर्धित करता है और आइगेनफंक्शंस (eigenfunctions) को मिश्रित करता है।

João Lobo, Bruno Loureiro, Long Tran-Than, Fanghui Liu2026-05-19
💰 quantitative finance

Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ

यह शोध पत्र यह प्रदर्शित करता है कि चार वर्षों के पांच-मिनट के OHLCV डेटा का उपयोग करके इंट्राडे MNQ फ्यूचर्स की दिशा का पूर्वानुमान लगाने के लिए न तो ग्रेडिएंट बूस्टिंग और न ही LSTM मॉडल 51.8% की बेस रेट से अधिक सांख्यिकीय रूप से महत्वपूर्ण भविष्य कहनेवाला सटीकता प्राप्त कर सकते हैं, जो यह सुझाव देता है कि ऐसे एकल-उपकरण डेटासेट विश्वसनीय अनुक्रमिक वित्तीय मशीन लर्निंग के लिए अपर्याप्त हैं।

Mathias Mesfin2026-05-19
💻 computer science

Divergence-Suppressing Couplings for Rectified Flow

यह शोध पत्र रेक्टिफाइड फ्लो (Rectified Flow) के लिए एक ऑफलाइन सुधार विधि प्रस्तावित करता है जो विकृत प्रक्षेप पथों (trajectories) को सीधा करने के लिए सीखे गए वेग क्षेत्र (velocity field) के अपसारी घटक (divergent component) को दबा देता है, जिससे इन्फरेंस लागत बढ़ाए बिना सिंथेटिक और इमेज बेंचमार्क दोनों पर जनरेशन की गुणवत्ता में सुधार होता है।

Yimeng Min, Carla P. Gomes2026-05-19
🤖 machine learning

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

OSCAR एक तैनात करने योग्य (deployable) 2-बिट KV कैश क्वांटाइजेशन विधि है जो अटेंशन-अलाइन्ड रोटेशन और क्लिपिंग थ्रेशोल्ड प्राप्त करने के लिए ऑफलाइन स्पेक्ट्रल कोवेरिएंस एस्टीमेशन का लाभ उठाती है, जो आधुनिक LLM सर्विंग फ्रेमवर्क में मेमोरी उपयोग को महत्वपूर्ण रूप से कम करने और इन्फरेंस थ्रूपुट में सुधार करने के साथ-साथ लॉन्ग-कॉन्टेक्स्ट रीजनिंग कार्यों पर लगभग लॉसलेस सटीकता सक्षम करती है।

Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu2026-05-19