🤖 machine learning

LEMUR 2: Unlocking Neural Network Diversity for AI

LEMUR 2 एक बड़े पैमाने के, विस्तार योग्य ढांचे को पेश करता है जो 14,000 से अधिक विविध न्यूरल आर्किटेक्चर को व्यापक प्रदर्शन मेटाडेटा के साथ उत्पन्न करने के लिए जनरेटिव, इवैलुएटिव और डिप्लॉयमेंट पाइपलाइनों को एकीकृत करता है, जिससे मल्टीमॉडल कार्यों और हेटेरोजेनियस हार्डवेयर में पुनरुत्पादक, डेटा-संचालित एआई डिज़ाइन और एलएलएम-संचालित ऑटोएमएल के लिए एक नया आधार स्थापित होता है।

Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvv (…)2026-07-09
📊 statistics

Tensor Train Diffusion: Leveraging Low-Rank Structures for High-Dimensional Score-Based Sampling

यह शोध पत्र टेंसर ट्रेन डिफ्यूजन (Tensor Train Diffusion) प्रस्तुत करता है, जो एक नवीन और कुशल सैंपलिंग विधि है जो डिफ्यूजन मॉडल के अंतर्निहित उच्च-आयामी हैमिल्टन-जैकोबी-बेलमैन (Hamilton-Jacobi-Bellman) समीकरण को हल करने के लिए कार्यात्मक टेंसर ट्रेन निरूपणों का लाभ उठाती है, जिससे मौजूदा तकनीकों की प्रशिक्षण अक्षमताओं और हाइपरपैरामीटर संवेदनशीलता पर विजय प्राप्त होती है।

Robert Gruhlke, Julius Berner, David Sommer, Lorenz Richter2026-07-09
💬 NLP

Geometric Self-Distillation for Reasoning Generalization

यह शोध पत्र GeoSD को प्रस्तुत करता है, जो एक ज्यामितीय स्व-डिस्टिलेशन (geometric self-distillation) ढांचा है जो मानक ऑन-पॉलिसी डिस्टिलेशन के कारण होने वाले आउट-ऑफ-डिस्ट्रीब्यूशन रीजनिंग ड्रिफ्ट (out-of-distribution reasoning drift) को कम करने के लिए हेलिंगर लॉस (Hellinger loss) और एक प्रॉक्सिमल फिशर-राओ पेनल्टी (proximal Fisher-Rao penalty) को नेचुरल-ग्रेडिएंट अपडेट्स के साथ जोड़ता है, जिससे विभिन्न मॉडल स्केल्स में जनरलाइजेशन में महत्वपूर्ण सुधार करते हुए इन-डिस्ट्रीब्यूशन प्रदर्शन को संरक्षित किया जा सके।

Josip Jukić, Ivan Titov2026-07-09
💻 computer science

Gen4U: Unifying Video Generation and Understanding via Diffusion

यह शोध पत्र Gen4U को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो वीडियो जनरेशन और समझ को एकीकृत करने के लिए फ्रोजन (frozen), बड़े पैमाने के वीडियो डिफ्यूजन मॉडल्स के स्ट्रक्चर्ड लेटेंट स्पेस का लाभ उठाता है, जिससे बिना फाइन-ट्यूनिंग के और जेनेरेटिव क्षमताओं को सुरक्षित रखते हुए विविध परसेप्शन कार्यों में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Michael King, Aravindh Mahendran, Matthew Koichi Grimes, Fedor Kitashov, Adham Elarabawy, Pedro Velez, Maks Ovsjanikov (…)2026-07-09
🔢 mathematics

Mathematical methods of reinforcement learning

यह सर्वेक्षण मार्कोव निर्णय प्रक्रियाओं (मार्कोव डिसीजन प्रोसेसेज) और बेलमैन ऑपरेटरों से लेकर स्टोकेस्टिक एप्रोक्सिमेशन और फंक्शन एप्रोक्सिमेशन तक की इसकी मुख्य संरचनाओं को प्रायिकता, अनुकूलन (ऑप्टिमाइज़ेशन) और ऑपरेटर सिद्धांत के चश्मे से व्यवस्थित करके आधुनिक सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) के लिए एक एकीकृत गणितीय ढांचा प्रदान करता है ताकि अभिसरण गारंटी (कन्वर्जेंस गारंटी) और परिमित-नमूना सीमाएं (फाइनाइट-सैंपल बाउंड्स) स्थापित की जा सकें।

Denis Belomestny, Alexander Gasnikov, Egor Gladin, Alexey Naumov, Artemy Rubtsov, Yuri Sapronov, Daniil Tiapkin, Nikita (…)2026-07-09
💬 NLP

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES एक स्व-सुधारित (self-improving) LLM रीजनिंग के लिए एक नवीन ढांचा है जो चरण-वार निर्देश युग्मों (step-wise instruction pairs) की एक मॉड्यूलर मेमोरी को गतिशील रूप से विस्तारित करता है और यथार्थवादी टेस्ट-टाइम बाधाओं के तहत मेमोरी संरचना और रीजनिंग सटीकता को अनुकूलित करने के लिए एक कोर्स-टू-फाइन (coarse-to-fine), सीखने योग्य चयन तंत्र का उपयोग करता है।

Ruilin Tong, Dong Gong2026-07-09
🤖 machine learning

Robust Federated Learning Under Real-World Client Churn

FeLiX एक सुदृढ़ फेडरेटेड लर्निंग फ्रेमवर्क है जो स्ट्रीमिंग-अवेयर क्लाइंट सिलेक्शन, फ्रेश-यूटिलिटी प्रायोरिटाइजेशन और डिले-रोबस्ट एग्रीगेशन को पेश करके वास्तविक दुनिया के परिनियोजन में वॉल-क्लॉक टाइम-टू-टारगेट एक्यूरेसी को कम करता है ताकि क्षणिक क्लाइंट उपलब्धता और गतिशील डेटा विषमता जैसी चुनौतियों से निपटा जा सके।

Dhruv Garg, Neha Lakhani, Debopam Sanyal, Myungjin Lee, Alexey Tumanov, Ada Gavrilovska2026-07-09
🤖 machine learning

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

यह शोध पत्र अनबाउंडेड पॉजिटिव एसिमेट्रिक ऑप्टिमाइज़ेशन (UP) को प्रस्तुत करता है, जो एक सार्वभौमिक प्लग-एंड-प्ले ऑब्जेक्टिव है जो सकारात्मक लाभों के लिए अनक्लिप्ड, स्थिर ग्रेडिएंट्स सक्षम करके और नकारात्मक लाभों के लिए क्लिपिंग सुरक्षा उपायों को बनाए रखते हुए लार्ज लैंग्वेज मॉडल्स के लिए सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) में अन्वेषण-स्थिरता द्वंद्व को हल करता है, जिससे विविध एल्गोरिदम और आर्किटेक्चर में तर्क संबंधी सटीकता को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin2026-07-09
💬 NLP

Dissociating the Internal Representations of Sycophancy in LLMs

यह शोध पत्र तथ्यात्मक और राय संबंधी उप-प्रकारों के बीच अंतर करके LLM चाटुकारिता (sycophancy) के आंतरिक तंत्रों की जांच करता है, जो यह प्रकट करता है कि विभिन्न मॉडल लीनियर प्रोब्स (linear probes) और स्टीयरिंग वेक्टर्स (steering vectors) के उपयोग के माध्यम से इन व्यवहारों को या तो एकीकृत या भिन्न और कारण रूप से हस्तक्षेप करने वाली अवधारणाओं के रूप में प्रस्तुत करते हैं।

Anthony Baez, Sheer Karny, Pat Pataranutaporn2026-07-09
🤖 machine learning

Multimodal Spatiotemporal-Frequency Fusion with Peak Enhancement for Cellular Traffic Forecasting

यह शोध पत्र MSPF-Net का प्रस्ताव करता है, जो एक मल्टीमॉडल फ्रेमवर्क है जो स्पैटियोटेम्पोरल-फ्रीक्वेंसी विश्लेषण, बर्स्ट डिटेक्शन के लिए पीक एन्हांसमेंट, और न्यूज़ कॉन्टेक्स्ट एनकोडिंग को एकीकृत करता है ताकि अंतर्निहित गतिकी (intrinsic dynamics) और बहिर्जात शहरी घटनाओं (exogenous urban events) को संयुक्त रूप से मॉडल करके सेलुलर ट्रैफ़िक पूर्वानुमान की सटीकता में महत्वपूर्ण सुधार किया जा सके।

Qingzhong Li, Yue Hu, Hui Ma, Yajun Zhang, Xinjun Pei, Ming Yan, Fei Xing2026-07-09