🤖 machine learning

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

यह शोध पत्र कांडिंस्की 5.0 (Kandinsky 5.0) का परिचय देता है, जो इमेज और वीडियो जनरेशन वेरिएंट्स वाला ओपन-सोर्स फाउंडेशन मॉडल्स का एक परिवार है जिसमें 19 बिलियन तक पैरामीटर्स हैं, जो अत्याधुनिक उच्च-रिज़ॉल्यूशन संश्लेषण और 10-सेकंड वीडियो जनरेशन प्राप्त करने के लिए एक व्यापक डेटा क्यूरेशन लाइफसाइकिल और उन्नत प्रशिक्षण तकनीकों का लाभ उठाते हैं।

Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy (…)2026-05-27
🤖 machine learning

Align & Invert: Solving Inverse Problems with Diffusion and Flow-based Models via Representation Alignment

यह शोधपत्र एक रिप्रेजेंटेशन अलाइनमेंट (REPA) फ्रेमवर्क प्रस्तावित करता है जो इन्वर्स समस्याओं को हल करने में डिफ्यूजन और फ्लो-आधारित मॉडलों को निर्देशित करने के लिए प्रीट्रेंड DINOv2 एनकोडर्स का लाभ उठाता है, जो सैद्धांतिक रूप से यह प्रदर्शित करता है कि यह दृष्टिकोण विभिन्न कार्यों में पुनर्निर्माण गुणवत्ता और संवेदी यथार्थता (perceptual realism) में सुधार करने और अनुमान चरणों (inference steps) को कम करने के लिए एम्बेडिंग-स्पेस डाइवर्जेंस को न्यूनतम करता है।

Loukas Sfountouris, Giannis Daras, Paris Giampouras2026-05-27
📊 statistics

Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently

यह शोध पत्र सैद्धांतिक रूप से यह प्रदर्शित करता है कि जबकि प्रोसेस रिवॉर्ड्स के साथ सुदृढीकरण शिक्षण (reinforcement learning) और सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) दोनों ही वन-लेयर ट्रांसफॉर्मर्स को चेन-ऑफ-थॉट रीजनिंग के माध्यम से स्पार्स बूलियन फंक्शन्स को सिद्ध रूप से सीखने में सक्षम बनाते हैं, वे उनके सीखने की गतिशीलता में मौलिक रूप से भिन्न हैं, जहाँ आरएल (RL) संपूर्ण रीजनिंग चेन को एक साथ प्राप्त करता है जबकि एसएफटी (SFT) इसे चरण-दर-चरण सीखता है।

Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu2026-05-27
🔬 applied physics

Reconstructing Multi-Scale Physical Fields from Extremely Sparse Measurements with an Autoencoder-Diffusion Cascade

यह शोध पत्र कैस्केडेड सेंसिंग (Cascaded Sensing) का प्रस्ताव करता है, जो एक पदानुक्रमित ढांचा है जो अत्यंत विरल मापों से बहु-स्तरीय भौतिक क्षेत्रों को पुनर्गठित करने के लिए पहले एक मास्क्ड ऑटोएन्कोडर (masked autoencoder) का उपयोग करके वैश्विक संरचनात्मक अस्पष्टता को नियत रूप से हल करता है और फिर परिष्कृत-स्तर के अवशेषों (residuals) को स्थिरता से अनुमानित करने के लिए एक कंडीशनल डिफ्यूजन मॉडल (conditional diffusion model) का उपयोग करता है, जिससे इस समस्या की इल-पोस्ड (ill-posed) और मल्टीमॉडल प्रकृति को संबोधित किया जा सके।

Letian Yi, Tingpeng Zhang, Mingyuan Zhou, Guannan Wang, Quanke Su, Zhilu Lai2026-05-27
🤖 machine learning

Training-Free Vector Quantization via Gaussian VAEs

यह शोधपत्र Gaussian Quant (GQ) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो रैंडम गॉसियन शोर (random Gaussian noise) को कोडबुक के रूप में उपयोग करके एक बाधित गॉसियन VAE को उच्च-प्रदर्शन वाले VQ-VAE में परिवर्तित करती है, जो सैद्धांतिक रूप से कम क्वांटाइजेशन त्रुटि की गारंटी देता है और अनुभवजन्य रूप से मौजूदा VQ-VAE दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Tongda Xu, Wendi Zheng, Jiajun He, Jose Miguel Hernandez-Lobato, Yan Wang, Ya-Qin Zhang, Jie Tang2026-05-27
⚡ electrical engineering

BUILD with Precision: Bottom-Up Inference of Linear DAGs

यह शोध पत्र BUILD को प्रस्तुत करता है, जो एक नियतात्मक (deterministic) बॉटम-अप एल्गोरिदम है जो समान शोर विचरणों (equal noise variances) के तहत रैखिक DAGs का सटीक पुनर्निर्माण करने के लिए प्रिसिजन मैट्रिक्स से लीफ नोड्स की पुनरावृत्त पहचान और छंटाई करता है, जबकि सीमित-डेटा अनुमान त्रुटियों के विरुद्ध मजबूती सुनिश्चित करने के लिए आवधिक पुनर्मूल्यांकन (periodic re-estimation) का उपयोग करता है।

Hamed Ajorlou, Samuel Rey, Gonzalo Mateos, Geert Leus, Antonio G. Marques2026-05-27
⚡ electrical engineering

Distributed Control of Network Systems in the Space of Stabilizing Graph Neural Network Policies

यह शोध पत्र एक यूला-समान परिमाण-दिशा पैरामीट्राइजेशन (magnitude-direction parameterization) में ग्राफ न्यूरल नेटवर्क को एकीकृत करके क्लोज्ड-लूप स्थिरता सुनिश्चित करने वाला एक वितरित नियंत्रण ढांचा प्रस्तावित करता है, जो ग्राफ और मॉडल गड़बड़ी के विरुद्ध स्केलेबल और सुदृढ़ नीतियां सुनिश्चित करता है।

John Cao, Luca Furieri2026-05-27
🤖 machine learning

INTERACT-CMIL: Multi-Task Shared Learning and Inter-Task Consistency for Conjunctival Melanocytic Intraepithelial Lesion Grading

यह शोध पत्र INTERACT-CMIL को प्रस्तुत करता है, जो एक मल्टी-टास्क डीप लर्निंग फ्रेमवर्क है जो साझा फीचर लर्निंग और इंटर-टास्क कंसिस्टेंसी का लाभ उठाकर पांच हिस्टोपैथोलॉजिकल अक्षों (histopathological axes) के माध्यम से कंजंक्टाइवल मेलानोसाइटिक इंट्राएपिथेलियल लीजन्स की सटीक ग्रेडिंग में महत्वपूर्ण सुधार करता है, जो एक मल्टी-सेंटर डेटासेट पर मौजूदा CNN और फाउंडेशन मॉडल बेसलाइन्स से बेहतर प्रदर्शन करता है।

Mert Ikinci, Luna Toma, Karin U. Loeffler, Leticia Ussem, Daniela Süsskind, Julia M. Weller, Yousef Yeganeh, Martina C. (…)2026-05-27
💬 NLP

Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information

यह शोध पत्र डिकोडर-ओनली (decoder-only) LLMs में एट्रिब्यूशन फेथफुलनेस (attribution faithfulness) का आकलन करते समय रिटेन्ड वर्ड काउंट्स (retained word counts) को नियंत्रित करने के लिए π\pi-Soft-NC और π\pi-Soft-NS मूल्यांकन ढांचे के साथ-साथ Grad-ELLM विधि प्रस्तुत करता है, जो मजबूत व्यापकता-उन्मुख प्रदर्शन प्राप्त करने के लिए ग्रेडिएंट और अटेंशन संकेतों को प्रभावी ढंग से संयोजित करती है।

Xin Huang, Antoni B. Chan2026-05-27
🤖 machine learning

Approximate Equivariance via Projection-based Regularisation

यह शोध पत्र एक प्रोजेक्शन-आधारित नियमितीकरण (regularisation) विधि प्रस्तुत करता है जो पूर्ण समूह कक्षा (full group orbit) में ऑपरेटर स्तर पर गैर-तुल्यता (non-equivariance) को दंडित करती है, जो लगभग तुल्य변 (approximately equivariant) तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए मौजूदा नमूना-आधारित दृष्टिकोणों के मुकाबले एक अधिक कुशल और प्रभावी विकल्प प्रदान करती है।

Torben Berndt, Jan Stühmer2026-05-27