🤖 machine learning

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

यह शोध पत्र ट्रांसफॉर्मेशन-ऑगमेंटेड GRPO (TA-GRPO) का प्रस्ताव करता है, जो एक ऐसी विधि है जो मिश्रित रिवॉर्ड्स और विविध तर्क पथों (reasoning paths) को बनाने के लिए समस्या-तुल्य प्रश्न पुनर्रचनाओं (problem-equivalent question rephrasings) को उत्पन्न करके बड़े भाषा मॉडल के तर्क में ग्रेडिएंट वैनिशिंग और डाइवर्सिटी कोलैप्स को कम करती है, जिससे जटिल गणितीय और वैज्ञानिक बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla2026-05-20
🤖 machine learning

Depth, Not Data: An Analysis of Hessian Spectral Bifurcation

यह शोध पत्र इस प्रचलित दृष्टिकोण को चुनौती देता है कि डीप न्यूरल नेटवर्क में हेसियन मैट्रिक्स (Hessian matrix) की "बल्क-एंड-स्पाइक" (bulk-and-spike) स्पेक्ट्रल संरचना केवल डेटा असंतुलन के कारण होती है, बल्कि यह प्रदर्शित करता है कि यह द्विभाजन (bifurcation) पूर्णतः नेटवर्क आर्किटेक्चर से उत्पन्न होता है और गहराई के साथ रैखिक रूप से स्केल करता है।

Shenyang Deng, Boyao Liao, Zhuoli Ouyang, Tianyu Pang, Yaoqing Yang2026-05-20
🔬 materials science

Learning ORDER-Aware Multimodal Representations for Composite Materials Design

यह शोधपत्र ORDER को प्रस्तुत करता है, जो एक मल्टीमॉडल प्रीट्रेनिंग फ्रेमवर्क है जो डेटा की कमी के तहत कंपोजिट सामग्रियों के निरंतर डिज़ाइन स्पेस को प्रभावी ढंग से मॉडल करने के लिए ऑर्डिनैलिटी (क्रमबद्धता) का लाभ उठाता है, और प्रॉपर्टी प्रेडिक्शन, रिट्रीवल और माइक्रोस्ट्रक्चर जनरेशन कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Xinyao Li, Hangwei Qian, Jingjing Li, Lei Zhu, Ivor Tsang2026-05-20
🤖 machine learning

Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL

यह शोध पत्र PULSE को प्रस्तुत करता है, जो बड़े भाषा मॉडलों के वितरित RL पोस्ट-ट्रेनिंग के लिए एक संचार-कुशल ढांचा है, जो इस अवलोकन का लाभ उठाता है कि 99% वेट अपडेट BF16 प्रिसिजन में अदृश्य होते हैं, ताकि बिट-आइडेंटिकल या मैचिंग प्रदर्शन बनाए रखते हुए सिंक्रोनाइज़ेशन बैंडविड्थ में 100x से अधिक की कमी लाई जा सके।

Erfan Miahi, Eugene Belilovsky2026-05-20
🔬 physics

WIND: Weather Inverse Diffusion for Zero-Shot Atmospheric Modeling

यह शोध पत्र WIND को प्रस्तुत करता है, जो एक ज़ीरो-शॉट वायुमंडलीय फाउंडेशन मॉडल है जो एक कार्य-अज्ञेय (task-agnostic) प्रायर सीखने के लिए स्व-पर्यवेक्षित वीडियो डिफ्यूजन का लाभ उठाता है, जिससे यह किसी भी कार्य-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता के बिना, इनवर्स प्रॉब्लम सैंपलिंग के माध्यम से पूर्वानुमान, डाउनस्केलिंग और पुनर्निर्माण सहित विविध मौसम और जलवायु समस्याओं को हल करने में सक्षम होता है।

Michael Aich, Andreas Fürst, Florian Sestak, Carlos Ruiz-Gonzalez, Niklas Boers, Johannes Brandstetter2026-05-20
🤖 machine learning

Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

यह शोध पत्र डिफ्यूजन मॉडल्स के लिए सुदृढीकरण शिक्षण (reinforcement learning) डिज़ाइन स्पेस का व्यवस्थित रूप से विश्लेषण करता है और यह प्रदर्शित करता है कि अंतिम जनरेट किए गए नमूने से गणना किया गया एक एविडेंस लोअर बाउंड (ELBO) आधारित लाइकलीहुड एस्टीमेटर उपयोग करना ही कुशल और स्थिर अनुकूलन को सक्षम करने वाला महत्वपूर्ण कारक है, जो गति और रिवॉर्ड दोनों बेंचमार्क में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Jaemoo Choi, Yuchen Zhu, Wei Guo, Petr Molodyk, Bo Yuan, Jinbin Bai, Yi Xin, Molei Tao, Yongxin Chen2026-05-20
💬 NLP

Diffusion-State Policy Optimization for Masked Diffusion Language Models

यह शोध पत्र डिफ्यूजन-स्टेट पॉलिसी ऑप्टिमाइज़ेशन (DiSPO) का प्रस्ताव करता है, जो एक प्लग-इन विधि है जो ब्रांचिंग और स्कोरिंग तंत्र के माध्यम से मध्यवर्ती टोकन-फिलिंग निर्णयों को सीधे अनुकूलित करके मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स को बेहतर बनाती है, जिससे बिना किसी अतिरिक्त कंप्यूट या ऑप्टिमाइज़र स्टेप की आवश्यकता के गणित और प्लानिंग जैसे जटिल कार्यों पर प्रदर्शन में सुधार होता है।

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki2026-05-20
🧬 biology

How does longer temporal context enhance multimodal narrative video processing in the brain?

यह अध्ययन प्रदर्शित करता है कि वीडियो क्लिप के टेम्पोरल कॉन्टेक्स्ट (कालिक संदर्भ) को बढ़ाने से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (लेकिन यूनिमोडल वीडियो मॉडल्स के लिए नहीं) के लिए ब्रेन-मॉडल अलाइनमेंट में महत्वपूर्ण सुधार होता है, जो नैरेटिव कॉम्प्रिहेन्शन (कथा बोध) के दौरान उच्च-क्रम मस्तिष्क क्षेत्रों में लंबी न्यूरल इंटीग्रेशन टाइमस्केल्स और MLLMs की गहरी परतों के बीच एक पदानुक्रमित पत्राचार को प्रकट करता है।

Prachi Jindal, Anant Khandelwal, Manish Gupta, Bapi S. Raju, Subba Reddy Oota, Tanmoy Chakraborty2026-05-20
🤖 machine learning

CMAD: Cooperative Multi-Agent Diffusion via Stochastic Optimal Control

यह शोध पत्र CMAD का प्रस्ताव करता है, जो एक नवीन ढांचा है जो कई पूर्व-प्रशिक्षित डिफ्यूजन मॉडलों के संयोजन को एक सहकारी स्टोकेस्टिक ऑप्टिमल कंट्रोल समस्या के रूप में पुनर्गठित करता है, जहाँ परस्पर क्रिया करने वाले एजेंट संभाव्यता घनत्वों के बीजगणितीय संयोजनों पर निर्भर रहने के बजाय एक साझा उद्देश्य की ओर अपनी डिफ्यूजन प्रक्षेपवक्रों को संयुक्त रूप से निर्देशित करते हैं।

Riccardo Barbano, Alexander Denker, Zeljko Kereta, Runchang Li, Francisco Vargas2026-05-20
🤖 machine learning

Adaptive Power Iteration Method for Differentially Private PCA

यह शोध पत्र एक नवीन विभेदक रूप से निजी (डिफरेंशियल प्राइवेट) PCA एल्गोरिदम प्रस्तावित करता है जो पंक्ति-वार गोपनीयता मॉडल के तहत कम सुसंगतता (लो कोहेरेंस) वाले मैट्रिसेस के लिए वर्स्ट-केस से परे गारंटी प्राप्त करने के लिए एक नई अनुकूली फ़िल्टरिंग तकनीक का लाभ उठाता है, जिससे पूर्ववर्ती कार्य का विस्तार और पूरकता होती है जो एंट्री-वाइज गोपनीयता तक सीमित था।

Ta Duy Nguyen, Alina Ene, Huy Le Nguyen2026-05-20