🧬 biology

Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

यह अध्ययन प्रदर्शित करता है कि प्राकृतिक गेमप्ले के दौरान क्रिया (LAMs) बनाम तर्क (VLMs) के लिए फाउंडेशन मॉडल्स को फाइन-ट्यून करने से मस्तिष्क संरेखण के विशिष्ट पैटर्न सामने आते हैं, जहाँ LAMs फ्रंटल-मोटर क्षेत्रों में असममित, क्रिया-विशिष्ट प्रतिनिधित्व दिखाते हैं जबकि दोनों मॉडल सुदृढीकरण शिक्षण (reinforcement learning) बेसलाइन्स की तुलना में बेहतर प्रदर्शन करते हैं, जिसमें लाभ कॉर्टिकल प्रोसेसिंग पदानुक्रम के साथ बढ़ते हैं।

Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish G (…)2026-05-20
🤖 machine learning

Understanding Dynamics of Adam in Zero-Sum Games: An ODE Approach

यह शोध पत्र शून्य-योग खेलों (zero-sum games) में Adam-DA एल्गोरिदम का विश्लेषण करने के लिए एक निरंतर-समय ODE ढांचे को स्थापित करता है, जो यह प्रकट करता है कि इसके मोमेंटम पैरामीटर न्यूनीकरण समस्याओं (minimization problems) में अपनी भूमिकाओं के विपरीत कार्य करते हैं और GAN प्रयोगों के माध्यम से इन सैद्धांतिक अंतर्दृष्टियों को मान्य करता है।

Yi Feng, Weiming Ou, Xiao Wang2026-05-20
🤖 machine learning

Neuron Incidence Redistribution for Fairness in Medical Image Classification

यह शोध पत्र न्यूरॉन इंसिडेंस रिडिस्ट्रिब्यूशन (NIR) का प्रस्ताव करता है, जो एक हल्का रेगुलराइजेशन तरीका है जो पेनल्टी के माध्यम से पेनल्टी-अंतिम-परत (penultimate-layer) के न्यूरॉन्स में एक्टिवेशन वेरिएंस को कम करके मेडिकल इमेज क्लासिफिकेशन में जनसांख्यिकीय प्रदर्शन असमानताओं को कम करता है, जिससे प्रशिक्षण के दौरान जनसांख्यिकीय लेबल की आवश्यकता के बिना सबग्रुप बायस को कम किया जा सकता है।

Abin Shoby, Lyle John Palmer, Nikhil Cherian Kurian2026-05-20
🤖 machine learning

A Bitter Lesson for Data Filtering

यह शोध पत्र इस पारंपरिक धारणा को चुनौती देता है कि बड़े मॉडल के प्रीट्रेनिंग के लिए डेटा फ़िल्टरिंग आवश्यक है, यह उच्च-कंप्यूट, डेटा-दुर्लभ व्यवस्थाओं में स्केलिंग अध्ययनों के माध्यम से प्रदर्शित करता है कि पर्याप्त रूप से प्रशिक्षित बड़े मॉडल वास्तव में कम गुणवत्ता वाले और विचलित करने वाले डेटा को हटाने के बजाय उन्हें शामिल करने से लाभान्वित होते हैं।

Christopher Mohri, John Duchi, Tatsunori Hashimoto2026-05-20
🤖 machine learning

Unlocking the Potential of Continual Model Merging: An ODE Perspective

यह शोध पत्र ODE-M का प्रस्ताव करता है, जो एक नवीन निरंतर मॉडल विलय (continual model merging) ढांचा है जो पैरामीटर स्पेस में लो-लॉस पथों को ट्रैक करने के लिए एक साधारण अवकल समीकरण (Ordinary Differential Equation) परिप्रेक्ष्य का लाभ उठाता है, जिससे कैटास्ट्रोफिक फॉरगेटिंग को प्रभावी ढंग से कम किया जा सके और विषम कार्य बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।

Lihong Lin, Haidong Kang2026-05-20
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

यह शोध पत्र कॉन्ट्रास्टिविव एविडेंस पॉलिसी ऑप्टिमाइज़ेशन (CEPO) को प्रस्तुत करता है, जो एक नवीन RLVR सेल्फ-डिस्टिलेशन विधि है जो एक कॉन्ट्रास्टिव रिवॉर्ड सिग्नल उत्पन्न करने के लिए सही और अस्वीकृत दोनों रोलआउट्स का लाभ उठाती है, जिससे सूचना रिसाव (information leakage) से बचते हुए निर्णायक रीजनिंग स्टेप्स की सटीक पहचान की जाती है और मल्टीमॉडल गणितीय तर्क बेंचमार्क पर GRPO जैसे मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जाता है।

Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan2026-05-20
🤖 machine learning

When the Majority Votes Wrong, the Intervention Timing for Test-Time Reinforcement Learning Hides in the Extinction Window

यह शोध पत्र तर्क देता है कि टेस्ट-टाइम रीइन्फोर्समेंट लर्निंग (TTRL) के कथित लाभ अक्सर "करेक्ट-आंसर एक्सटिंक्शन विंडो" में सही उत्तरों के अपरिवर्तनीय दमन के कारण भ्रामक होते हैं, और TTRL-Guard का प्रस्ताव करता है, जो इस क्षति को कम करने और गणितीय तर्क संबंधी बेंचमार्क पर प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए फ्लिप-रेट मॉनिटरिंग और अल्पसंख्यक-संरक्षण तंत्रों का उपयोग करने वाला एक ढांचा है।

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang2026-05-20
🤖 machine learning

Implicit Bias of Mirror Flow in Homogeneous Neural Networks: Sparse and Dense Feature Learning

यह शोध पत्र एक नवीन संतुलन समीकरण को व्युत्पन्न करके होमोजेनियस न्यूरल नेटवर्क में मिरर फ्लो के अंतर्निहित पूर्वाग्रह (implicit bias) को अभिलक्षित करता है और यह सिद्ध करता है कि भिन्न मिरर मैप्स, हालांकि समान मैक्स-मार्जिन समाधान की ओर अभिसरित होते हैं, फिर भी विरल (sparse) से सघन (dense) सक्रियताओं तक के व्यापक रूप से भिन्न फीचर लर्निंग व्यवहार को प्रेरित कर सकते हैं।

Tom Jacobs, Guido Montufar2026-05-20
🤖 machine learning

Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models

यह शोध पत्र एक नियंत्रित ढांचा स्थापित करता है जो यह प्रदर्शित करता है कि स्व-पर्यवेक्षित प्री-ट्रेनिंग (self-supervised pre-training) टाइम सीरीज़ वर्गीकरण और विसंगति का पता लगाने (anomaly detection) के लिए पर्याप्त लाभ प्रदान करती है, लेकिन पूर्वानुमान (forecasting) के लिए यह मामूली लाभ ही देती है, एक ऐसा अंतर जो परिशुद्धता-अपरिवर्तनीयता (precision-invariance) के व्यापार-बंद (trade-off) द्वारा संचालित है जो जनरेटिव प्रतिमानों (generative paradigms) के बजाय लेटेंट अलाइनमेंट आर्किटेक्चर (latent alignment architectures) के पक्ष में है।

Noam Major, Kathy Razmadze, Yoli Shavit2026-05-20
🤖 machine learning

Sampling-Based Safe Reinforcement Learning

यह शोध पत्र सैंपलिंग-आधारित सेफ रिइन्फोर्समेंट लर्निंग (SBSRL) प्रस्तुत करता है, जो एक मॉडल-आधारित एल्गोरिदम है जो डायनेमिक्स सैंपल्स में बाधाओं को लागू करके और एपिस्टेमिक अनसर्टेन्टी (epistemic uncertainty) को प्रबंधित करके निरंतर नियंत्रण शिक्षण के दौरान सुरक्षा सुनिश्चित करता है, जिससे सैद्धांतिक सुरक्षा गारंटी प्रदान होती है और सिमुलेशन एवं वास्तविक दुनिया के रोबोटिक हार्डवेयर दोनों में कुशल अन्वेषण प्राप्त होता है।

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As2026-05-20