🤖 machine learning

Plug-and-Play Benchmarking of Reinforcement Learning Algorithms for Large-Scale Flow Control

यह शोध पत्र FluidGym प्रस्तुत करता है, जो बड़े पैमाने पर सक्रिय प्रवाह नियंत्रण (active flow control) के लिए सुदृढीकरण लर्निंग (reinforcement learning) एल्गोरिदम के मूल्यांकन और तुलना को मानकीकृत करने के लिए पूरी तरह से PyTorch में निर्मित पहला स्टैंडअलोन, पूर्णतः विभेदनीय (fully differentiable) और GPU-त्वरित बेंचमार्क सूट है।

Jannis Becktepe, Aleksandra Franz, Nils Thuerey, Sebastian Peitz2026-05-28
🤖 machine learning

Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits

यह शोध पत्र स्टोकेस्टिक लॉजिस्टिक बैंडिट्स के लिए मिनिमैक्स ऑप्टिमल सिंपल रिग्रेट रेट को स्थापित करता है, जो यह दर्शाता है कि यह इष्टतम क्रिया पर इनवर्स सिग्मॉइड स्लोप द्वारा नियंत्रित होता है, और दो कर्वेचर-अवेयर एल्गोरिदम प्रस्तावित करता है जो सूचनात्मक लो-रिवॉर्ड क्रियाओं का लाभ उठाकर इस बाउंड को प्राप्त करते हैं।

Shuai Liu, Alireza Bakhtiari, Alex Ayoub, Botao Hao, Csaba Szepesvári2026-05-28
🤖 machine learning

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

यह शोधपत्र RankTuner को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग फ्रेमवर्क है जो 'रिलेटिव रैंक इंडिकेटर' नामक एक नवीन 'प्रोबेबिलिटी-एन्ट्रॉपी कैलिब्रेशन' सिग्नल का उपयोग करता है, जो टोकन को गतिशील रूप से पुन: भारित (reweight) करने के लिए नियोजित किया जाता है, जिससे अंतर्निहित अनिश्चितता को ध्यान में रखते हुए वास्तव में कम सीखे गए टोकन पर ध्यान केंद्रित करके गणितीय तर्क, कोड जनरेशन और आउट-ऑफ-डिस्ट्रीब्यूशन ट्रांसफर में सुधार किया जाता है।

Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King2026-05-28
🤖 machine learning

ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning

यह शोध पत्र ECHO का प्रस्ताव करता है, जो एक टेस्ट-टाइम सुदृढीकरण लर्निंग (reinforcement learning) ढांचा है जो एंट्रॉपी और कॉन्फिडेंस मेट्रिक्स को संयोजित करके वृक्ष-संरचित रोलआउट्स (tree-structured rollouts) को अनुकूल रूप से नियंत्रित करने और पॉलिसी अपडेट को परिष्कृत करने के लिए काम करता है, जिससे सीमित कम्प्यूटेशनल बजट के तहत रीजनिंग प्रदर्शन में सुधार करने के लिए रोलआउट कोलैप्स को रोकने और प्रारंभिक चरण के पूर्वाग्रह को कम करने में मदद मिलती है।

Chu Zhao, Enneng Yang, Yuting Liu, Jianzhe Zhao, Guibing Guo2026-05-28
🤖 machine learning

Segment to Focus: Guiding Latent Action Models in the Presence of Distractors

यह शोधपत्र MaskLAM प्रस्तुत करता है, जो ज़ीरो-शॉट सेगमेंटेशन के माध्यम से प्री-ट्रेनिंग रिकंस्ट्रक्शन ऑब्जेक्टिव को केवल एजेंट पिक्सेल तक सीमित करके विजुअल डिस्ट्रैक्टर्स की उपस्थिति में लेटेंट एक्शन मॉडल्स में सुधार करने की एक विधि है, जिससे बिना किसी अतिरिक्त आर्किटेक्चरल बदलाव या एक्शन लेबल की आवश्यकता के मॉडल को केवल एजेंट-नियंत्रित डायनेमिक्स सीखने के लिए मजबूर किया जाता है।

Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner2026-05-28
🤖 machine learning

Trust Region Continual Learning as an Implicit Meta-Learner

यह शोध पत्र ट्रस्ट रीजन कॉन्टिनुअल लर्निंग (Trust Region Continual Learning) का प्रस्ताव करता है, जो एक हाइब्रिड विधि है जो जेनेरेटिव रिप्ले (generative replay) को फिशर-मेट्रिक बाधाओं (Fisher-metric constraints) के साथ जोड़ती है जो स्पष्ट बाइसल लेवल ऑप्टिमाइज़ेशन (bilevel optimization) के बिना पूर्व कार्य इष्टतमों (prior task optima) पर तीव्र पुन: अभिसरण और बेहतर प्रतिधारण (retention) को सक्षम करने के लिए अंतर्निहित रूप से एक मेटा-लर्नर के रूप में कार्य करती है।

Zekun Wang, Anant Gupta, Christopher J. MacLellan2026-05-28
📊 statistics

When pre-training hurts LoRA fine-tuning: a dynamical analysis via single-index models

यह शोध पत्र गणितीय रूप से प्रदर्शित और अनुभवजन्य रूप से प्रमाणित करता है कि अत्यधिक प्री-ट्रेनिंग (pre-training), सिंगल-इंडेक्स मॉडल पर LoRA फाइन-ट्यूनिंग को एक लंबे खोज चरण (search phase) को प्रेरित करके कम्प्यूटेशनल रूप से बाधित कर सकती है, जो यह प्रकट करता है कि मजबूत प्री-ट्रेनिंग हमेशा डाउनस्ट्रीम अनुकूलन (downstream optimization) को त्वरित नहीं करती है, भले ही कार्य अच्छी तरह से संरेखित हों।

Gibbs Nwemadji, Bruno Loureiro, Jean Barbier2026-05-28
🤖 machine learning

Mitigating Staleness in Asynchronous Pipeline Parallelism via Basis Rotation

यह शोध पत्र यह पहचानता है कि एसिंक्रोनस पाइपलाइन पैरेललिज्म (asynchronous pipeline parallelism) में ग्रेडिएंट स्टेलेनेस (gradient staleness), हेसियन आइगेनबेसिस (Hessian eigenbasis) और कोऑर्डिनेट सिस्टम के बीच मिसअलाइनमेंट के कारण बढ़ जाती है, और एक "बेसिस रोटेशन" (basis rotation) फ्रेमवर्क का प्रस्ताव करता है ताकि इन बेसेस को पुनः संरेखित किया जा सके, जिससे बड़े पैमाने पर वितरित प्रशिक्षण (distributed training) के लिए प्रशिक्षण इटरेशन में काफी कमी आती है और स्केलेबिलिटी बहाल होती है।

Hyunji Jung, Sungbin Shin, Namhoon Lee2026-05-28
⚡ electrical engineering

Majorization-Minimization Networks for Inverse Problems: An Application to EEG Imaging

यह शोध पत्र ईईजी (EEG) इमेजिंग जैसी व्युत्क्रम समस्याओं (inverse problems) के लिए एक सीखे हुए मेजरइज़ेशन-मिनिमाइज़ेशन (Majorization-Minimization) ढांचे का प्रस्ताव करता है, जो एक बाइलेवल ऑप्टिमाइज़ेशन सेटिंग के भीतर स्ट्रक्चर्ड कर्वेचर मेजरेंट्स (structured curvature majorants) को सीखने के लिए एक लाइटवेट रिकरेंट न्यूरल नेटवर्क को एकीकृत करता है, जिससे शास्त्रीय एमएम (MM) विधियों की सैद्धांतिक अभिसरण गारंटी (theoretical convergence guarantees) को संरक्षित करते हुए बेहतर सटीकता, स्थिरता और सामान्यीकरण प्राप्त होता है।

Le Minh Triet Tran (IMT Atlantique, LaTIM), Sarah Reynaud (IMT Atlantique, LaTIM), Ronan Fablet (IMT Atlantique, Lab-STI (…)2026-05-28
🤖 machine learning

EvoMAS: Evolutionary Generation of Multi-Agent Systems

EvoMAS एक ऐसा विकासवादी ढांचा (evolutionary framework) पेश करता है जो फीडबैक-आधारित उत्परिवर्तन (mutation) और क्रॉसओवर के माध्यम से संरचित कॉन्फ़िगरेशन को पुनरावृत्ति द्वारा परिष्कृत करके, स्वचालित रूप से मजबूत और उच्च-प्रदर्शन वाले मल्टी-एजेंट सिस्टम उत्पन्न करता है, जो विविध रीजनिंग, सॉफ्टवेयर इंजीनियरिंग और टूल-यूज़ बेंचमार्क में मानव-निर्मित और पूर्व स्वचालित विधियों दोनों से काफी बेहतर प्रदर्शन करता है।

Yuntong Hu, Yuting Zhang, Matthew Trager, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto2026-05-28