💬 NLP

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

यह शोध पत्र PROVE को प्रस्तुत करता है, जो एक स्टेटफुल सर्वर लाइब्रेरी, एक डिपेंडेंसी-गाइडेड डेटा सिंथेसिस पाइपलाइन और एक नवीन प्रोग्रामेटिक रिवॉर्ड सिस्टम को संयोजित करके लाइव वातावरण में मल्टी-स्टेप टूल उपयोग के लिए प्रभावी सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) को सक्षम बनाता है, जिसके परिणामस्वरूप कई बेंचमार्क और मॉडल परिवारों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi2026-06-03
🤖 machine learning

Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

यह शोध पत्र सैद्धांतिक रूप से प्रदर्शित करता है कि Muon ऑप्टिमाइज़र में मोमेंटम (momentum) एक स्पेक्ट्रल फ़िल्टर के रूप में कार्य करता है जो ग्रेडिएंट शोर (gradient noise) को दबाने और स्पेक्ट्रल गैप को बड़ा करने के लिए है, जिससे ऑर्थोगोनलाइज़ेशन (orthogonalization) चरण स्थिर होता है और सिग्नल संरेखण (signal alignment) में सुधार होता है, एक ऐसा निष्कर्ष जिसे लार्ज लैंग्वेज मॉडल प्रशिक्षण में प्रयोगों द्वारा समर्थित किया गया है।

Xianliang Li, Zihan Zhang, Weiyang Liu, Han Bao2026-06-03
🤖 machine learning

MAdam: Metric-Aware Multi-Objective Adam

यह शोधपत्र MAdam को प्रस्तुत करता है, जो एक ड्रॉप-इन रैपर है जो प्राथमिकता-सशर्त वक्रता (preference-conditioned curvature) के साथ सामंजस्यपूर्ण दिशाओं को प्रीकंडीशन करके मल्टी-ऑब्जेक्टिव सॉल्वर और एडम ऑप्टिमाइज़र के बीच व्यवस्थित वेटिंग और ज्यामितीय बेमेल (geometric mismatches) को हल करता है, जिससे विविध मशीन लर्निंग कार्यों में प्रदर्शन में निरंतर सुधार होता है।

Fengbei Liu, Rachit Saluja, Sunwoo Kwak, Ruibo Wang, Ruining Deng, Heejong Kim, Johannes C. Paetzold, Mert R. Sabuncu2026-06-03
🔬 physics

Forecasting Conceptual Diffusion in Science: The Case of Quantum Computing

यह शोध पत्र प्रदर्शित करता है कि जहाँ अंतर्जात वैज्ञानिक सुदृढ़ीकरण काफी हद तक अप्रत्याशित है, वहीं क्वांटम कंप्यूटिंग जैसे तेजी से विकसित होते क्षेत्रों में बहिर्जात वैचारिक प्रसार और एंट्रॉपी का सटीक पूर्वानुमान अपस्ट्रीम उद्धरण विषमता और वितरण संबंधी विशेषताओं पर प्रशिक्षित मशीन लर्निंग मॉडल का उपयोग करके लगाया जा सकता है, जो अग्रिम विज्ञान नीति और प्रौद्योगिकी दूरदर्शिता के लिए एक स्केलेबल रूपरेखा प्रदान करता है।

Thomas Maillart, Thibaut Chataing, David Dosu, Paul Bagourd, Julian Jang-Jaccard, Alain Mermoud2026-06-03
🤖 machine learning

Contrastive Neural Algorithmic Reasoning for Graph Coloring

यह शोध पत्र ग्राफ कलरिंग के लिए एक कंट्रास्टिव लर्निंग फ्रेमवर्क प्रस्तावित करता है जो हस्तांतरणीय ज्यामितीय एम्बेडिंग्स सीखता है जहाँ समान-रंग वाले नोड्स संरेखित होते हैं और आसन्न नोड्स विचलित होते हैं, जिससे ग्राफ के आकार और वितरणों में प्रभावी सामान्यीकरण सक्षम होता है और कम-संघर्ष वाले कलरिंग उत्पन्न होते हैं जो ग्रीडी दृष्टिकोणों के बराबर या उनसे बेहतर होते हैं।

Thien Le, Tianyu Zhao, Melanie Weber2026-06-03
🤖 machine learning

FFR: Forward-Forward Learning for Regression

यह शोध पत्र FFR को प्रस्तुत करता है, जो ऑर्डिनल कॉम्पिटिटिव गुडनेस (ordinal competitive goodness), एक स्ट्रैटिफाइड लैडर आर्किटेक्चर और पदानुक्रमित भविष्यवाणी (hierarchical prediction) का उपयोग करके रिग्रेशन कार्यों के लिए जैविक रूप से संभावित फॉरवर्ड-फॉरवर्ड एल्गोरिदम को अनुकूलित करने वाला पहला ढांचा है, जो काफी कम मेमोरी और कम्प्यूटेशनल लागत के साथ बैकप्रोपैगेशन के निकट सटीकता प्राप्त करता है।

Xinyang Liu, Xuanyu Liang, Shiqi Ding, Boyang Li, Zhiqiang Que, Jiayang Li, Guosheng Hu2026-06-03✓ Author reviewed
🤖 machine learning

q0: Primitives for Hyper-Epoch Pretraining

यह शोध पत्र "हाइपर-एपॉक प्रीट्रेनिंग" (q0) को प्रस्तुत करता है, जो एक ढांचा है जो चक्रीय शेड्यूलिंग (cyclic scheduling), चेन डिस्टिलेशन (chain distillation) और एक सीखे हुए प्रायर (learned prior) के माध्यम से एक एकल मॉडल को प्रशिक्षित करने के बजाय मॉडलों की एक विविध आबादी को एकत्रित करने की ओर स्थानांतरित होता है, जिससे पारंपरिक मल्टी-एपॉक ट्रेनिंग की तुलना में काफी अधिक डेटा दक्षता और कम वैलिडेशन लॉस प्राप्त होता है।

Bishwas Mandal, Shmuel Berman, Akshay Vegesna, Samip Dahal2026-06-03
🤖 machine learning

Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning

यह शोध पत्र एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो रिवॉर्ड अनिश्चितता को रिवॉर्ड फंक्शन के एक वितरण के रूप में मानकर उद्देश्य को पुनर्गठित करके एजेंट के विविध और नियंत्रणीय व्यवहार को स्वाभाविक रूप से प्रेरित करता है, जिससे पारंपरिक एंट्रॉपी रेगुलराइजेशन या ह्यूरिस्टिक विधियों में निहित प्रदर्शन-विविधता ट्रेड-ऑफ को समाप्त किया जा सके।

Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, A (…)2026-06-03
🤖 machine learning

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

मानव सीखने की प्रक्रिया से प्रेरित होकर, यह शोध पत्र लार्ज लैंग्वेज मॉडल्स के लिए एक "स्लीप" (नींद) प्रतिमान प्रस्तावित करता है जो "नॉलेज सीडिंग" (ज्ञान बीजारोपण) डिस्टिलेशन और सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) के माध्यम से अनसुपरवाइज्ड "ड्रिमिंग" (सपनों) की दो-चरणीय प्रक्रिया के जरिए अल्पकालिक स्मृतियों को दीर्घकालिक मापदंडों में समेकित करके निरंतर सीखने और आत्म-सुधार को सक्षम बनाता है।

Ali Behrouz, Farnoosh Hashemi, Vahab Mirrokni2026-06-03