🤖 machine learning

Token Geometry

यह शोधपत्र एम्बर (Ember) को प्रस्तुत करता है, जो एक हल्का ऑप्टिमाइज़र है जो एम्बेडिंग और एलएम-हेड (LM-head) मैट्रिसेस की अद्वितीय ग्रेडिएंट ज्यामिति का लाभ उठाकर विभिन्न कार्यों में वीआरएएम (VRAM) के उपयोग को काफी कम करता है और प्रशिक्षण दक्षता में सुधार करता है, साथ ही न्यूरल नेटवर्क अनुकूलन परिदृश्यों के पारंपरिक दृष्टिकोण को चुनौती देता है।

Kathan Shah2026-07-03
🤖 machine learning

Class-Grouped Normalized Momentum and Faster Hyperparameter Exploration to Tackle Class Imbalance in Federated Learning

यह शोध पत्र FedCGNM प्रस्तुत करता है, जो एक नवीन क्लाइंट-साइड ऑप्टिमाइज़र है जो फेडरेटेड लर्निंग में ग्रेडिएंट असंतुलन को संबोधित करने के लिए क्लास-ग्रुपड नॉर्मलाइज्ड मोमेंटम का उपयोग करता है, साथ ही FedHOO, जो रिसैंपलिंग दरों को अनुकूलित करने के लिए एक कुशल X-आर्म्ड-बैंडिट एल्गोरिदम है, ये दोनों ही मौजूदा बेसलाइनों की तुलना में लॉन्ग-टेल्ड डेटासेट्स पर बेहतर प्रदर्शन प्रदर्शित करते हैं।

Haemin Park, Diego Klabjan, Martin W. Braun, Xiuqi Li, Balakrishnan Ananthanarayanan2026-07-03
🤖 machine learning

How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size

यह शोध पत्र एक "तीन-पद" (three-term) स्केलिंग लॉ का प्रस्ताव करता है जो प्रशिक्षण डेटा को चरणों (steps) और बैच आकार (batch size) में स्पष्ट रूप से विभाजित करता है, जिससे इष्टतम बैच आकार स्केलिंग की सुदृढ़ रिकवरी और काफी कम प्रशिक्षण रन का उपयोग करके उप-इष्टतम सेटिंग्स के लिए नियमों का व्युत्पन्न संभव हो पाता है।

Fabian Schaipp2026-07-03
🤖 machine learning

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

यह शोध पत्र FADE पेश करता है, जो एक स्व-अनुकूलनकारी लाभ फलन (self-adapting advantage function) है जो प्रशिक्षण गतिकी का विश्लेषण करके ग्रेडिएंट भार को गतिशील रूप से शेड्यूल करता है ताकि एंट्रॉपी और नमूना फोकस के बीच के समझौतों को हल किया जा सके, जिससे बड़े भाषा मॉडलों के लिए सुदृढीकरण शिक्षण (reinforcement learning) में अभिसरण को गति मिलती है और सटीकता-विविधता के बीच के संतुलन में सुधार होता है।

Juliette Decugis, Sean O'Brien, Francis Bach, Gabriel Synnaeve, Taco Cohen2026-07-03
🤖 machine learning

Unveiling the Non-Monotonic Effect of Privacy on Generalization under Byzantine Robustness

यह शोध पत्र बायज़ेंटाइन-रोबस्ट (Byzantine-robust) डिस्ट्रिब्यूटेड लर्निंग में गोपनीयता और सामान्यीकरण (generalization) के बीच एक गैर-एकदिष्ट (non-monotonic) संबंध को प्रकट करता है, यह प्रदर्शित करते हुए कि जहाँ मजबूत गोपनीयता (उच्च शोर) मजबूती के साथ तनाव को समाप्त करके सामान्यीकरण में सुधार करती है, वहीं कमजोर गोपनीयता (कम शोर) इस ट्रेड-ऑफ को पुन: स्थापित करती है और प्रदर्शन को कम करती है।

Thomas Boudou, Batiste Le Bars, Nirupam Gupta, Aurélien Bellet2026-07-03
🤖 machine learning

Towards Learning Representations of Policies in Two-Player Zero-Sum Imperfect-Information Games

यह शोध पत्र दो-खिलाड़ी शून्य-योग (zero-sum) अपूर्ण-सूचना वाले खेलों में नीति डेटासेट बनाने, नीति एम्बेडिंग सीखने और डाउनस्ट्रीम कार्यों के माध्यम से उनकी प्रभावशीलता का मूल्यांकन करने के लिए एक ढांचे का परिचय देता है, जो यह प्रदर्शित करता है कि कुह्न (Kuhn) और लेड्यूक (Leduc) पोकर पर स्व-पर्यवेक्षित (self-supervised) तकनीकों का उपयोग करके उपयोगी व्यवहार संबंधी प्रतिनिधित्व सीखे जा सकते हैं।

Kevin Wang, Kevin Yang, Arjun Prakash, Amy Greenwald2026-07-03
🤖 AI

Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning

यह शोध पत्र Semi-CoT को प्रस्तुत करता है, जो एक अर्ध-पर्यवेक्षित (semi-supervised) शिक्षण ढांचा है जो सिमेंटिक एंट्रॉपी फ़िल्टरिंग के माध्यम से उच्च-परिशुद्धता वाले छद्म तर्क श्रृंखलाओं (pseudo reasoning chains) को उत्पन्न करने के लिए अनलेबल प्रश्नों का लाभ उठाता है, जो विविध गणितीय बेंचमार्क में प्रदर्शन लाभ को अधिकतम करने के लिए चयन और प्रशिक्षण रणनीतियों में सुधार की आवश्यकता पर प्रकाश डालते हुए प्रभावी प्रशिक्षण संकेतों के रूप में उनकी क्षमता को प्रदर्शित करता है।

Hongyang He, Jiuming Liu, Victor Sanchez2026-07-03
🤖 machine learning

The risk of KV cache compression

यह शोध पत्र अंतर्निहित संपीड़नीयता (intrinsic compressibility) के आधार पर इसके मिनिमैक्स जोखिम (minimax risk) को अभिलक्षित करके, कॉज़ल मास्किंग (causal masking) के लिए इष्टतम डिज़ाइन सिद्धांतों को व्युत्पन्न करके, और एक नए एल्गोरिदम को मान्य करके KV कैश संपीड़न में अनुभवजन्य प्रथाओं और सैद्धांतिक सीमाओं के बीच के अंतर को पाटता है, जो सैद्धांतिक गारंटियों के साथ LongBench पर उत्कृष्ट प्रदर्शन प्राप्त करता है।

Lukas Haverbeck, Carmen Amo Alonso, Andres Felipe Posada-Moreno, Sebastian Trimpe, Marco Pavone2026-07-03
🤖 machine learning

Multi-Head Recurrent Memory Agents

यह शोध पत्र मल्टी-हेड रिकरेंट मेमोरी (MHM) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो मेमोरी को स्वतंत्र हेड्स में विभाजित करता है और ओवरराइटिंग को रोकने के लिए एक 'सेलेक्ट-देन-अपडेट' रणनीति का उपयोग करता है, जिससे विभिन्न मॉडलों और स्केल्स में लॉन्ग-कॉन्टेक्स्ट रिटेंशन और एंड-टू-एंड प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jiatong Li, Samuel Yeh, Sharon Li2026-07-03
🤖 AI

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration

OPINE-World एक LLM-आधारित एजेंट है जो परिकल्पना सृजन (hypothesis generation) को ऑन्टोलॉजी-त्रुटि-प्राथमिकता वाले अन्वेषण (ontology-error-prioritized exploration) के साथ जोड़कर, पिक्सेल-आधारित अंतःक्रियाओं से डेटा-कुशल, पुन: प्रयोज्य, वस्तु-केंद्रित प्रोग्रामेटिक वर्ल्ड मॉडल ऑनलाइन सीखता है, जिससे बिना प्रति-खेल प्रशिक्षण के चुनौतीपूर्ण ARC-AGI-3 बेंचमार्क पर उत्कृष्ट प्रदर्शन प्राप्त होता है।

David Courtis, Wenhao Li, Scott Sanner2026-07-03