📊 statistics

Toward Scalable and Valid Conditional Independence Testing with Spectral Representations

यह शोध पत्र एक स्केलेबल और सांख्यिकीय रूप से वैध सशर्त स्वतंत्रता परीक्षण ढांचे का प्रस्ताव करता है जो कर्नेल-आधारित सिद्धांत को आधुनिक प्रतिनिधित्व शिक्षण (रिप्रजेंटेशन लर्निंग) के साथ जोड़ने के लिए एक द्वि-स्तरीय कंट्रास्टिव लर्निंग एल्गोरिदम के भीतर आंशिक सहप्रसरण ऑपरेटरों के सिंगुलर वैल्यू डिकंपोजिशन का लाभ उठाता है।

Alek Fröhlich, Vladimir R. Kostic, Karim Lounici, Daniel Perazzo, Daniel Tiezzi, Massimiliano Pontil2026-06-05
🤖 AI

Reward Learning through Ranking Mean Squared Error

यह शोध पत्र आरएल के लिए रैंकड रिटर्न रिग्रेशन (R4) प्रस्तुत करता है, जो एक नवीन रिवॉर्ड लर्निंग विधि है जो मानव प्रक्षेपवक्र रेटिंग से रिवॉर्ड फंक्शन का अनुमान लगाने के लिए रैंकिंग मीन स्क्वेयर्ड एरर लॉस का उपयोग करती है, जो न्यूनतमता और पूर्णता की औपचारिक गारंटी प्रदान करते हुए रोबोटिक बेंचमार्क पर मौजूदा प्राथमिकता-आधारित दृष्टिकोणों से अनुभवजन्य रूप से बेहतर प्रदर्शन करती है।

Chaitanya Kharyal, Calarina Muslimani, Matthew E. Taylor2026-06-05
💬 NLP

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

यह शोध पत्र डायनेमिक थिंकिंग-टोकन सिलेक्शन (DynTS) का प्रस्ताव करता है, जो एक ऐसी विधि है जो रीजनिंग ट्रेसेस में निर्णय-महत्वपूर्ण टोकन के केवल की-वैल्यू (Key-Value) कैश स्टेट्स को पहचानने और बनाए रखने तथा अनावश्यक प्रविष्टियों को हटाने के माध्यम से लार्ज रीजनिंग मॉडल्स की दक्षता को बढ़ाती है।

Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen2026-06-05
🤖 machine learning

Unraveling the Hidden Dynamical Structure in Recurrent Neural Policies

यह शोध पत्र प्रकट करता है कि आवर्ती तंत्रिका नीतियां (recurrent neural policies) अपने छिपे हुए अवस्था स्थान (hidden state space) में स्थिर सीमा चक्र संरचनाओं (limit cycle structures) को बनाकर बेहतर सामान्यीकरण और मजबूती प्राप्त करती हैं, जो कौशल अनुकूलन को सुगम बनाने के लिए व्यवहार संबंधी संबंध संरचनाओं को कूटबद्ध करते हुए आंतरिक स्मृति और पर्यावरणीय अवस्थाओं को स्थिर करती हैं।

Jin Li, Yue Wu, Mengsha Huang, Yuhao Sun, Hao He, Xianyuan Zhan2026-06-05
🤖 AI

Beyond Rewards in Reinforcement Learning for Cyber Defence

यह शोध पत्र प्रदर्शित करता है कि साइबर रक्षा के लिए डीप रिइन्फोर्समेंट लर्निंग एजेंटों को प्रशिक्षित करने में स्पार्स (sparse), लक्ष्य-संरेखित रिवॉर्ड फंक्शन, डेंस (dense), इंजीनियर किए गए रिवॉर्ड्स की तुलना में बेहतर प्रदर्शन करते हैं, जिसके परिणामस्वरूप अधिक विश्वसनीय, कम जोखिम वाली नीतियां प्राप्त होती हैं जो महंगी रक्षात्मक कार्रवाइयों के उपयोग को प्रभावी ढंग से कम करती हैं।

Elizabeth Bates, Chris Hicks, Vasilios Mavroudis2026-06-05
📊 statistics

On the Convergence of Multicalibration Gradient Boosting

यह शोध पत्र मल्टीकैलिब्रेशन ग्रेडिएंट बूस्टिंग के लिए कम्प्यूटेशनल अभिसरण (convergence) गारंटी स्थापित करता है, जो यह प्रदर्शित करता है कि अनुभवजन्य मल्टीकैलिब्रेशन त्रुटि सामान्यतः O(1/T)O(1/\sqrt{T}) की दर से घटती है और अतिरिक्त स्मूथनेस मान्यताओं के तहत रैखिक अभिसरण (linear convergence) में सुधर जाती है, जिसका वास्तविक दुनिया के डेटासेट्स पर प्रयोगात्मक सत्यापन किया गया है।

Daniel Haimovich, Fridolin Linder, Lorenzo Perini, Niek Tax, Milan Vojnovic2026-06-05
🤖 machine learning

Harpoon: Generalised Manifold Guidance for Conditional Tabular Diffusion

यह शोध पत्र HARPOON को प्रस्तुत करता है, जो कंडीशनल टैबुलर डिफ्यूजन के लिए एक सामान्यीकृत मैनिफोल्ड गाइडेंस विधि है जो मैनिफोल्ड थ्योरी को डिस्क्रीट डेटा और विविध इन्फरेंस-टाइम उद्देश्यों तक विस्तारित करता है, जिससे बिना पुनरप्रशिक्षण (रिट्रेनिंग) के विशिष्ट बाधाओं को पूरा करने वाले सैंपल्स का निर्माण सक्षम होता है।

Aditya Shankar, Yuandou Wang, Rihan Hai, Lydia Y. Chen2026-06-05
💬 NLP

Learning Self-Correction in Vision-Language Models via Rollout Augmentation

यह शोधपत्र Octopus पेश करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रोलआउट पुनर्संयोजन (rollout recombination) और एक रिस्पॉन्स-मास्किंग रणनीति के माध्यम से सघन स्व-सुधार उदाहरणों को संश्लेषित करके विजन-लैंग्वेज मॉडल्स के लिए सैंपल दक्षता को बढ़ाता है और प्रशिक्षण को स्थिर करता है, जिसके परिणामस्वरूप अत्याधुनिक Octopus-8B मॉडल प्राप्त होता है।

Yi Ding, Ziliang Qiu, Bolian Li, Ruqi Zhang2026-06-05
💬 NLP

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

यह शोध पत्र बजट-गाइडेड एमसीटीएस (BG-MCTS) का प्रस्ताव करता है, जो एक ट्री-सर्च डिकोडिंग एल्गोरिदम है जो गणितीय और भौतिकी तर्क कार्यों में बजट-अज्ञेयवादी बेसलाइनों से बेहतर प्रदर्शन करने के लिए शेष टोकन बजट के साथ अन्वेषण (exploration) और परिशोधन (refinement) रणनीतियों को गतिशील रूप से संरेखित करता है।

Sora Miyamoto, Daisuke Oba, Naoaki Okazaki2026-06-05