🤖 machine learning

Bridging the Gap between Newton-Raphson Method and Regularized Policy Iteration

यह शोधपत्र यह स्थापित करता है कि रेगुलराइज्ड पॉलिसी इटरेशन (Regularized Policy Iteration), स्मूथ बेलमैन समीकरणों (smoothed Bellman equations) पर लागू न्यूटन-राफसन विधि के औपचारिक रूप से समतुल्य है, जिससे इसकी स्थानीय द्विघाती अभिसरणता (local quadratic convergence) सिद्ध होती है (जो शैनन एंट्रॉपी के लिए आयाम-मुक्त है) और रेगुलराइज्ड मार्कोव निर्णय प्रक्रियाओं (regularized Markov decision processes) के लिए एक नए तृतीय-क्रम अभिसरण एल्गोरिदम के विकास को सक्षम बनाती है।

Zeyang Li, Chuxiong Hu, Yunan Wang, Guojian Zhan, Jie Li, Yao Lyu, Shengbo Eben Li2026-07-17
🤖 machine learning

Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

यह शोध पत्र जेनेरालाइज्ड फिशर-वेटेड एसवीडी (GFWSVD) का प्रस्ताव करता है, जो बड़े भाषा मॉडलों के लिए एक स्केलेबल पोस्ट-ट्रेनिंग कंप्रेशन विधि है जो पैरामीटर सहसंबंधों को पकड़ने के लिए पूर्ण फिशर सूचना मैट्रिक्स के क्रोनेकर-फैक्टर्ड सन्निकटन (Kronecker-factored approximation) का उपयोग करती है और मौजूदा डायगोनल-आधारित कंप्रेशन तकनीकों से काफी बेहतर प्रदर्शन करती है।

Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov2026-07-17
🤖 machine learning

Fully Offline Reinforcement Learning

यह शोध पत्र SOReL और TOReL को प्रस्तुत करता है, जो एक पूर्णतः ऑफलाइन बेयसियन ढांचा (Bayesian framework) है जो बिना किसी ऑनलाइन इंटरैक्शन के, मॉडल-आधारित और मॉडल-मुक्त सुदृढीकरण शिक्षण (reinforcement learning) दोनों के लिए विश्वसनीय हाइपरपैरामीटर ट्यूनिंग और प्रदर्शन अनुमान सक्षम करता है, जबकि मिनिमैक्स-इष्टतम अभिसरण (minimax-optimal convergence) की सैद्धांतिक गारंटी भी प्रदान करता है।

Mattie Fellows, Clarisse Wibault, Uljad Berdica, Johannes Forkel, Maike Osborne, Jakob N. Foerster2026-07-17
📊 statistics

Gibbs randomness-compression proposition

यह शोध पत्र "गिब्स रैंडमनेस-कंप्रेशन प्रपोजिशन" (Gibbs randomness-compression proposition) का प्रस्ताव और प्रयोगात्मक रूप से सत्यापन करता है, जो संकुचित डीप लर्निंग मॉडल्स के शेष भार (weights) पर मापे गए गिब्स एंट्रॉपी और सीखने के प्रदर्शन के बीच उच्च सहसंबंध को प्रदर्शित करके मॉडल कंप्रेशन और निर्देशित यादृच्छिकता (directed randomness) के बीच एक गणनीय संबंध स्थापित करता है।

M. Süzen2026-07-17
🔬 materials science

Mic-hackathon 2024: Hackathon on Machine Learning for Electron and Scanning Probe Microscopy

Mic-hackathon 2024 ने डेटा अक्षमताओं को दूर करने, रीयल-टाइम ML एनालिटिक्स विकसित करने और इलेक्ट्रॉन एवं स्कैनिंग प्रोब माइक्रोस्कोपी के लिए वर्कफ़्लो को मानकीकृत करने हेतु बेंचमार्क डेटासेट और डिजिटल ट्विन्स बनाने के लिए सहयोग को बढ़ावा देकर मशीन लर्निंग और माइक्रोस्कोपी समुदायों के बीच की खाई को पाटा।

Utkarsh Pratiush, Austin Houston, Kamyar Barakati, Aditya Raghavan, Dasol Yoon, Harikrishnan KP, Zhaslan Baraissov, Desh (…)2026-07-17
🤖 machine learning

The Effect of Stochasticity in Score-Based Diffusion Sampling: a KL Divergence Analysis

यह शोध पत्र KL डाइवर्जेंस (KL divergence) सीमाओं को व्युत्पन्न करके स्कोर-आधारित डिफ्यूजन सैंपलिंग में स्टोकेस्टिसिटी (stochasticity) के प्रभाव का विश्लेषण करता है जो त्रुटि सुधार (error correction) और प्रवर्धन (amplification) के बीच एक व्यापार-संबंध (trade-off) को प्रकट करते हैं, यह प्रदर्शित करते हुए कि इष्टतम स्टोकेस्टिसिटी प्रोफाइल मॉडल की स्कोर त्रुटियों के समय-स्थानीयकरण (time-localization) पर निर्भर करती है।

Bernardo P. Schaeffer, Ricardo M. S. Rosa, Glauco Valle2026-07-17
📊 statistics

Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning

यह शोध पत्र सिमिलैरिटी एज़ रिवॉर्ड अलाइनमेंट (SARA) को प्रस्तुत करता है, जो प्राथमिकता-आधारित सुदृढीकरण शिक्षण (preference-based reinforcement learning) के लिए एक सुदृढ़ कंट्रास्टिव फ्रेमवर्क है जो रिवॉर्ड्स की गणना समानता के रूप में करने के लिए लेटेंट रिप्रेजेंटेशन सीखता है, और निरंतर नियंत्रण बेंचमार्क (continuous control benchmarks) पर बेसलाइन्स की तुलना में बेहतर स्थिरता और शोर प्रतिरोध (noise resilience) प्रदर्शित करता है।

Sara Rajaram, R. James Cotton, Fabian H. Sinz2026-07-17
🤖 machine learning

VideoGAN-based Trajectory Proposal for Automated Vehicles

यह शोध पत्र एक VideoGAN-आधारित पाइपलाइन का प्रस्ताव करता है जो लो-रिज़ॉल्यूशन बर्ड्स-आई व्यू ऑक्यूपेंसी ग्रिड वीडियो से सांख्यिकीय रूप से सटीक और भौतिक रूप से यथार्थवादी वाहन प्रक्षेपवक्र (ट्रैजेक्टरी) उत्पन्न करता है, जो भविष्य के ट्रैफ़िक परिदृश्यों के जटिल मल्टीमॉडल वितरण को प्रभावी ढंग से कैप्चर करते हुए तेज़ इन्फरेंस समय प्राप्त करता है।

Annajoyce Mariani, Kira Maag, Hanno Gottschalk2026-07-17
🤖 machine learning

Query Efficient Structured Matrix Learning

यह शोधपत्र प्रदर्शित करता है कि एक परिमित परिवार (finite family) से निकट-इष्टतम संरचित मैट्रिक्स सन्निकटन (near-optimal structured matrix approximation) सीखना O~(logF)\tilde{O}(\sqrt{\log|\mathcal{F}|}) मैट्रिक्स-वेक्टर उत्पाद प्रश्नों के साथ प्राप्त किया जा सकता है, जो मानक O(logF)O(\log|\mathcal{F}|) सीमा पर लगभग द्विघाती सुधार का प्रतिनिधित्व करता है और आयाम qq के लिए O~(q)\tilde{O}(\sqrt{q}) जटिलता के साथ अनंत परिवारों तक विस्तृत होता है।

Noah Amsel, Pratyush Avi, Tyler Chen, Feyza Duman Keles, Chinmay Hegde, Cameron Musco, Christopher Musco, David Persson2026-07-17
🔬 condensed matter

Learning Pseudorandom Numbers with Transformers: Permuted Congruential Generators, Curricula, and Interpretability

यह शोध पत्र प्रदर्शित करता है कि ट्रांसफॉर्मर मॉडल करिकुलम लर्निंग और बिटवाइज़ रोटेशनली-इनवेरिएंट (bitwise rotationally-invariant) निरूपणों की खोज के माध्यम से जटिल परम्यूटेड कॉन्ग्रुएंशियल जनरेटर्स (PCGs) से अनुक्रमों को सफलतापूर्वक सीख सकते हैं और उनका पूर्वानुमान लगा सकते हैं, जो एक ऐसे स्केलिंग लॉ (scaling law) को प्रकट करता है जहाँ आवश्यक संदर्भ लंबाई (context length) मॉडुलस के वर्गमूल के रूप में बढ़ती है।

Tao Tao, Maissam Barkeshli2026-07-17