🤖 machine learning

Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

यह शोध पत्र हुरविट्ज़ क्वार्टरनियन मल्टीप्लिकेटिव क्वांटाइजेशन (HQMQ) को प्रस्तुत करता है, जो एक कैलिब्रेशन-मुक्त विधि है जो 4-तत्वों वाले चंक्स को एक निश्चित हुरविट्ज़ समूह और यादृच्छिक माध्यमिक कोडबुक्स के उत्पाद के माध्यम से क्वांटाइज किए गए क्वार्टरनियन के रूप में निरूपित करके KV कैश को संकुचित करती है, जिससे विविध आधुनिक LLMs में 5.05x तक संपीड़न के साथ लगभग fp16 सटीकता प्राप्त होती है और कैलिब्रेशन की आवश्यकता समाप्त हो जाती है।

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba2026-05-28
🤖 machine learning

Transferable Reinforcement Learning via Probabilistic Latent Embeddings and Dynamic Policy Adaptation for Sim-to-Real Deployment

यह शोध पत्र एक नवीन सुदृढीकरण अधिगम (reinforcement learning) ढांचे का प्रस्ताव करता है जो संभाव्य लेटेंट एनवायरनमेंट एम्बेडिंग्स का अनुमान लगाकर और संदर्भ अनुमान सटीकता के आधार पर नीति जोखिम स्तरों को गतिशील रूप से समायोजित करके साइबर-फिजिकल सिस्टम्स के लिए सुरक्षित और कुशल सिम-टू-रियल ट्रांसफर सुनिश्चित करता है।

Gengyue Han, Yiheng Feng2026-05-28
🤖 machine learning

How the Optimizer Shapes Learned Solutions in Equivariant Neural Networks

यह शोध पत्र यह प्रदर्शित करता है कि म्यूऑन (Muon) ऑप्टिमाइज़र अधिक नियमित लॉस सर्फेस (loss surfaces) को नेविगेट करके और उच्च-रैंक वाले निरूपण (representations) प्रदान करके इक्विवेरिएंट न्यूरल नेटवर्क (equivariant neural networks) के प्रशिक्षण में एडम (Adam) से लगातार बेहतर प्रदर्शन करता है, जो ज्यामितीय गहन शिक्षण (geometric deep learning) के समाधानों को आकार देने में ऑप्टिमाइज़र डिज़ाइन की महत्वपूर्ण लेकिन अल्प-अन्वेषित भूमिका को रेखांकित करता है।

Teodor-Mihai Stupariu, Andrei Manolache2026-05-28
🤖 machine learning

Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting

यह शोध पत्र बीटा-बर्नौली कैलिब्रेटर (बीबीसी) का परिचय देता है, जो एक हल्का तरीका है जो पॉइंट एस्टीमेट्स को विश्वसनीय एपिस्टेमिक अनसर्टेन्टी के साथ कैलिब्रेटेड प्रोबेबिलिस्टिक फोरकास्ट में बदलने के लिए बाइनरी आउटकम्स और ह्यूमन फोरकास्ट डिस्ट्रीब्यूशन दोनों का लाभ उठाता है, जो मौजूदा कैलिब्रेशन और फाइन-ट्यूनिंग दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Hui Dai, Ryan Teehan, Parsa Torabian, Mengye Ren2026-05-28
🤖 AI

Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers

यह शोध पत्र टेंसर मेमोरी (Tensor Memory) का परिचय देता है, जो एक हल्का मॉड्यूल है जो ट्रांसफॉर्मर्स को एक निश्चित आकार के, आवर्ती (recurrent) 3D मेमोरी टेंसर के साथ संवर्धित करता है ताकि अनुक्रम लंबाई (sequence length) से अवस्था क्षमता (state capacity) को अलग किया जा सके और बेहतर दीर्घकालिक वीडियो समझ एवं अवरोध-संवेदनशील तर्क (occlusion-sensitive reasoning) के लिए स्थानिक प्रेरक पूर्वाग्रहों (spatial inductive biases) को संरक्षित किया जा सके।

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba2026-05-28
🤖 machine learning

Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning

यह शोधपत्र सिमुलेशन-इन्फॉर्म्ड डिफ्यूजन (SID) प्रस्तुत करता है, जो एक विकेंद्रीकृत मल्टी-रोबोट मोशन प्लानिंग फ्रेमवर्क है जो पड़ोसियों के भविष्य के प्रक्षेपवक्रों (ट्रैजेक्टरीज) को सिम्युलेट करने और सक्रिय रूप से टकराव-मुक्त पथों की योजना बनाने के लिए कंस्ट्रेंट-अवेयर डिफ्यूजन मॉडल का लाभ उठाता है, जिससे वैश्विक सेंसिंग या निरंतर संचार पर निर्भर किए बिना अत्यधिक भीड़भाड़ वाले वातावरण में स्केलेबिलिटी और सुरक्षा बढ़ती है।

Jinhao Liang, Sven Koenig, Ferdinando Fioretto2026-05-28
🤖 AI

CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text

यह शोध पत्र CiteCheck को प्रस्तुत करता है, जो एक हाइब्रिड फ्रेमवर्क है जो वैज्ञानिक ग्रंथों में साइटेशन हेलोसिनेशन (citation hallucinations) का सटीक रूप से पता लगाने के लिए विद्वत्तापूर्ण पुनर्प्राप्ति (scholarly retrieval) को संरचित LLM सत्यापन के साथ जोड़ता है, और मौजूदा बेसलाइनों की तुलना में एक नए निर्मित भौतिकी बेंचमार्क पर बेहतर प्रदर्शन प्राप्त करता है।

Khashayar Khajavi, Shaghayegh Sadeghi, Rise Adhikari, Alexander Tessier2026-05-28
🤖 AI

Cross-Entropy Games and Frost Training

यह शोध पत्र फ्रॉस्ट ट्रेनिंग (Frost Training) को प्रस्तुत करता है, जो एक नवीन विधि है जो एम्बेडिंग स्पेस में रिवॉर्ड फंक्शन ग्रेडिएंट्स का लाभ उठाती है—जिसका उपयोग पहले जेलब्रेकिंग के लिए किया गया था—LLM-as-a-judge कार्यों के लिए मोंटे कार्लो-आधारित पॉलिसी ऑप्टिमाइज़ेशन को त्वरित और उन्नत करने के लिए, जिसके परिणामस्वरूप उच्च-स्कोर वाले आउटपुट और तेज़ प्रशिक्षण अभिसरण (convergence) प्राप्त होता है।

Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler2026-05-28
🤖 AI

DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation

DeepSciVerify एक दो-चरणीय, LLM-संचालित पाइपलाइन है जो अमूर्त-स्तर के तर्क (abstract-level reasoning) को पूर्ण-पाठ साक्ष्य (full-text evidence) के चयनात्मक एस्केलेशन के साथ जोड़कर वैज्ञानिक दावे-उद्धरण सत्यापन की सटीकता और दक्षता को बढ़ाता है।

Shaghayegh Sadeghi, Khashayar Khajavi, Rise Adhikari, Alexander Tessier2026-05-28
🤖 machine learning

Worker Disagreement Reveals Sharp Directions in Local SGD

यह शोध पत्र प्रदर्शित करता है कि लोकल SGD में श्रमिकों के बीच की असहमति स्वाभाविक रूप से लॉस लैंडस्केप की तीव्र, प्रमुख दिशाओं को उजागर करती है, जो बेहतर न्यूरल नेटवर्क प्रशिक्षण के लिए प्रमुख उप-स्थान (dominant subspace) का अनुमान लगाने हेतु एक गणनात्मक रूप से कुशल, हेसियन-मुक्त विधि प्रदान करती है।

Tolga Dimlioglu, Kristi Topollai, Anna Choromanska2026-05-28