📊 statistics

Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with kk-step Policy Gradients

यह शोध पत्र एक सामान्यीकृत kk-स्टेप पॉलिसी ग्रेडिएंट पद्धति प्रस्तावित करता है जो kk-स्टेप विंडो पर यादृच्छिकता (randomness) को जोड़कर प्रतिबंधित पॉलिसी वर्गों में निहित अल्पदर्शी स्थानीय इष्टतमों (myopic local optima) पर विजय प्राप्त करता है, जो वितरण बेमेल कारकों (distribution mismatch factors) पर निर्भर किए बिना निकट-इष्टतम समाधानों में अभिसरण की सैद्धांतिक गारंटी देता है।

Alex DeWeese, Guannan Qu2026-05-12
⚛️ quantum physics

Equivariant Reinforcement Learning for Clifford Quantum Circuit Synthesis

यह शोध पत्र एक इक्विवेरिएंट (equivariant), आकार-अज्ञेय (size-agnostic) सुदृढीकरण शिक्षण (reinforcement learning) एजेंट प्रस्तुत करता है जो ऑल-टू-ऑल कनेक्टिविटी वाले उपकरणों के लिए इष्टतम या निकट-इष्टतम क्लिफोर्ड क्वांटम सर्किटों को कुशलतापूर्वक संश्लेषित करता है, जो कि Qiskit के सिंथेसाइज़र जैसे मौजूदा उपकरणों से बेहतर प्रदर्शन करता है और छह से तीस क्विबिट तक सफलतापूर्वक स्केल करता है।

Richie Yeung, Aleks Kissinger, Rob Cornish2026-05-12
🔢 mathematics

Quantifying Concentration Phenomena of Mean-Field Transformers in the Low-Temperature Regime

यह शोध पत्र गणितीय रूप से सिद्ध करता है कि निम्न-तापमान सीमा (low-temperature limit) में, गहरे एनकोडर-ओनली ट्रांसफॉर्मर में टोकन वितरण तेजी से मॉडल के प्रोजेक्शन मैट्रिसेस द्वारा निर्धारित एक विशिष्ट मेटास्टेबल अवस्था पर केंद्रित हो जाते हैं, जिसका अभिसरण दर (convergence rate) वासरस्टीन दूरी (Wasserstein distance) के माध्यम से परिमाणित किया गया है और बाद के स्पेक्ट्रल-डोमिनेटेड टर्मिनल चरण को दर्शाने वाले संख्यात्मक प्रयोगों द्वारा मान्य किया गया है।

Albert Alcalde, Leon Bungert, Konstantin Riedl, Tim Roith2026-05-12
🤖 machine learning

DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices

यह शोध पत्र DECO को प्रस्तुत करता है, जो एक स्पार्स Mixture-of-Experts आर्किटेक्चर है जो ReLU-आधारित रूटिंग, लर्नेबल एक्सपर्ट-वाइज स्केलिंग और एक नवीन NormSiLU एक्टिवेशन फंक्शन का लाभ उठाकर केवल 20% एक्सपर्ट एक्टिवेशन और एंड-साइड डिवाइसेस पर 3.00× इन्फरेंस स्पीडअप के साथ डेंस-तुलनीय प्रदर्शन प्राप्त करता है।

Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan Liu2026-05-12
🤖 machine learning

ELF: Embedded Language Flows

यह शोध पत्र एम्बेडेड लैंग्वेज फ्लोज़ (ELF) को प्रस्तुत करता है, जो एक निरंतर-समय फ्लो मैचिंग मॉडल है जो डिस्क्रीट टोकन में मैप करने से पहले मुख्य रूप से निरंतर एम्बेडिंग स्पेस में कार्य करता है, और मौजूदा डिस्क्रीट और निरंतर डिफ्यूजन लैंग्वेज मॉडल्स की तुलना में बेहतर जनरेशन गुणवत्ता और दक्षता प्रदर्शित करता है।

Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He2026-05-12
🤖 machine learning

HIVE-COTE 2.0: a new meta ensemble for time series classification

यह शोध पत्र HIVE-COTE 2.0 प्रस्तुत करता है, जो टाइम सीरीज़ क्लासिफिकेशन के लिए एक काफी उन्नत मेटा-एन्सेम्बल है, जिसमें यूनिवेरिएट और मल्टीवेरिएट डेटासेट्स पर अत्याधुनिक सटीकता प्राप्त करने के लिए नवीन क्लासिफायर (TDE, DrCIF, और द आर्सेनल) को शामिल किया गया है।

Matthew Middlehurst, James Large, Michael Flynn, Jason Lines, Aaron Bostrom, Anthony Bagnall2026-05-11
📊 statistics

Unsupervised Feature Based Algorithms for Time Series Extrinsic Regression

यह शोध पत्र टाइम सीरीज़ एक्सट्रिंसिक रिग्रेशन (TSER) बेंचमार्क का विस्तार 63 समस्याओं तक करता है और यह प्रदर्शित करता है कि दो नए प्रस्तावित अनसुपरवाइज्ड फीचर-आधारित एल्गोरिदम, FreshPRINCE और DrCIF, मानक रोटेशन फॉरेस्ट रिग्रेसर सहित मौजूदा तरीकों से काफी बेहतर प्रदर्शन करते हैं।

David Guijo-Rubio, Matthew Middlehurst, Guilherme Arcencio, Diego Furtado Silva, Anthony Bagnall2026-05-11
⚛️ quantum physics

Learning quantum Hamiltonians at any temperature in polynomial time

यह शोध पत्र एक नवीन फ्लैट बहुपद सन्निकटन (flat polynomial approximation) और सम-ऑफ-स्क्वायर रिलैक्सेशन (sum-of-squares relaxation) का उपयोग करके पिछले कम्प्यूटेशनल अवरोधों को दूर करते हुए, किसी भी स्थिर व्युत्क्रम तापमान β>0\beta > 0 पर उनके गिब्स अवस्थाओं (Gibbs states) की बहुपद संख्या प्रतियों से ϵ\epsilon परिशुद्धता के साथ स्थानीय क्वांटम हैमिल्टोनियन (local quantum Hamiltonians) सीखने के लिए एक बहुपद-समय एल्गोरिदम प्रस्तुत करके एक प्रमुख खुली समस्या का समाधान करता है।

Ainesh Bakshi, Allen Liu, Ankur Moitra, Ewin Tang2026-05-11
🤖 AI

Active teacher selection for reward learning

यह शोध पत्र रिवॉर्ड लर्निंग में एकल मानव शिक्षक को मानने की सीमा को संबोधित करने के लिए हिडन यूटिलिटी बैंडिट (HUB) फ्रेमवर्क और एक्टिव टीचर सिलेक्शन (ATS) एल्गोरिदम पेश करता है, जो विविध वास्तविक दुनिया के अनुप्रयोगों में तर्कसंगतता, विशेषज्ञता और लागत में शिक्षक की विषमता को प्रभावी ढंग से मॉडल और लाभान्वित करता है।

Rachel Freedman, Justin Svegliato, Kyle Wray, Stuart Russell2026-05-11
🧬 biology

Clinical Characteristics and Laboratory Biomarkers in ICU-admitted Septic Patients with and without Bacteremia

आईसीयू में भर्ती सेप्टिक रोगियों के 218 मामलों का यह रेट्रोस्पेक्टिव अध्ययन प्रदर्शित करता है कि प्रोकैल्सीटोनिन, बिलीरुबिन, न्यूट्रोफिल-टू-लिम्फोसाइट अनुपात, प्लेटलेट्स, लैक्टिक एसिड, एरिथ्रोसाइट सेडिमेंटेशन रेट और ग्लासगो कोमा स्केल स्कोर को संयोजित करने वाला एक मल्टीवेरिएबल लॉजिस्टिक रिग्रेशन मॉडल, केवल प्रोकैल्सीटोनिन की तुलना में बैक्टीरेमिया (AUC 0.907) के पूर्वानुमान में महत्वपूर्ण रूप से सुधार करता है, जबकि साथ ही बैक्टीरेमिया और बढ़ी हुई मृत्यु दर के बीच एक मजबूत संबंध की भी पुष्टि करता है।

Sangwon Baek, Seung Jun Lee2026-05-11