📊 statistics

Sample-Efficient Optimisation over the Outputs of Generative Models

यह शोध पत्र O3 को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) विधि है जो अंतर्निहित मॉडल को पुन: प्रशिक्षित किए बिना बेहतर कार्य-विशिष्ट नमूनों को खोजने के लिए निम्न-आयामी, प्रशिक्षण-मुक्त सरोगेट लेटेंट स्पेस (surrogate latent spaces) का लाभ उठाकर निरंतर-चर जनरेटिव मॉडल्स पर सैंपल-कुशल ब्लैक-बॉक्स अनुकूलन को सक्षम बनाता है।

Samuel Willis, Paul Duckworth, Jack Simons, Aleksandra Kalisz, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry (…)2026-05-14
📊 statistics

Beyond Softmax: A Natural Parameterization for Categorical Random Variables

यह शोध पत्र श्रेणीगत लेटेंट वेरिएबल्स (categorical latent variables) में ग्रेडिएंट डिसेंट की सीमाओं को दूर करने के लिए पदानुक्रमित बाइनरी स्प्लिट्स (hierarchical binary splits) पर आधारित एक नवीन "catnat" पैरामीट्राइजेशन के माध्यम से मानक सॉफ्टमैक्स फंक्शन को बदलने का प्रस्ताव करता है, जो सूचना ज्यामिति (information geometry) और व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण एक विकर्ण फिशर सूचना मैट्रिक्स (diagonal Fisher Information Matrix), बेहतर शिक्षण दक्षता और विविध डीप लर्निंग कार्यों में श्रेष्ठ परीक्षण प्रदर्शन प्रदान करता है।

Alessandro Manenti, Cesare Alippi2026-05-14
🧬 biology

Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception

यह शोध पत्र बिहेवियरल ज्योमेट्रिक सुपरविजन (BGS) को प्रस्तुत करता है, जो एक हाइब्रिड ऑब्जेक्टिव है जो एम्बेडिंग ज्योमेट्री को मानव समानता निर्णयों के अनुरूप सीमित करके वीडियो फाउंडेशन मॉडल्स को मानवीय सामाजिक धारणा के साथ संरेखित करता है, जिससे मॉडल भाषा-आधारित बेसलाइन से काफी बेहतर प्रदर्शन करने, व्याख्या योग्य सामाजिक-भावात्मक गुणों को विकसित करने और उन विशेषताओं पर स्पष्ट प्रशिक्षण के बिना सामाजिक रूप से सूचनात्मक क्षेत्रों पर ध्यान केंद्रित करने में सक्षम होते हैं।

Kathy Garcia, Leyla Isik2026-05-14
🤖 machine learning

Probabilistic Prediction Markets with Intermittent Contributions

यह शोध पत्र एक लचीले प्रेडिक्शन मार्केट फ्रेमवर्क का प्रस्ताव और विश्लेषण करता है जो इष्टतम पूर्वानुमान उत्पन्न करने और पुरस्कार आवंटित करने के लिए ऐतिहासिक एजेंट प्रदर्शन को रोबस्ट रिग्रेशन के साथ जोड़ता है, जो रुक-रुक कर होने वाले योगदान, समय के साथ बदलते परिवेश और गतिशील एजेंट भागीदारी को प्रभावी ढंग से समायोजित करता है।

Michael Vitali, Pierre Pinson2026-05-14
🧬 biology

Protein Folding with Neural Ordinary Differential Equations

यह शोध पत्र इवोफॉर्मर (Evoformer) आर्किटेक्चर के एक निरंतर-गहराई वाले न्यूरल ओडीई (Neural ODE) फॉर्मूलेशन का प्रस्ताव करता है जो अल्फाफोल्ड (AlphaFold) जैसे पारंपरिक डीप लर्निंग मॉडलों के लिए एक हल्का और अनुकूलनीय विकल्प प्रदान करते हुए, प्लाउज़िबल (plausible) प्रोटीन संरचनाओं की भविष्यवाणी करने की क्षमता बनाए रखते हुए कंप्यूटेशनल लागत और मेमोरी उपयोग को काफी कम करता है।

Arielle Sanford, Shuo Sun, Christian B. Mendl2026-05-14
🤖 machine learning

On the Sample Complexity of Differentially Private Policy Optimization

यह शोध पत्र ऑन-पॉलिसी लर्निंग के लिए एक विशेष गोपनीयता परिभाषा को औपचारिक रूप देकर और पॉलिसी ग्रेडिएंट तथा नेचुरल पॉलिसी ग्रेडिएंट जैसे एल्गोरिदम की सैंपल कॉम्प्लेक्सिटी का विश्लेषण करके डिफरेंशियल प्राइवेट पॉलिसी ऑप्टिमाइज़ेशन के एक सैद्धांतिक अध्ययन की शुरुआत करता है, जिससे यह पता चलता है कि गोपनीयता लागत अक्सर लोअर-ऑर्डर टर्म्स के रूप में दिखाई देती है और गोपनीयता-संरक्षित सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) के लिए व्यावहारिक अंतर्दृष्टि प्रदान करती है।

Yi He, Xingyu Zhou2026-05-14
💬 NLP

Higher-order Linear Attention

यह शोध पत्र हायर-ऑर्डर लीनियर अटेंशन (HLA) को प्रस्तुत करता है, जो एक स्केलेबल, कॉज़ल मैकेनिज्म है जो कॉम्पैक्ट प्रीफ़िक्स पर्याप्त सांख्यिकी (prefix sufficient statistics) को बनाए रखकर लीनियर टाइम कॉम्प्लेक्सिटी के साथ हायर-ऑर्डर इंटरैक्शन प्राप्त करता है, जिससे रिकरेंट आर्किटेक्चर की अभिव्यक्ति क्षमता को संरक्षित करते हुए मानक अटेंशन की क्वाड्रेटिक लागत पर विजय प्राप्त की जा सकती है।

Yifan Zhang, Zhen Qin, Quanquan Gu2026-05-14
🤖 machine learning

Sharpness-Guided Group Relative Policy Optimization via Probability Shaping

यह शोध पत्र शार्पनेस-गाइडेड GRPO (GRPO-SG) का प्रस्ताव करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) का एक टोकन-वेटेड वेरिएंट है, जो शार्पनेस को कम करने और प्रशिक्षण को स्थिर करने के लिए बड़े ग्रेडिएंट्स उत्पन्न करने वाले टोकन्स को डाउनवेट करके, सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) में सामान्यीकरण (generalization) में सुधार करता है।

Tue Le, Linh Ngo Van, Trung Le2026-05-14
⚛️ quantum physics

Limitations of Quantum Advantage in Unsupervised Machine Learning

यह शोधपत्र अनसुपरवाइज्ड मशीन लर्निंग में क्वांटम लाभ की सीमाओं की जांच करता है, यह प्रदर्शित करते हुए कि शास्त्रीय मॉडलों पर कोई भी संभावित लाभ विशिष्ट इनपुट डेटा और लक्षित अवलोकनीय (observables) पर महत्वपूर्ण रूप से निर्भर करता है, न कि एक सार्वभौमिक विशेषता पर।

Apoorva D. Patel2026-05-14