🤖 machine learning

Hölder Policy Optimisation

यह शोध पत्र HölderPO प्रस्तुत करता है, जो एक सामान्यीकृत पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है जो ग्रेडिएंट एकाग्रता और वेरिएंस स्थिरता को संतुलित करने के लिए होल्डर मीन पैरामीटर को गतिशील रूप से समायोजित करता है, जिससे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) में फिक्स्ड एग्रीगेशन की सीमाओं को हल किया जाता है और गणितीय एवं कार्य-उन्मुख बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin (…)2026-05-13
🤖 machine learning

Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

यह शोध पत्र एसिंक्रोनस एजेंटिक आरएल (asynchronous agentic RL) में महत्वपूर्ण "मिसिंग ओल्ड लॉजिट्स" (missing old logits) समस्या की पहचान करता है जो ऑफ-पॉलिसी करेक्शन सिमेंटिक्स को बाधित करती है, इन मानों को पुनः प्राप्त करने या अनुमान लगाने के लिए तीन सटीक रणनीतियों और एक अनुमानित विधि का प्रस्ताव करता है, और यह प्रदर्शित करता है कि एक संशोधित PPO-EWMA दृष्टिकोण प्रशिक्षण गति और अनुकूलन प्रदर्शन दोनों में महत्वपूर्ण सुधार करता है।

Zhong Guan, Yongjian Guo, Haoran Sun, Wen Huang, Shuai Di, Xiong Jun Wu, Likang Wu, Hongke Zhao2026-05-13
🤖 machine learning

Elicitation-Augmented Bayesian Optimization

यह शोध पत्र एक मानव-इन-द-लूप बेयसियन अनुकूलन ढांचे को प्रस्तुत करता है जो अंतर्निहित विशेषज्ञ ज्ञान को प्राप्त करने के लिए युग्मवार तुलनाओं का लाभ उठाता है, और बेहतर नमूना दक्षता के लिए प्रत्यक्ष अवलोकनों और विशेषज्ञ प्रश्नों के बीच गतिशील रूप से संतुलन बनाने हेतु एक लागत-जागरूक सूचना-का-मूल्य अधिग्रहण फलन का उपयोग करता है।

Alvar Haltia, Ville Hyvönen, Samuel Kaski2026-05-13
⚡ electrical engineering

Learning What Matters: Adaptive Information-Theoretic Objectives for Robot Exploration

यह शोध पत्र क्वाज़ी-ऑप्टिमल एक्सपेरिमेंटल डिज़ाइन (QOED) का प्रस्ताव करता है, जो एक अनुकूली सूचना-सैद्धांतिक उद्देश्य है जो अवलोकन योग्य पैरामीटर दिशाओं की पहचान करके और बाधा उत्पन्न करने वाले प्रभावों को दबाकर रोबोट अन्वेषण को बढ़ाता है, जिससे सिम्युलेटेड और वास्तविक दुनिया के कार्यों में डेटा दक्षता और नीति प्रदर्शन में महत्वपूर्ण सुधार होता है।

Youwei Yu, Jionghao Wang, Zhengming Yu, Wenping Wang, Lantao Liu2026-05-13
📊 statistics

Keeping Score: Efficiency Improvements in Neural Likelihood Surrogate Training via Score-Augmented Loss Functions

यह शोध पत्र एक स्कोर-ऑगमेंटेड लॉस फंक्शन प्रस्तावित करता है जो सटीक ग्रेडिएंट जानकारी को शामिल करता है ताकि संरचित स्टोकेस्टिक प्रोसेस मॉडल के लिए न्यूरल लाइकलीहुड सरोगेट्स की दक्षता और गुणवत्ता में महत्वपूर्ण सुधार किया जा सके, जिससे न्यूनतम अतिरिक्त कम्प्यूटेशनल लागत के साथ दस गुना अधिक प्रशिक्षण डेटा के बराबर इन्फरेंस प्रदर्शन प्राप्त होता है।

Alexander Shen, Mikael Kuusela2026-05-13
⚡ electrical engineering

STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts

STRUM एक मल्टी-स्टेज हाइब्रिड ऑडियो-टू-चार्ट पाइपलाइन है जो बिना किसी मेटाडेटा की आवश्यकता के, ड्रम, गिटार, बास, वोकल्स और कीज़ के लिए कच्चे संगीत रिकॉर्डिंग को खेलने योग्य रिदम-गेम चार्ट में परिवर्तित करती है, जो विशेष न्यूरल डिटेक्टरों और क्लासिफायर के माध्यम से एक क्यूरेटेड बेंचमार्क पर मजबूत प्रदर्शन प्राप्त करती है।

Joshua Opria2026-05-13
🤖 machine learning

PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

यह शोध पत्र PrivacySIM को प्रस्तुत करता है, जो एक मूल्यांकन सुइट है जो 1,000 वास्तविक उपयोगकर्ता प्रतिक्रियाओं के विरुद्ध नौ फ्रंटियर LLMs का बेंचमार्क करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि पर्सोना कंडीशनिंग सिमुलेशन सटीकता में सुधार करती है, फिर भी वर्तमान मॉडल व्यक्तिगत गोपनीयता निर्णयों को निष्ठापूर्वक दोहराने में संघर्ष करते हैं, विशेष रूप से उन उपयोगकर्ताओं के लिए जिनका AI अनुभव उच्च है लेकिन घोषित गोपनीयता चिंताएं कम हैं।

James Flemings, Murali Annavaram2026-05-13
🔬 physics

Machine Learning for neutron source distributions

यह शोध पत्र मोंटे कार्लो कण सूचियों (Monte Carlo particle lists) से न्यूट्रॉन स्रोत वितरण का अनुमान लगाने के लिए संभाव्य जनरेटिव मॉडल (probabilistic generative models) का उपयोग करने वाले एक नवीन दृष्टिकोण का प्रस्ताव और मूल्यांकन करता है, जो मॉडलों के प्रशिक्षित होने के बाद कुशल, स्मृति-स्वतंत्र (memory-independent) नमूनाकरण को सक्षम बनाता है।

Jose Ignacio Robledo, Norberto Schmidt, Klaus Lieutenant, Jingjing Li, Stefan Kesselheim, Paul Zakalek2026-05-13
🤖 machine learning

On What We Can Learn from Low-Resolution Data

यह शोध पत्र एक सैद्धांतिक विश्लेषण और अनुभवजन्य साक्ष्य प्रदान करता है जो यह प्रदर्शित करता है कि प्रशिक्षण सेटों में निम्न-रिज़ॉल्यूशन वाले डेटा को शामिल करना उच्च-रिज़ॉल्यूशन वाले कार्यों पर मॉडल के प्रदर्शन में निरंतर सुधार करता है, विशेष रूप से उन संसाधन-सीमित क्षेत्रों में जहाँ उच्च-रिज़ॉल्यूशन वाला डेटा दुर्लभ है।

Theresa Dahl Frehr, Niels Henrik Pontoppidan, Hiba Nassar, Tommy Sonne Alstrøm2026-05-13
🤖 AI

Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics

यह शोध पत्र तर्क देता है कि कॉन्फ़िगर करने योग्य एंटरप्राइज़ सिस्टम में, एजेंटों को केवल भंगुर (brittle), ऑफलाइन-प्रशिक्षित वर्ल्ड मॉडल्स पर निर्भर रहने के बजाय सक्रिय बिजनेस लॉजिक की रनटाइम डिस्कवरी को प्राथमिकता देनी चाहिए, जो नए CascadeBench बेंचमार्क के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण डिप्लॉयमेंट शिफ्ट्स के विरुद्ध मजबूती (robustness) में महत्वपूर्ण सुधार करता है।

Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary, Surajit Dasgupta, Sravan Ramachandran, Aakash Bhagat, Sh (…)2026-05-13