🔢 mathematics

DT-PBO: an Interpretable Tree-based Surrogate Model for Preferential Bayesian Optimization

यह शोध पत्र DT-PBO का प्रस्ताव करता है, जो प्रिफरेंशियल बेयसियन ऑप्टिमाइज़ेशन (Preferential Bayesian Optimization) के लिए एक नवीन व्याख्या योग्य ट्री-आधारित सरोगेट मॉडल है, जो पारंपरिक गॉसियन प्रोसेस-आधारित दृष्टिकोणों की व्याख्यात्मकता संबंधी सीमाओं को संबोधित करते हुए, निर्णय लेने वाले की प्राथमिकताओं में पारदर्शी अंतर्दृष्टि प्रदान करते हुए प्रतिस्पर्धी प्रदर्शन और मजबूती प्राप्त करता है।

Nick Leenders, Thomas Quadt, Boris Cule, Roy Lindelauf, Herman Monsuur, Joost van Oijen, Mark Voskuijl2026-05-11
🤖 machine learning

Bloom Filter Encoding for Machine Learning

यह शोध पत्र एक ब्लूम फ़िल्टर-आधारित एन्कोडिंग पद्धति प्रस्तावित करता है जो विविध डेटा प्रकारों को मेमोरी उपयोग को कम करने और मूल मानों को अस्पष्ट करने के लिए संक्षिप्त, निश्चित-लंबाई वाले बिट सरणियों में परिवर्तित करता है, यह प्रदर्शित करते हुए कि इन निरूपणों पर प्रशिक्षित मशीन लर्निंग मॉडल कच्चे डेटा या मानक आयामी कमी तकनीकों का उपयोग करने वाले मॉडलों के प्रदर्शन के तुलनीय परिणाम प्राप्त करते हैं।

John Cartmell, Mihaela Cardei, Ionut Cardei2026-05-11
💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

यह शोध पत्र तर्क देता है कि चेन-ऑफ-थॉट रीजनिंग (Chain-of-Thought reasoning) प्रॉम्प्ट-इंजेक्टेड संकेतों (prompt-injected hints) को स्पष्ट रूप से मौखिक रूप से व्यक्त किए बिना भी निष्ठावान (faithful) हो सकती है, जो अपूर्णता को निष्ठाहीनता के साथ मिलाने वाले "बायसिंग फीचर्स" (Biasing Features) मीट्रिक को चुनौती देता है और एक व्यापक व्याख्यात्मक टूलकिट (interpretability toolkit) की वकालत करता जिसमें कॉज़ल मीडिएशन एनालिसिस (causal mediation analysis) शामिल है।

Kerem Zaman, Shashank Srivastava2026-05-11
🤖 machine learning

SWaRL: Safeguard Code Watermarking via Reinforcement Learning

SWaRL एक सुदृढ़ और फिडेलिटी-प्रिजर्विंग (fidelity-preserving) कोड वॉटरमार्किंग फ्रेमवर्क है जो LLM-जनरेटेड कोड में सत्यापन योग्य सिग्नेचर एम्बेड करने के लिए कंपाइलर फीडबैक और एक गोपनीय वेरीफायर के साथ सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाता है, जो कार्यात्मक शुद्धता बनाए रखते हुए मजबूत डिटेक्शन सटीकता और हमलों के विरुद्ध प्रतिरोध सुनिश्चित करता है।

Neusha Javidnia, Ruisi Zhang, Ashish Kundu, Farinaz Koushanfar2026-05-11
⚡ electrical engineering

ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule

यह शोध पत्र एडेप्टिव रीपैरामीटराइज्ड टाइम (ART) और इसके सुदृढीकरण शिक्षण संस्करण ART-RL को प्रस्तुत करता है, जो विवक्तीकरण त्रुटि (discretization error) को न्यूनतम करके डिफ्यूजन मॉडल टाइमस्टेप शेड्यूल्स को अनुकूलित करने की एक सिद्धांतपूर्ण विधि है, जो बिना किसी अतिरिक्त अनुमान लागत के विभिन्न डेटासेट और बजटों में नमूना गुणवत्ता में महत्वपूर्ण सुधार करती है।

Yilie Huang, Wenpin Tang, Xunyu Zhou2026-05-11
💬 NLP

Neural Neural Scaling Laws

यह शोधपत्र न्यूरल न्यूरल स्केलिंग लॉज़ (NeuNeu) को प्रस्तुत करता है, जो एक न्यूरल नेटवर्क-आधारित दृष्टिकोण है जो डाउनस्ट्रीम टास्क परफॉरमेंस प्रेडिक्शन को टाइम-सीरीज एक्सट्रपलेशन समस्या के रूप में फ्रेम करके पारंपरिक पैरामीट्रिक मॉडलों से बेहतर प्रदर्शन करता है, जिससे विविध मॉडल परिवारों और कार्यों में काफी कम त्रुटि दर और ज़ीरो-शॉट जनरलाइजेशन हासिल होता है।

Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho2026-05-11
🤖 AI

R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes

यह शोध पत्र R-GTD का प्रस्ताव करता है, जो एक नियमितीकृत ग्रेडिएंट टेम्पोरल-डिफरेंस लर्निंग एल्गोरिदम है जो एक अद्वितीय समाधान की अभिसरण (convergence) की गारंटी देता है और फीचर इंटरेक्शन मैट्रिक्स के सिंगुलर होने पर भी स्पष्ट त्रुटि सीमाएं प्रदान करता है, जो गैर-सिंगुलैरिटी धारणाओं पर निर्भर मौजूदा विधियों की सीमाओं को दूर करता है।

Hyunjun Na, Donghwan Lee2026-05-11
🤖 AI

Test-Time Compute Games

यह शोध पत्र LLM-as-a-service बाजारों में सामाजिक अक्षमता की पहचान करता है जहाँ प्रदाता महंगी टेस्ट-टाइम कंप्यूट का अत्यधिक उपयोग करने के लिए प्रोत्साहित होते हैं, और मूल्य निर्धारण को सीमांत मूल्य (marginal value) के साथ संरेखित करने के लिए एक रिवर्स सेकंड-प्राइस ऑक्शन तंत्र का प्रस्ताव करता है, जिसे गणित और विज्ञान बेंचमार्क पर विभिन्न मॉडल परिवारों के माध्यम से प्रयोगों द्वारा सत्यापित किया गया है।

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez2026-05-11
📊 statistics

Diffusion Path Samplers via Sequential Monte Carlo

यह शोध पत्र एक डिफ्यूजन-आधारित अनुक्रमिक मोंटे कार्लो ढांचे को प्रस्तुत करता है जो डिफ्यूजन पथों के साथ सहायक चरों को विकसित करके लक्ष्य वितरणों के लिए स्कोर और घनत्वों का कुशलतापूर्वक अनुमान लगाता है, जिसे विचरण को कम करने के लिए कंट्रोल वेरिएट्स के साथ उन्नत किया गया है और विभिन्न स्टोकेस्टिक प्रक्रियाओं एवं डेटासेटों में मान्य किया गया है।

James Matthew Young, Paula Cordero-Encinar, Sebastian Reich, Andrew Duncan, O. Deniz Akyildiz2026-05-11
🤖 AI

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

यह शोध पत्र ESSAM को पेश करता है, जो एक मेमोरी-कुशल फुल पैरामीटर फाइन-ट्यूनिंग फ्रेमवर्क है जो इवोल्यूशन स्ट्रेटजीज (Evolution Strategies) को शार्पनेस-अवेयर मैक्सिमाइजेशन (Sharpness-Aware Maximization) के साथ जोड़ता है ताकि पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) विधियों जैसे कि PPO और GRPO की तुलना में GPU मेमोरी के उपयोग को काफी कम करते हुए LLMs पर प्रतिस्पर्धी गणितीय तर्क प्रदर्शन प्राप्त किया जा सके।

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye2026-05-11