💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

यह शोध पत्र तर्क देता है कि चेन-ऑफ-थॉट रीजनिंग (Chain-of-Thought reasoning) प्रॉम्प्ट-इंजेक्टेड संकेतों (prompt-injected hints) को स्पष्ट रूप से मौखिक रूप से व्यक्त किए बिना भी निष्ठावान (faithful) हो सकती है, जो अपूर्णता को निष्ठाहीनता के साथ मिलाने वाले "बायसिंग फीचर्स" (Biasing Features) मीट्रिक को चुनौती देता है और एक व्यापक व्याख्यात्मक टूलकिट (interpretability toolkit) की वकालत करता जिसमें कॉज़ल मीडिएशन एनालिसिस (causal mediation analysis) शामिल है।

Kerem Zaman, Shashank Srivastava2026-05-11
🤖 machine learning

SWaRL: Safeguard Code Watermarking via Reinforcement Learning

SWaRL एक सुदृढ़ और फिडेलिटी-प्रिजर्विंग (fidelity-preserving) कोड वॉटरमार्किंग फ्रेमवर्क है जो LLM-जनरेटेड कोड में सत्यापन योग्य सिग्नेचर एम्बेड करने के लिए कंपाइलर फीडबैक और एक गोपनीय वेरीफायर के साथ सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाता है, जो कार्यात्मक शुद्धता बनाए रखते हुए मजबूत डिटेक्शन सटीकता और हमलों के विरुद्ध प्रतिरोध सुनिश्चित करता है।

Neusha Javidnia, Ruisi Zhang, Ashish Kundu, Farinaz Koushanfar2026-05-11
⚡ electrical engineering

ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule

यह शोध पत्र एडेप्टिव रीपैरामीटराइज्ड टाइम (ART) और इसके सुदृढीकरण शिक्षण संस्करण ART-RL को प्रस्तुत करता है, जो विवक्तीकरण त्रुटि (discretization error) को न्यूनतम करके डिफ्यूजन मॉडल टाइमस्टेप शेड्यूल्स को अनुकूलित करने की एक सिद्धांतपूर्ण विधि है, जो बिना किसी अतिरिक्त अनुमान लागत के विभिन्न डेटासेट और बजटों में नमूना गुणवत्ता में महत्वपूर्ण सुधार करती है।

Yilie Huang, Wenpin Tang, Xunyu Zhou2026-05-11
💬 NLP

Neural Neural Scaling Laws

यह शोधपत्र न्यूरल न्यूरल स्केलिंग लॉज़ (NeuNeu) को प्रस्तुत करता है, जो एक न्यूरल नेटवर्क-आधारित दृष्टिकोण है जो डाउनस्ट्रीम टास्क परफॉरमेंस प्रेडिक्शन को टाइम-सीरीज एक्सट्रपलेशन समस्या के रूप में फ्रेम करके पारंपरिक पैरामीट्रिक मॉडलों से बेहतर प्रदर्शन करता है, जिससे विविध मॉडल परिवारों और कार्यों में काफी कम त्रुटि दर और ज़ीरो-शॉट जनरलाइजेशन हासिल होता है।

Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho2026-05-11
🤖 AI

R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes

यह शोध पत्र R-GTD का प्रस्ताव करता है, जो एक नियमितीकृत ग्रेडिएंट टेम्पोरल-डिफरेंस लर्निंग एल्गोरिदम है जो एक अद्वितीय समाधान की अभिसरण (convergence) की गारंटी देता है और फीचर इंटरेक्शन मैट्रिक्स के सिंगुलर होने पर भी स्पष्ट त्रुटि सीमाएं प्रदान करता है, जो गैर-सिंगुलैरिटी धारणाओं पर निर्भर मौजूदा विधियों की सीमाओं को दूर करता है।

Hyunjun Na, Donghwan Lee2026-05-11
🤖 AI

Test-Time Compute Games

यह शोध पत्र LLM-as-a-service बाजारों में सामाजिक अक्षमता की पहचान करता है जहाँ प्रदाता महंगी टेस्ट-टाइम कंप्यूट का अत्यधिक उपयोग करने के लिए प्रोत्साहित होते हैं, और मूल्य निर्धारण को सीमांत मूल्य (marginal value) के साथ संरेखित करने के लिए एक रिवर्स सेकंड-प्राइस ऑक्शन तंत्र का प्रस्ताव करता है, जिसे गणित और विज्ञान बेंचमार्क पर विभिन्न मॉडल परिवारों के माध्यम से प्रयोगों द्वारा सत्यापित किया गया है।

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez2026-05-11
📊 statistics

Diffusion Path Samplers via Sequential Monte Carlo

यह शोध पत्र एक डिफ्यूजन-आधारित अनुक्रमिक मोंटे कार्लो ढांचे को प्रस्तुत करता है जो डिफ्यूजन पथों के साथ सहायक चरों को विकसित करके लक्ष्य वितरणों के लिए स्कोर और घनत्वों का कुशलतापूर्वक अनुमान लगाता है, जिसे विचरण को कम करने के लिए कंट्रोल वेरिएट्स के साथ उन्नत किया गया है और विभिन्न स्टोकेस्टिक प्रक्रियाओं एवं डेटासेटों में मान्य किया गया है।

James Matthew Young, Paula Cordero-Encinar, Sebastian Reich, Andrew Duncan, O. Deniz Akyildiz2026-05-11
🤖 AI

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

यह शोध पत्र ESSAM को पेश करता है, जो एक मेमोरी-कुशल फुल पैरामीटर फाइन-ट्यूनिंग फ्रेमवर्क है जो इवोल्यूशन स्ट्रेटजीज (Evolution Strategies) को शार्पनेस-अवेयर मैक्सिमाइजेशन (Sharpness-Aware Maximization) के साथ जोड़ता है ताकि पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) विधियों जैसे कि PPO और GRPO की तुलना में GPU मेमोरी के उपयोग को काफी कम करते हुए LLMs पर प्रतिस्पर्धी गणितीय तर्क प्रदर्शन प्राप्त किया जा सके।

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye2026-05-11
🤖 machine learning

CGF-Softmax: A Cumulant-Based Softmax Reformulation for Efficient Inference under Homomorphic Encryption

यह शोध पत्र CGF-Softmax प्रस्तुत करता है, जो सॉफ्टमैक्स फलन का एक नवीन पुनर्गठन है जो संचयी जनरेटिंग फंक्शन (cumulant generating function) का उपयोग करके खर्चीले होमोमॉर्फिक विभाजन और अधिकतम घटाव को समाप्त करता है, जिससे कम मल्टीप्लिकेटिव डेप्थ के साथ होमोमॉर्फिक एन्क्रिप्शन के तहत ट्रांसफार्मर मॉडल के लिए कुशल और सटीक गोपनीयता-संरक्षित अनुमान (privacy-preserving inference) सक्षम होता है।

Hanjun Park, Byeongseo Min, Jiheon Woo, Min-Wook Jeong, Jongho Shin, Yongwoo Lee, Young-Sik Kim, Yongjune Kim2026-05-11
📊 statistics

The Effect of Mini-Batch Noise on the Implicit Bias of Adam

यह शोध पत्र एक सैद्धांतिक ढांचा प्रस्तुत करता है जो यह प्रदर्शित करता है कि मिनी-बैच शोर (mini-batch noise) एडम (Adam) के मोमेंटम हाइपरपैरामीटर्स के निहित पूर्वाग्रह (implicit bias) को मौलिक रूप से बदल देता है, जिससे यह स्पष्ट होता है कि जबकि मानक (β1,0.999)(\beta_1, 0.999) विन्यास छोटे बैचों के लिए इष्टतम है, बड़े बैचों के लिए एंटी-रेगुलराइजेशन (anti-regularization) से बचने और सामान्यीकरण (generalization) में सुधार करने के लिए β1\beta_1 को β2\beta_2 के करीब समायोजित करने की आवश्यकता होती है।

Matias D. Cattaneo, Boris Shigida2026-05-11