🤖 AI

Replicating Human Motivated Reasoning Studies with LLMs

यह शोध पत्र प्रदर्शित करता है कि आधारभूत लार्ज लैंग्वेज मॉडल्स (LLMs) प्रेरणात्मक हेरफेर (motivational manipulations) के संपर्क में आने पर मानवीय प्रेरित तर्क (motivated reasoning) के पैटर्न को दोहराते नहीं हैं, जो मानव मत निर्माण या तर्क मूल्यांकन का अनुकरण करने के लिए LLMs का उपयोग करने वाले शोधकर्ताओं के लिए महत्वपूर्ण सीमाओं को रेखांकित करता है।

Neeley Pate, Adiba Mahbub Proma, Hangfeng He, James N. Druckman, Daniel C. Molden, Gourab Ghoshal, Ehsan Hoque2026-05-11
🤖 AI

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

यह शोध पत्र LLM-आधारित टेक्स्ट-टू-SQL जनरेशन के लिए एक नवीन फ्रेमवर्क प्रस्तावित करता है जो स्पाइडर (Spider) और बर्ड (BIRD) जैसे बेंचमार्क पर प्रतिस्पर्धी निष्पादन सटीकता प्राप्त करने के लिए सिंगल-एजेंट सेल्फ-रिफाइनमेंट विद एनसेम्बल वोटिंग (SSEV) पाइपलाइन और एक मल्टी-एजेंट कोलाबोरेटिव सिस्टम (ReCapAgent-SQL) को जोड़ता है, जो ग्राउंड-ट्रुथ डेटा पर निर्भर रहे बिना वास्तविक दुनिया के एंटरप्राइज डेटाबेस की जटिलताओं को प्रभावी ढंग से संबोधित करता है।

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen2026-05-11
⚡ electrical engineering

ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule

यह शोध पत्र एडेप्टिव रीपैरामीटराइज्ड टाइम (ART) और इसके सुदृढीकरण शिक्षण संस्करण ART-RL को प्रस्तुत करता है, जो विवक्तीकरण त्रुटि (discretization error) को न्यूनतम करके डिफ्यूजन मॉडल टाइमस्टेप शेड्यूल्स को अनुकूलित करने की एक सिद्धांतपूर्ण विधि है, जो बिना किसी अतिरिक्त अनुमान लागत के विभिन्न डेटासेट और बजटों में नमूना गुणवत्ता में महत्वपूर्ण सुधार करती है।

Yilie Huang, Wenpin Tang, Xunyu Zhou2026-05-11
🤖 AI

R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes

यह शोध पत्र R-GTD का प्रस्ताव करता है, जो एक नियमितीकृत ग्रेडिएंट टेम्पोरल-डिफरेंस लर्निंग एल्गोरिदम है जो एक अद्वितीय समाधान की अभिसरण (convergence) की गारंटी देता है और फीचर इंटरेक्शन मैट्रिक्स के सिंगुलर होने पर भी स्पष्ट त्रुटि सीमाएं प्रदान करता है, जो गैर-सिंगुलैरिटी धारणाओं पर निर्भर मौजूदा विधियों की सीमाओं को दूर करता है।

Hyunjun Na, Donghwan Lee2026-05-11
🤖 AI

Test-Time Compute Games

यह शोध पत्र LLM-as-a-service बाजारों में सामाजिक अक्षमता की पहचान करता है जहाँ प्रदाता महंगी टेस्ट-टाइम कंप्यूट का अत्यधिक उपयोग करने के लिए प्रोत्साहित होते हैं, और मूल्य निर्धारण को सीमांत मूल्य (marginal value) के साथ संरेखित करने के लिए एक रिवर्स सेकंड-प्राइस ऑक्शन तंत्र का प्रस्ताव करता है, जिसे गणित और विज्ञान बेंचमार्क पर विभिन्न मॉडल परिवारों के माध्यम से प्रयोगों द्वारा सत्यापित किया गया है।

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez2026-05-11
🤖 AI

Supervised sparse auto-encoders for interpretable and compositional representations

यह शोधपत्र एक सुपरवाइज्ड स्पार्स ऑटो-एनकोडर फ्रेमवर्क प्रस्तुत करता है जो पारंपरिक L1L_1 दंडों की नॉन-स्मूथनेस (non-smoothness) को दूर करने और सीखे गए फीचर्स को मानवीय अर्थों के साथ संरेखित करने के लिए अनकन्स्ट्रेंड फीचर मॉडल्स का लाभ उठाता है, जो स्टेबल डिफ्यूजन 3.5 पर सफल कंपोजिशनल जनरलाइजेशन और फीचर-लेवल इमेज एडिटिंग का प्रदर्शन करता है।

Ouns El Harzli, Hugo Wallner, Yoonsoo Nam, Haixuan Xavier Tao2026-05-11
🤖 AI

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

यह शोध पत्र ESSAM को पेश करता है, जो एक मेमोरी-कुशल फुल पैरामीटर फाइन-ट्यूनिंग फ्रेमवर्क है जो इवोल्यूशन स्ट्रेटजीज (Evolution Strategies) को शार्पनेस-अवेयर मैक्सिमाइजेशन (Sharpness-Aware Maximization) के साथ जोड़ता है ताकि पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) विधियों जैसे कि PPO और GRPO की तुलना में GPU मेमोरी के उपयोग को काफी कम करते हुए LLMs पर प्रतिस्पर्धी गणितीय तर्क प्रदर्शन प्राप्त किया जा सके।

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye2026-05-11
📊 statistics

The Effect of Mini-Batch Noise on the Implicit Bias of Adam

यह शोध पत्र एक सैद्धांतिक ढांचा प्रस्तुत करता है जो यह प्रदर्शित करता है कि मिनी-बैच शोर (mini-batch noise) एडम (Adam) के मोमेंटम हाइपरपैरामीटर्स के निहित पूर्वाग्रह (implicit bias) को मौलिक रूप से बदल देता है, जिससे यह स्पष्ट होता है कि जबकि मानक (β1,0.999)(\beta_1, 0.999) विन्यास छोटे बैचों के लिए इष्टतम है, बड़े बैचों के लिए एंटी-रेगुलराइजेशन (anti-regularization) से बचने और सामान्यीकरण (generalization) में सुधार करने के लिए β1\beta_1 को β2\beta_2 के करीब समायोजित करने की आवश्यकता होती है।

Matias D. Cattaneo, Boris Shigida2026-05-11
🧬 biology

Latent-Space Causal Discovery from Indirect Neuroimaging Observations

यह शोध पत्र INCAMA को प्रस्तुत करता है, जो एक भौतिकी-जागरूक (physics-aware) ढांचा है जो विकृत न्यूरोइमेजिंग संकेतों से निर्देशित तंत्रिका कारण संरचनाओं (directed neural causal structures) को पुनर्प्राप्त करने के लिए लेटेंट-स्पेस इन्वर्जन को डिले-अवेयर माम्बा एनकोडर के साथ जोड़ता है, जो सिमुलेशन और वास्तविक दुनिया के fMRI डेटा दोनों में बेसलाइन्स की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Sangyoon Bae, Miruna Oprescu, David Keetae Park, Shinjae Yoo, Jiook Cha2026-05-11✓ Author reviewed
💬 NLP

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

यह शोध पत्र एक नवीन डायनेमिक क्लिपिंग तंत्र का प्रस्ताव देकर 'वेरिफिएबल रिवार्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) में एंट्रॉपी कोलैप्स को संबोधित करता है, जो पॉलिसी एंट्रॉपी को सटीक रूप से नियंत्रित करने के लिए एक ग्रेडिएंट-प्रिजर्विंग परिप्रेक्ष्य का लाभ उठाता है, जिससे समयपूर्व अति-आत्मविश्वास को रोका जा सके और एलएलएम (LLM) तर्क प्रदर्शन को बढ़ाया जा सके।

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao2026-05-11