💬 NLP

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

यह शोध पत्र एक एकीकृत, सैद्धांतिक रूप से आधारित ढांचा प्रस्तावित करता है जो विजन-लैंग्वेज मॉडल्स में सिद्धांत-आधारित लेयर स्किपिंग को सक्षम करने के लिए प्रयोगात्मक रूप से सत्यापन योग्य रेडंडेंसी स्थितियों को परिभाषित करता है, जिससे प्रदर्शन से समझौता किए बिना अनुमान दक्षता में सुधार होता है।

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney2026-05-11
💬 NLP

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher एक LLM-आधारित एजेंट फ्रेमवर्क है जो एक कॉम्पैक्ट मेमोरी मैकेनिज्म और एक नवीन मल्टी-कॉन्टेक्स्ट GRPO ट्रेनिंग एल्गोरिदम का उपयोग करता है ताकि मल्टी-टर्न सर्च कार्यों के लिए कुशल, एंड-टू-एंड सुदृढीकरण शिक्षण (reinforcement learning) प्राप्त किया जा सके, जो स्थिर कॉन्टेक्स्ट लंबाई बनाए रखते हुए पारंपरिक हिस्ट्री-कॉन्कैटेनेशन बेसलाइन्स से बेहतर प्रदर्शन करता है।

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han2026-05-11
⚡ electrical engineering

Switching-time bioprocess control with pulse-width-modulated optogenetics

यह शोध पत्र बायोग्रॉसस में पल्स-विड्थ-मॉड्यूलेटेड ऑप्टोजेनेटिक नियंत्रण को अनुकूलित करने के लिए एक सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) आधारित दृष्टिकोण प्रस्तावित करता है, जो निरंतर ड्यूटी चक्र के माध्यम से बाइनरी लाइट स्विचिंग को पैरामीटराइज करके पारंपरिक मिश्रित-पूर्णांक अनुकूलन (मिक्सड-इंटीजर ऑप्टिमाइजेशन) की कम्प्यूटेशनल जटिलता को दूर करता है और तीव्र डोज़-रिस्पॉन्स संबंधों वाले सिस्टम में ट्यूनेबिलिटी को बढ़ाता है।

Sebastián Espinel-Ríos2026-05-11
🤖 AI

BEAVER: An Efficient Deterministic LLM Verifier

यह शोध पत्र BEAVER को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो LLM सुरक्षा गुणों के लिए नियत (deterministic), सुदृढ़ (sound) संभाव्यता सीमाओं की कुशलतापूर्वक गणना करने के लिए टोकन ट्राइ (Token trie) और फ्रंटियर (Frontier) डेटा संरचनाओं का उपयोग करता है, जो कंप्यूट बजट के एक अंश के साथ काफी अधिक जोखिम भरे उदाहरणों की पहचान करके सैंपलिंग-आधारित बेसलाइनों से बेहतर प्रदर्शन करता है।

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh2026-05-11
🔢 mathematics

DT-PBO: an Interpretable Tree-based Surrogate Model for Preferential Bayesian Optimization

यह शोध पत्र DT-PBO का प्रस्ताव करता है, जो प्रिफरेंशियल बेयसियन ऑप्टिमाइज़ेशन (Preferential Bayesian Optimization) के लिए एक नवीन व्याख्या योग्य ट्री-आधारित सरोगेट मॉडल है, जो पारंपरिक गॉसियन प्रोसेस-आधारित दृष्टिकोणों की व्याख्यात्मकता संबंधी सीमाओं को संबोधित करते हुए, निर्णय लेने वाले की प्राथमिकताओं में पारदर्शी अंतर्दृष्टि प्रदान करते हुए प्रतिस्पर्धी प्रदर्शन और मजबूती प्राप्त करता है।

Nick Leenders, Thomas Quadt, Boris Cule, Roy Lindelauf, Herman Monsuur, Joost van Oijen, Mark Voskuijl2026-05-11
💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

यह शोध पत्र तर्क देता है कि चेन-ऑफ-थॉट रीजनिंग (Chain-of-Thought reasoning) प्रॉम्प्ट-इंजेक्टेड संकेतों (prompt-injected hints) को स्पष्ट रूप से मौखिक रूप से व्यक्त किए बिना भी निष्ठावान (faithful) हो सकती है, जो अपूर्णता को निष्ठाहीनता के साथ मिलाने वाले "बायसिंग फीचर्स" (Biasing Features) मीट्रिक को चुनौती देता है और एक व्यापक व्याख्यात्मक टूलकिट (interpretability toolkit) की वकालत करता जिसमें कॉज़ल मीडिएशन एनालिसिस (causal mediation analysis) शामिल है।

Kerem Zaman, Shashank Srivastava2026-05-11
🤖 AI

Replicating Human Motivated Reasoning Studies with LLMs

यह शोध पत्र प्रदर्शित करता है कि आधारभूत लार्ज लैंग्वेज मॉडल्स (LLMs) प्रेरणात्मक हेरफेर (motivational manipulations) के संपर्क में आने पर मानवीय प्रेरित तर्क (motivated reasoning) के पैटर्न को दोहराते नहीं हैं, जो मानव मत निर्माण या तर्क मूल्यांकन का अनुकरण करने के लिए LLMs का उपयोग करने वाले शोधकर्ताओं के लिए महत्वपूर्ण सीमाओं को रेखांकित करता है।

Neeley Pate, Adiba Mahbub Proma, Hangfeng He, James N. Druckman, Daniel C. Molden, Gourab Ghoshal, Ehsan Hoque2026-05-11
🤖 AI

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

यह शोध पत्र LLM-आधारित टेक्स्ट-टू-SQL जनरेशन के लिए एक नवीन फ्रेमवर्क प्रस्तावित करता है जो स्पाइडर (Spider) और बर्ड (BIRD) जैसे बेंचमार्क पर प्रतिस्पर्धी निष्पादन सटीकता प्राप्त करने के लिए सिंगल-एजेंट सेल्फ-रिफाइनमेंट विद एनसेम्बल वोटिंग (SSEV) पाइपलाइन और एक मल्टी-एजेंट कोलाबोरेटिव सिस्टम (ReCapAgent-SQL) को जोड़ता है, जो ग्राउंड-ट्रुथ डेटा पर निर्भर रहे बिना वास्तविक दुनिया के एंटरप्राइज डेटाबेस की जटिलताओं को प्रभावी ढंग से संबोधित करता है।

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen2026-05-11
⚡ electrical engineering

ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule

यह शोध पत्र एडेप्टिव रीपैरामीटराइज्ड टाइम (ART) और इसके सुदृढीकरण शिक्षण संस्करण ART-RL को प्रस्तुत करता है, जो विवक्तीकरण त्रुटि (discretization error) को न्यूनतम करके डिफ्यूजन मॉडल टाइमस्टेप शेड्यूल्स को अनुकूलित करने की एक सिद्धांतपूर्ण विधि है, जो बिना किसी अतिरिक्त अनुमान लागत के विभिन्न डेटासेट और बजटों में नमूना गुणवत्ता में महत्वपूर्ण सुधार करती है।

Yilie Huang, Wenpin Tang, Xunyu Zhou2026-05-11
🤖 AI

R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes

यह शोध पत्र R-GTD का प्रस्ताव करता है, जो एक नियमितीकृत ग्रेडिएंट टेम्पोरल-डिफरेंस लर्निंग एल्गोरिदम है जो एक अद्वितीय समाधान की अभिसरण (convergence) की गारंटी देता है और फीचर इंटरेक्शन मैट्रिक्स के सिंगुलर होने पर भी स्पष्ट त्रुटि सीमाएं प्रदान करता है, जो गैर-सिंगुलैरिटी धारणाओं पर निर्भर मौजूदा विधियों की सीमाओं को दूर करता है।

Hyunjun Na, Donghwan Lee2026-05-11