🤖 AI

Scalable Option Learning in High-Throughput Environments

यह शोध पत्र स्केलेबल ऑप्शन लर्निंग (SOL) को प्रस्तुत करता है, जो एक अत्यधिक कुशल पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) एल्गोरिदम है जो मौजूदा विधियों की तुलना में लगभग 35 गुना अधिक थ्रूपुट प्राप्त करता है और नेटहैक (NetHack) जैसे जटिल वातावरणों में 30 बिलियन फ्रेम पर प्रशिक्षण के माध्यम से उत्कृष्ट प्रदर्शन और सकारात्मक स्केलिंग रुझान प्रदर्शित करता है।

Mikael Henaff, Scott Fujimoto, Michael Matthews, Michael Rabbat2026-05-11
💬 NLP

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

यह शोध पत्र यह प्रदर्शित करते हुए अनुसंधान में मानव प्रतिभागियों के विकल्प के रूप में लार्ज लैंग्वेज मॉडल एजेंटों के उपयोग की वैधता को चुनौती देता है कि, मनुष्यों के समान प्रतिक्रियाएं उत्पन्न करने के बावजूद, उनमें विभिन्न प्रयोगात्मक सेटिंग्स में वह मौलिक व्यवहारिक निरंतरता का अभाव है जो वास्तविक मानव व्यवहार का सटीक प्रतिनिधित्व करने के लिए आवश्यक है।

James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang2026-05-11
⚡ electrical engineering

Mechanistic Interpretability with Sparse Autoencoder Neural Operators

यह शोध पत्र स्पार्स ऑटोएनकोडर न्यूरल ऑपरेटर्स (SAE-NOs) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो पारंपरिक स्पार्स ऑटोएनकोडर्स का विस्तार करता है, जिसमें अवधारणाओं (concepts) को स्केलर सक्रियणों के बजाय संरचित फलनों के रूप में पैरामीटराइज किया जाता है, जिससे इनपुट डोमेन में अवधारणा अभिव्यक्ति का मॉडलिंग सक्षम होता है, विभिन्न रिज़ॉल्यूशन पर उत्कृष्ट सामान्यीकरण प्राप्त होता है, और एक नवीन लिफ्टिंग तकनीक के माध्यम से अनुकूलन को त्वरित किया जाता है।

Bahareh Tolooshams, Ailsa Shen, Anima Anandkumar2026-05-11
⚛️ high-energy experiments

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

यह शोध पत्र प्रदर्शित करता है कि फाइन-ट्यून्ड विजन-लैंग्वेज मॉडल्स, विशेष रूप से LLaMA 3.2 का एक वेरिएंट, मल्टीमॉडल रीजनिंग के माध्यम से बेहतर सटीकता, मजबूती और व्याख्यात्मकता प्राप्त करके उच्च-ऊर्जा भौतिकी में न्यूट्रिनो इंटरैक्शन को वर्गीकृत करने में पारंपरिक कनवल्शनल न्यूरल नेटवर्क्स और विजन-ओनली ट्रांसफॉर्मर्स से बेहतर प्रदर्शन करते हैं।

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi2026-05-11
💬 NLP

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

यह शोध पत्र एक एकीकृत, सैद्धांतिक रूप से आधारित ढांचा प्रस्तावित करता है जो विजन-लैंग्वेज मॉडल्स में सिद्धांत-आधारित लेयर स्किपिंग को सक्षम करने के लिए प्रयोगात्मक रूप से सत्यापन योग्य रेडंडेंसी स्थितियों को परिभाषित करता है, जिससे प्रदर्शन से समझौता किए बिना अनुमान दक्षता में सुधार होता है।

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney2026-05-11
💬 NLP

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher एक LLM-आधारित एजेंट फ्रेमवर्क है जो एक कॉम्पैक्ट मेमोरी मैकेनिज्म और एक नवीन मल्टी-कॉन्टेक्स्ट GRPO ट्रेनिंग एल्गोरिदम का उपयोग करता है ताकि मल्टी-टर्न सर्च कार्यों के लिए कुशल, एंड-टू-एंड सुदृढीकरण शिक्षण (reinforcement learning) प्राप्त किया जा सके, जो स्थिर कॉन्टेक्स्ट लंबाई बनाए रखते हुए पारंपरिक हिस्ट्री-कॉन्कैटेनेशन बेसलाइन्स से बेहतर प्रदर्शन करता है।

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han2026-05-11
⚡ electrical engineering

Switching-time bioprocess control with pulse-width-modulated optogenetics

यह शोध पत्र बायोग्रॉसस में पल्स-विड्थ-मॉड्यूलेटेड ऑप्टोजेनेटिक नियंत्रण को अनुकूलित करने के लिए एक सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) आधारित दृष्टिकोण प्रस्तावित करता है, जो निरंतर ड्यूटी चक्र के माध्यम से बाइनरी लाइट स्विचिंग को पैरामीटराइज करके पारंपरिक मिश्रित-पूर्णांक अनुकूलन (मिक्सड-इंटीजर ऑप्टिमाइजेशन) की कम्प्यूटेशनल जटिलता को दूर करता है और तीव्र डोज़-रिस्पॉन्स संबंधों वाले सिस्टम में ट्यूनेबिलिटी को बढ़ाता है।

Sebastián Espinel-Ríos2026-05-11
🤖 AI

BEAVER: An Efficient Deterministic LLM Verifier

यह शोध पत्र BEAVER को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो LLM सुरक्षा गुणों के लिए नियत (deterministic), सुदृढ़ (sound) संभाव्यता सीमाओं की कुशलतापूर्वक गणना करने के लिए टोकन ट्राइ (Token trie) और फ्रंटियर (Frontier) डेटा संरचनाओं का उपयोग करता है, जो कंप्यूट बजट के एक अंश के साथ काफी अधिक जोखिम भरे उदाहरणों की पहचान करके सैंपलिंग-आधारित बेसलाइनों से बेहतर प्रदर्शन करता है।

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh2026-05-11
🔢 mathematics

DT-PBO: an Interpretable Tree-based Surrogate Model for Preferential Bayesian Optimization

यह शोध पत्र DT-PBO का प्रस्ताव करता है, जो प्रिफरेंशियल बेयसियन ऑप्टिमाइज़ेशन (Preferential Bayesian Optimization) के लिए एक नवीन व्याख्या योग्य ट्री-आधारित सरोगेट मॉडल है, जो पारंपरिक गॉसियन प्रोसेस-आधारित दृष्टिकोणों की व्याख्यात्मकता संबंधी सीमाओं को संबोधित करते हुए, निर्णय लेने वाले की प्राथमिकताओं में पारदर्शी अंतर्दृष्टि प्रदान करते हुए प्रतिस्पर्धी प्रदर्शन और मजबूती प्राप्त करता है।

Nick Leenders, Thomas Quadt, Boris Cule, Roy Lindelauf, Herman Monsuur, Joost van Oijen, Mark Voskuijl2026-05-11
💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

यह शोध पत्र तर्क देता है कि चेन-ऑफ-थॉट रीजनिंग (Chain-of-Thought reasoning) प्रॉम्प्ट-इंजेक्टेड संकेतों (prompt-injected hints) को स्पष्ट रूप से मौखिक रूप से व्यक्त किए बिना भी निष्ठावान (faithful) हो सकती है, जो अपूर्णता को निष्ठाहीनता के साथ मिलाने वाले "बायसिंग फीचर्स" (Biasing Features) मीट्रिक को चुनौती देता है और एक व्यापक व्याख्यात्मक टूलकिट (interpretability toolkit) की वकालत करता जिसमें कॉज़ल मीडिएशन एनालिसिस (causal mediation analysis) शामिल है।

Kerem Zaman, Shashank Srivastava2026-05-11