🤖 machine learning

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

यह शोध पत्र रिफ्लेक्टर (Reflector) को पेश करता है, जो एक दो-चरणीय ढांचा है जो शिक्षक-निर्देशित सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से एलएलएम (LLM) जनरेशन प्रक्रिया में आत्म-चिंतन को आंतरिक रूप से समाहित करता है, जिससे मॉडल की उपयोगिता और सामान्यीकरण को बढ़ाते हुए जटिल अप्रत्यक्ष जेलब्रेक (indirect jailbreaks) के विरुद्ध 90% से अधिक रक्षा सफलता प्राप्त होती है।

Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang2026-05-21
🤖 machine learning

Dynamic TMoE: A Drift-Aware Dynamic Mixture of Experts Framework for Non-Stationary Time Series Forecasting

यह शोध पत्र डायनेमिक TMoE (Dynamic TMoE) का प्रस्ताव करता है, जो गैर-स्थिर (non-stationary) समय श्रृंखला पूर्वानुमान के लिए एक नवीन ढांचा है, जो विषम विशेषज्ञ पूलों (heterogeneous expert pools) को गतिशील रूप से प्रबंधित करता है और वितरण परिवर्तनों (distribution shifts) को अनुकूल रूप से संभालने के लिए एक टेम्पोरल मेमोरी राउटर (temporal memory router) का उपयोग करता है, जिससे नौ बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jiawen Zhu, Shuhan Liu, Di Weng, Yingcai Wu2026-05-21
💻 computer science

Declarative Data Services: Structured Agentic Discovery for Composing Data Systems

यह शोध पत्र डिक्लेरेटिव डेटा सर्विसेज (DDS) को प्रस्तुत करता है, जो एक संरचित आर्किटेक्चर है जो विषम डेटा प्रणालियों में अनबाउंड एजेंटिक डिस्कवरी की अभिसरण विफलताओं (convergence failures) को, डिक्लेरेटिव उपयोगकर्ता इरादे और पुनरावृत्ति रनटाइम फीडबैक द्वारा निर्देशित, बंधित (bounded), टाइप किए गए परतों में खोज स्थान को विभाजित करके दूर करता है।

Shanshan Ye, Duo Lu2026-05-21
🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

यह शोध पत्र LlamaWeb प्रस्तुत करता है, जो llama.cpp के लिए एक WebGPU बैकएंड है जो स्टैटिक मेमोरी प्लानिंग, एक ट्यूनेबल कर्नेल लाइब्रेरी और टेम्पलेटेड GPU कर्नेल का उपयोग करके ब्राउज़रों में मेमोरी-कुशल, प्रदर्शन-पोर्टेबल और मल्टी-प्रिसिजन LLM इन्फरेंस प्राप्त करता है, जिसके परिणामस्वरूप विविध हार्डवेयर पर मौजूदा फ्रेमवर्क की तुलना में मेमोरी के उपयोग में उल्लेखनीय कमी और डिकोड थ्रूपुट में वृद्धि होती है।

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen2026-05-21
💻 computer science

Rethinking Cross-Layer Information Routing in Diffusion Transformers

यह शोध पत्र डिफ्यूजन-एडैप्टिव रूटिंग (DAR) को प्रस्तुत करता है, जो एक सीखने योग्य (learnable), टाइमस्टेप-एडैप्टिव रेसिडुअल मैकेनिज्म है जो डिफ्यूजन ट्रांसफॉर्मर्स में पारंपरिक रेसिडुअल एडिशन को प्रतिस्थापित करता है ताकि सूचना प्रवाह की समस्याओं को कम किया जा सके, जिससे फाइन-ट्यूनिंग के दौरान हाई-फ्रीक्वेंसी विवरणों को सुरक्षित रखते हुए इमेजनेट जनरेशन की गुणवत्ता और प्रशिक्षण दक्षता में महत्वपूर्ण सुधार होता है।

Chao Xu, Maohua Li, Qirui Li, Yixuan Xu, Yanke Zhou, Yunhe Li, Cuifeng Shen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao (…)2026-05-21
🤖 machine learning

SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction

यह शोध पत्र SAVER का प्रस्ताव करता है, जो एक चयनात्मक मल्टीमॉडल सूचना निष्कर्षण ढांचा (selective multimodal information extraction framework) है, जो यह निर्णय लेने के लिए कि कब और छवियों के किस उपसमुच्चय (subset) से परामर्श करना है, एक कॉन्फॉर्मल ग्राउंडेबिलिटी गेट (Conformal Groundability Gate) का उपयोग करता है, जिससे हमेशा चालू रहने वाले फ्यूजन तरीकों की तुलना में निष्कर्षण सटीकता में सुधार होता है और कंप्यूटिंग लागत एवं विलंबता (latency) में काफी कमी आती है।

Miaobo Hu, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao2026-05-21
🤖 machine learning

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

यह शोध पत्र एडेप्टिव ग्रुप पॉलिसी ऑप्टिमाइज़ेशन (AGPO) का प्रस्ताव करता है, जो एक क्रिटिक-मुक्त सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मानक PPO और GRPO विधियों की तुलना में गणित और STEM बेंचमार्क पर LLM तर्क प्रदर्शन को बेहतर बनाने के लिए समूह-स्तरीय सांख्यिकी का उपयोग करके क्लिपिंग बाउंड्स और डिकोडिंग तापमान को गतिशील रूप से समायोजित करता है।

Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao2026-05-21
💬 NLP

Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning

यह शोध पत्र लीनियर टास्क वेक्टर (LTV) प्रस्तुत करता है, जो एक ऐसी विधि है जो टास्क वेक्टर-आधारित और इन-कॉन्टेक्स्ट लर्निंग इन्फरेंस के बीच वितरण संबंधी विसंगति (distributional discrepancy) को न्यूनतम करके टास्क वेक्टर डिजाइन करती है, जिससे वर्गीकरण (classification), प्रतिगमन (regression) और क्रॉस-मॉडल ट्रांसफर कार्यों में सटीकता और दक्षता में महत्वपूर्ण सुधार होता है।

Jihoon Kwon, Jiwon Choi, Jy-yong Sohn2026-05-21
📊 statistics

TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design

यह शोध पत्र TASTE को प्रस्तुत करता है, जो नौ ग्राफिक डिज़ाइन मानदंडों के आधार पर पेशेवर डिजाइनरों द्वारा एनोटेट किया गया एक बहुआयामी प्राथमिकता डेटासेट है, और यह प्रदर्शित करता है कि जबकि वर्तमान AI मूल्यांकनकर्ता मानव सहमति के साथ तालमेल बिठाने में संघर्ष करते हैं, इस डेटासेट पर प्रशिक्षित एक विशेष मॉडल विशेषज्ञ निर्णयों के साथ संरेखण में महत्वपूर्ण सुधार करता है।

Haonan Zhu, Elad Hirsch, Alexandria Minetti, Allison Nulty, Purvanshi Mehta2026-05-21
🤖 machine learning

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

यह शोध पत्र डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड (Distribution-Aware Reward) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) उद्देश्य है जो निरंतर रैंक की संभाव्यता स्कोर (Continuous Ranked Probability Score) के साथ कई डिकोड किए गए नमूनों का मूल्यांकन करके, बड़े भाषा मॉडलों को प्रतिगमन कार्यों (regression tasks) के लिए कैलिब्रेटेड प्रेडिक्टिव वितरण उत्पन्न करने हेतु अनुकूलित करता है, जिससे पारंपरिक पॉइंट-एस्टीमेट प्रशिक्षण विधियों की तुलना में अनिश्चितता अनुमान, रैंकिंग प्रदर्शन और मजबूती में सुधार होता है।

Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter2026-05-21