🤖 machine learning

RAP: Runtime Adaptive Pruning for LLM Inference

यह शोध पत्र RAP को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) द्वारा संचालित फ्रेमवर्क है जो बदलते मेमोरी बजट और वर्कलोड स्थितियों के तहत उपयोगिता को अधिकतम करने के लिए मॉडल वेट्स और KV-कैशे रिटेंशन को संयुक्त रूप से अनुकूलित करके, वास्तविक समय में LLM इन्फरेंस प्रूनिंग रणनीतियों को गतिशील रूप से अनुकूलित करता है।

Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li2026-05-19
🤖 machine learning

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

यह शोध पत्र SIPO को प्रस्तुत करता है, जो डिफ्यूजन मॉडल के लिए एक स्थिर और उन्नत प्राथमिकता अनुकूलन (preference optimization) ढांचा है, जो एक नवीन ग्रेडिएंट क्लिपिंग तंत्र और टाइमस्टेप-अवेयर इम्पॉर्टेंस रीवेटिंग के माध्यम से प्रशिक्षण अस्थिरता और ऑफ-पॉलिसी पूर्वाग्रह को संबोधित करता है, तथा इमेज और वीडियो जनरेशन कार्यों में बेहतर प्रदर्शन प्रदर्शित करता है।

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li2026-05-19
💬 NLP

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

यह शोध पत्र यह प्रदर्शित करता है कि मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) भाषा मॉडल, एक इष्टतम सक्रियण दर (activation rate) की पहचान करके जो विभिन्न मॉडल आकारों में सुसंगत रहती है, समान संसाधन बाधाओं (कुल पैरामीटर, कंप्यूट, और डेटा) के तहत अपने डेंस समकक्षों से बेहतर प्रदर्शन कर सकते हैं, एक ऐसा निष्कर्ष जिसे लगभग 250 मॉडलों को प्रशिक्षित करने और 50 ट्रिलियन टोकन को प्रोसेस करने के व्यापक प्रयोगों के माध्यम से मान्य किया गया है।

Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Dax (…)2026-05-19
💻 computer science

Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking

यह शोध पत्र छह मुख्य मूल्य विषयों (value themes) की पहचान करके एआई संरेखण (AI alignment) के मूल्यांकन के लिए एक स्केलेबल, आउटपुट-आधारित ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जबकि 75 एलएलएम (LLMs) लगातार मानवीय मूल्य क्रम को पुनरुत्पादित करते हैं, वे अक्सर मूल्य अंशांकन (value calibration) में भिन्न होते हैं, जिसमें प्रोफाइल फिडेलिटी (profile fidelity) मॉडल के आकार या क्षमता से स्वतंत्र रूप से भिन्न होती है।

Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto2026-05-19
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

यह शोध पत्र OSWorld-Human प्रस्तुत करता है, जो एक मैन्युअल रूप से एनोटेट किया गया बेंचमार्क है जो यह प्रकट करता है कि वर्तमान कंप्यूटर-उपयोग एजेंट अत्यधिक विलंबता (latency) और अक्षमता से ग्रस्त हैं, जिसका मुख्य कारण योजना बनाने और चिंतन (reflection) के लिए अत्यधिक मॉडल कॉल्स हैं, जिसके परिणामस्वरूप उन्हें कार्य पूरा करने में मनुष्यों की तुलना में 2.7 से 4.3 गुना अधिक कदम उठाने पड़ते हैं।

Reyna Abhyankar, Qi Qi, Yiying Zhang2026-05-19
🤖 machine learning

CooT: Learning to Coordinate In-Context with Coordination Transformers

CooT एक नवीन ढांचा है जो इन-कॉन्टेक्स्ट लर्निंग का लाभ उठाकर मल्टी-एजेंट सिस्टम को बिना पैरामीटर अपडेट के अपरिचित पार्टनर्स के प्रति तेजी से और मजबूती से अनुकूलित होने में सक्षम बनाता है, जो ओवरकुक्ड (Overcooked) और गूगल रिसर्च फुटबॉल (Google Research Football) जैसे बेंचमार्क पर मौजूदा पॉपुलेशन-आधारित, फाइन-ट्यूनिंग और मेटा-आरएल (Meta-RL) दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Huai-Chih Wang, Hsiang-Chun Chuang, Hsi-Chun Cheng, Dai-Jie Wu, Shao-Hua Sun2026-05-19
🤖 machine learning

Geometry-aware 4D Video Generation for Robot Manipulation

यह शोध पत्र एक ज्यामिति-जागरूक (geometry-aware) 4D वीडियो जनरेशन मॉडल प्रस्तुत करता है जो नए दृष्टिकोणों (novel viewpoints) से भविष्य के वीडियो अनुक्रमों को टेम्पोरल रूप से सुसंगत और स्थानिक रूप से संरेखित बनाने के लिए क्रॉस-व्यू पॉइंटमैप संरेखण के माध्यम से मल्टी-व्यू 3D निरंतरता लागू करता है, जिससे विभिन्न कैमरा परिप्रेक्ष्यों में सामान्यीकरण करने वाली मजबूत रोबोट मैनिपुलेशन नीतियों को सक्षम बनाया जा सके।

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song2026-05-19
🤖 machine learning

JSON-Bag: A generic game trajectory representation

यह शोध पत्र JSON-Bag प्रस्तुत करता है, जो गेम ट्रैजेक्टरीज (game trajectories) को उनके JSON विवरणों को टोकनाइज़ करके और जेन्सन-शैनन डिस्टेंस (Jensen-Shannon distance) के माध्यम से समानता को मापकर उन्हें निरूपित करने की एक जेनेरिक विधि है, जो छह टेबलटॉप गेम्स में एजेंटों, मापदंडों और सीड्स को वर्गीकृत करने में हस्तनिर्मित बेसलाइन्स (hand-crafted baselines) से बेहतर प्रदर्शन करता है और एजेंट पॉलिसी दूरियों (agent policy distances) के साथ मजबूत सहसंबंध और सैंपल दक्षता प्रदर्शित करता है।

Dien Nguyen, Diego Perez-Liebana, Simon Lucas2026-05-19
💬 NLP

Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap

यह शोध पत्र डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) के लिए एक नवीन कठिनाई-आधारित डेटा चयन रणनीति प्रस्तुत करता है जो छोटे निहित रिवॉर्ड गैप्स के माध्यम से चुनौतीपूर्ण प्राथमिकता उदाहरणों की पहचान करता है, जिससे मौजूदा बेसलाइन की तुलना में मूल डेटा के केवल 10% का उपयोग करके मॉडल अलाइनमेंट दक्षता और प्रदर्शन में महत्वपूर्ण सुधार होता है।

Xuan Qi, Rongwu Xu, Zhijing Jin2026-05-19
🤖 machine learning

The Loupe: A Plug-and-Play Attention Module for Amplifying Discriminative Features in Vision Transformers

द लूप (The Loupe) विजन ट्रांसफॉर्मर्स के लिए एक हल्का, प्लग-एंड-प्ले स्थानिक गेटिंग मॉड्यूल है जो विभेदक विशेषताओं को बढ़ाने के लिए विरल स्थानिक मास्क (sparse spatial masks) की भविष्यवाणी करके सूक्ष्म-स्तरीय दृश्य वर्गीकरण को महत्वपूर्ण रूप से बढ़ाता है, और न्यूनतम पैरामीटर ओवरहेड के साथ CUB-200-2011 पर अत्याधुनिक परिणाम प्राप्त करता है।

Naren Sengodan2026-05-19