💻 computer science

Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking

यह शोध पत्र छह मुख्य मूल्य विषयों (value themes) की पहचान करके एआई संरेखण (AI alignment) के मूल्यांकन के लिए एक स्केलेबल, आउटपुट-आधारित ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जबकि 75 एलएलएम (LLMs) लगातार मानवीय मूल्य क्रम को पुनरुत्पादित करते हैं, वे अक्सर मूल्य अंशांकन (value calibration) में भिन्न होते हैं, जिसमें प्रोफाइल फिडेलिटी (profile fidelity) मॉडल के आकार या क्षमता से स्वतंत्र रूप से भिन्न होती है।

Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto2026-05-19
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

यह शोध पत्र OSWorld-Human प्रस्तुत करता है, जो एक मैन्युअल रूप से एनोटेट किया गया बेंचमार्क है जो यह प्रकट करता है कि वर्तमान कंप्यूटर-उपयोग एजेंट अत्यधिक विलंबता (latency) और अक्षमता से ग्रस्त हैं, जिसका मुख्य कारण योजना बनाने और चिंतन (reflection) के लिए अत्यधिक मॉडल कॉल्स हैं, जिसके परिणामस्वरूप उन्हें कार्य पूरा करने में मनुष्यों की तुलना में 2.7 से 4.3 गुना अधिक कदम उठाने पड़ते हैं।

Reyna Abhyankar, Qi Qi, Yiying Zhang2026-05-19
🤖 machine learning

CooT: Learning to Coordinate In-Context with Coordination Transformers

CooT एक नवीन ढांचा है जो इन-कॉन्टेक्स्ट लर्निंग का लाभ उठाकर मल्टी-एजेंट सिस्टम को बिना पैरामीटर अपडेट के अपरिचित पार्टनर्स के प्रति तेजी से और मजबूती से अनुकूलित होने में सक्षम बनाता है, जो ओवरकुक्ड (Overcooked) और गूगल रिसर्च फुटबॉल (Google Research Football) जैसे बेंचमार्क पर मौजूदा पॉपुलेशन-आधारित, फाइन-ट्यूनिंग और मेटा-आरएल (Meta-RL) दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Huai-Chih Wang, Hsiang-Chun Chuang, Hsi-Chun Cheng, Dai-Jie Wu, Shao-Hua Sun2026-05-19
🤖 machine learning

Geometry-aware 4D Video Generation for Robot Manipulation

यह शोध पत्र एक ज्यामिति-जागरूक (geometry-aware) 4D वीडियो जनरेशन मॉडल प्रस्तुत करता है जो नए दृष्टिकोणों (novel viewpoints) से भविष्य के वीडियो अनुक्रमों को टेम्पोरल रूप से सुसंगत और स्थानिक रूप से संरेखित बनाने के लिए क्रॉस-व्यू पॉइंटमैप संरेखण के माध्यम से मल्टी-व्यू 3D निरंतरता लागू करता है, जिससे विभिन्न कैमरा परिप्रेक्ष्यों में सामान्यीकरण करने वाली मजबूत रोबोट मैनिपुलेशन नीतियों को सक्षम बनाया जा सके।

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song2026-05-19
🤖 machine learning

JSON-Bag: A generic game trajectory representation

यह शोध पत्र JSON-Bag प्रस्तुत करता है, जो गेम ट्रैजेक्टरीज (game trajectories) को उनके JSON विवरणों को टोकनाइज़ करके और जेन्सन-शैनन डिस्टेंस (Jensen-Shannon distance) के माध्यम से समानता को मापकर उन्हें निरूपित करने की एक जेनेरिक विधि है, जो छह टेबलटॉप गेम्स में एजेंटों, मापदंडों और सीड्स को वर्गीकृत करने में हस्तनिर्मित बेसलाइन्स (hand-crafted baselines) से बेहतर प्रदर्शन करता है और एजेंट पॉलिसी दूरियों (agent policy distances) के साथ मजबूत सहसंबंध और सैंपल दक्षता प्रदर्शित करता है।

Dien Nguyen, Diego Perez-Liebana, Simon Lucas2026-05-19
💬 NLP

Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap

यह शोध पत्र डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) के लिए एक नवीन कठिनाई-आधारित डेटा चयन रणनीति प्रस्तुत करता है जो छोटे निहित रिवॉर्ड गैप्स के माध्यम से चुनौतीपूर्ण प्राथमिकता उदाहरणों की पहचान करता है, जिससे मौजूदा बेसलाइन की तुलना में मूल डेटा के केवल 10% का उपयोग करके मॉडल अलाइनमेंट दक्षता और प्रदर्शन में महत्वपूर्ण सुधार होता है।

Xuan Qi, Rongwu Xu, Zhijing Jin2026-05-19
🤖 machine learning

The Loupe: A Plug-and-Play Attention Module for Amplifying Discriminative Features in Vision Transformers

द लूप (The Loupe) विजन ट्रांसफॉर्मर्स के लिए एक हल्का, प्लग-एंड-प्ले स्थानिक गेटिंग मॉड्यूल है जो विभेदक विशेषताओं को बढ़ाने के लिए विरल स्थानिक मास्क (sparse spatial masks) की भविष्यवाणी करके सूक्ष्म-स्तरीय दृश्य वर्गीकरण को महत्वपूर्ण रूप से बढ़ाता है, और न्यूनतम पैरामीटर ओवरहेड के साथ CUB-200-2011 पर अत्याधुनिक परिणाम प्राप्त करता है।

Naren Sengodan2026-05-19
🤖 machine learning

Ordinal Adaptive Correction: A Data-Centric Approach to Ordinal Image Classification with Noisy Labels

यह शोध पत्र ORDinal Adaptive Correction (ORDAC) का प्रस्ताव करता है, जो एक नवीन डेटा-केंद्रित ढांचा है जो विभिन्न शोर स्थितियों के तहत Adience और Diabetic Retinopathy जैसे डेटासेट पर मॉडल की मजबूती और सटीकता में उल्लेखनीय सुधार करने के लिए प्रशिक्षण के दौरान शोर वाले ऑर्डिनल लेबल को गतिशील रूप से समायोजित और ठीक करने हेतु Label Distribution Learning का लाभ उठाता है।

Alireza Sedighi Moghaddam, Mohammad Reza Mohammadi2026-05-19
🤖 machine learning

Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training

यह शोध पत्र प्रोसेस कंसिस्टेंसी फ़िल्टर (PROF) को प्रस्तुत करता है, जो एक डेटा क्यूरेशन पद्धति है जो उच्च गुणवत्ता वाले प्रशिक्षण नमूनों का चयन करने के लिए प्रोसेस और आउटकम रिवॉर्ड मॉडल्स के बीच की निरंतरता का लाभ उठाती है, जिससे प्रत्यक्ष रिवॉर्ड ऑप्टिमाइज़ेशन की अस्थिरता से बचते हुए अंतिम-उत्तर सटीकता और रीजनिंग फेथफुलनेस दोनों में सुधार होता है।

Chenlu Ye, Zhou Yu, Ziji Zhang, Hao Chen, Narayanan Sadagopan, Jing Huang, Tong Zhang, Anurag Beniwal2026-05-19
🤖 machine learning

CoUn: Empowering Machine Unlearning via Contrastive Learning

यह शोध पत्र CoUn को पेश करता है, जो एक नवीन मशीन अनलर्निंग फ्रेमवर्क है जो भूल जाने वाले नमूनों (forget samples) के प्रभाव को उनके सिमेंटिक रिप्रजेंटेशन को समायोजित करके प्रभावी ढंग से हटाने के लिए रिटेन डेटा पर कंट्रास्टिव लर्निंग और सुपरवाइज्ड लर्निंग का लाभ उठाता है, जिससे यह मौजूदा अत्याधुनिक तरीकों से बेहतर प्रदर्शन करता है।

Yasser H. Khalil, Mehdi Setayesh, Hongliang Li2026-05-19