🤖 AI

Latent Video Prediction Learns Better World Models

यह शोध पत्र एक व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि लेटेंट वीडियो प्रेडिक्शन मॉडल, जैसे कि V-JEPA 2.1, पांच मजबूती अक्षों (robustness axes) पर पारंपरिक पुनर्निर्माण-आधारित और पर्यवेक्षित मॉडलों से बेहतर प्रदर्शन करते हैं, जो उन्हें मजबूत वर्ल्ड मॉडल्स बनाने के लिए श्रेष्ठ उम्मीदवार के रूप में स्थापित करते हैं।

Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam, James Bailey, Naveed Akhtar2026-05-18
🤖 AI

PRISM: Prompt Reliability via Iterative Simulation and Monitoring for Enterprise Conversational AI

PRISM एक क्लोज्ड-लूप फ्रेमवर्क है जो प्रॉम्प्ट इंजीनियरिंग को एक निरंतर विश्वसनीयता इंजीनियरिंग समस्या के रूप में मानता है, जो स्वचालित रूप से टेस्ट केस जनरेट करता है, बातचीत का अनुकरण करता है, और प्रॉम्प्ट्स को पुनरावृत्ति के साथ रिपेयर करता है ताकि यह सुनिश्चित किया जा सके कि एंटरप्राइज कन्वर्सेशनल एआई एजेंट्स एलएलएम व्यवहारिक ड्रिफ्ट (LLM behavioral drift) के विरुद्ध लचीले बने रहें।

Keshava Chaitanya, Jahnavi Gundakaram2026-05-18
🤖 AI

VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

यह शोध पत्र प्रकट करता है कि अत्याधुनिक विजन-लैंग्वेज मॉडल स्थानीय भटकाव (लोकल डिस्ट्रैक्टर्स) का प्रतिरोध करने में मौलिक अक्षमता के कारण विजुअल पाथ फॉलोइंग में संघर्ष करते हैं, जो एक ऐसा बॉटलनेक है जो स्केलिंग, रीजनिंग हस्तक्षेप या स्पष्ट निर्देशों के बावजूद बना रहता है।

Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No2026-05-18
💬 NLP

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

यह शोध पत्र ASRU का प्रस्ताव करता है, जो एक नियंत्रणीय मल्टीमॉडल अनलर्निंग फ्रेमवर्क है जो संवेदनशील क्रॉस-मोडल जानकारी को प्रभावी ढंग से हटाने के साथ-साथ जनरेशन की गुणवत्ता में उल्लेखनीय सुधार करने और मॉडल उपयोगिता को बनाए रखने के लिए एक्टिवेशन स्टीयरिंग को सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) के साथ जोड़ता है।

Jiahui Guang, Yingjie Zhu, Cuiyun Gao, Haiyan Wang, Jing Li, Di Shao, Zhaoquan Gu2026-05-18
🤖 AI

Position: Early-Stage Quality Assurance in Annotation Pipelines Is More Cost-Effective Than Late-Stage Validation

यह स्थिति पत्र (position paper) यह तर्क देता है कि एनोटेशन पाइपलाइनों में प्रारंभिक-चरण के गुणवत्ता आश्वासन (quality assurance) को प्राथमिकता देना विलंब-चरण के सत्यापन (late-stage validation) की तुलना में काफी अधिक लागत प्रभावी है, और मशीन लर्निंग समुदाय से आग्रह करता है कि वे वर्तमान शोध के एक प्रमुख अंतर को दूर करने के लिए QA समय को एक महत्वपूर्ण डिज़ाइन चर (design variable) के रूप में मानें और इसे व्यवस्थित रूप से रिपोर्ट करें।

Sunil Kothari, Sumukha Sharma Thoppanahalli Chandramouli, Naman Khandelwal, Parth Kulshreshtha, Ashi Jain, Kriti Banka (…)2026-05-18
🤖 AI

DiLA: Disentangled Latent Action World Models

DiLA एक नवीन वर्ल्ड मॉडल पेश करता है जो लेबल किए गए डेटा की आवश्यकता के बिना उच्च-गुणवत्ता वाले वीडियो जनरेशन और व्याख्यात्मक एक्शन स्पेस को प्राप्त करने के लिए लेटेंट एक्शन लर्निंग और कंटेंट-स्ट्रक्चर डिसेंटैंगलमेंट के बीच तालमेल का लाभ उठाकर एक्शन एब्स्ट्रैक्शन और जनरेशन फिडेलिटी के बीच के ट्रेड-ऑफ को हल करता है।

Tianqiu Zhang, Muyang Lyu, Yufan Zhang, Fang Fang, Si Wu2026-05-18
🤖 AI

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

यह शोध पत्र NudgeRL प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो महंगी ओरेकलल सुपरविजन (oracle supervision) या ब्रूट-फोर्स स्केलिंगिंग (brute-force scaling) पर निर्भर हुए बिना, गणितीय बेंचमार्क पर तर्क क्षमता (reasoning capabilities) को कुशलतापूर्वक सुधारने के लिए स्ट्रैटेजी-गाइडेड (strategy-guided), डाइवर्सिटी-ड्रिवन (diversity-driven) एक्सप्लोरेशन का उपयोग करके वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग (RLVR) को बढ़ाता है।

Chanuk Lee, Sangwoo Park, Minki Kang, Sung Ju Hwang2026-05-18
🤖 AI

Structure Abstraction and Generalization in a Hippocampal-Entorhinal Inspired World Model

यह शोध पत्र एक मस्तिष्क-प्रेरित पदानुक्रमित मॉडल प्रस्तावित करता है जो अमूर्त संबंधपरक संरचनाओं को समवर्ती रूप से निकालने और भविष्य कहने वाले दृश्य विश्व मॉडलों का निर्माण करने के लिए हिप्पोकैम्पल-एंटोरहिनल सर्किट (hippocampal-entorhinal circuit) की नकल करता है, जिससे स्व-पर्यवेक्षित शिक्षण (self-supervised learning) के माध्यम से सुदृढ़ संरचनात्मक सामान्यीकरण और ज्ञान हस्तांतरण सक्षम होता है।

Tianqiu Zhang, Muyang Lyu, Xiao Liu, Si Wu2026-05-18
🤖 AI

BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation

BiomedAP एक नवीन विज़न-इन्फॉर्म्ड ड्यूल-एंकर फ्रेमवर्क है जो डायनेमिक नॉइज़ रेगुलेशन के लिए गेटेड क्रॉस-मोडल फ्यूजन और सिमेंटिक अलाइनमेंट को स्थिर करने के लिए एक ड्यूल-एंकर कंस्ट्रेंट का उपयोग करके प्रॉम्प्ट वेरिएशंस के प्रति बायोमेडिकल विज़न-लैंग्वेज मॉडल्स की भंगुरता को संबोधित करता है, जिससे विविध बेंचमार्क पर सुदृढ़ फ्यू-शॉट मेडिकल डायग्नोसिस प्राप्त होता है।

Huanyang Tong, Kai Liu, Fangjun Kuang, Huiling Chen2026-05-18