💬 NLP

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में एकीकृत विजन-लैंग्वेज परसेप्शन का पहला व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो धारणा (परसेप्शन) को एक अंतर्निहित क्षमता के रूप में औपचारिक रूप देता है, इसके प्रतिमान विकास के पांच-चरणीय वर्गीकरण का प्रस्ताव करता है, और आर्टिफिशियल जनरल इंटेलिजेंस की ओर भविष्य के अनुसंधान दिशाओं को रेखांकित करता है।

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv2026-06-26
🤖 machine learning

Fast LeWorldModel

यह शोध पत्र Fast-LeWorldModel को प्रस्तुत करता है, जो एक पुनर्निर्माण-मुक्त (reconstruction-free) विजुअल वर्ल्ड मॉडल है जो ऑटोरिग्रेसिव वन-स्टेप रोलआउट्स के स्थान पर एक पैरेलल एक्शन-प्रिफिक्स प्रेडिक्शन मैकेनिज्म का उपयोग करके प्लानिंग को तेज़ करता है और त्रुटि संचय (error accumulation) को कम करता है, जो उम्मीदवार एक्शन सीक्वेंस के लिए भविष्य के लेटेंट्स (latents) का सीधे पूर्वानुमान लगाता है।

Yuntian Gao, Xiangyu Xu2026-06-26
💻 computer science

Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes

यह शोध पत्र टर्बिड (अस्पष्ट) अंतर्जलीय वातावरण में सूचना की हानि की समझ में मौजूद अंतराल को संबोधित करने के लिए टर्बिड अंडरवॉटर बेसलाइन (TUB) डेटासेट पेश करता है और PCD का प्रस्ताव देता है, जो एक फेज़ कॉन्ग्रुएंसी-आधारित मीट्रिक है जो प्रभावी रूप से कंप्यूटर विज़न मॉडल के प्रदर्शन के साथ सह-संबंध स्थापित करता है जहाँ मौजूदा मीट्रिक्स विफल हो जाते हैं।

Vasiliki Ismiroglou, Stefan H. Bengtson, Tasos Benos, Thomas B. Moeslund, Malte Pedersen2026-06-26
💻 computer science

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

यह शोध पत्र विजन ट्रांसफॉर्मर्स के लिए इष्टतम लेयर-विशिष्ट प्रॉम्प्ट फ्यूजन स्कीम्स खोजने हेतु एक डिफरेंशिएबल आर्किटेक्चर सर्च विधि प्रस्तावित करता है, जो यह प्रदर्शित करता है कि कॉनकैटिनेशन (concatenation), एडिशन (addition), एफाइन ट्रांसफॉर्मेशन (affine transformation) और क्रॉस-अटेंशन (cross-attention) को संयोजित करने वाला एक हाइब्रिड फ्यूजन दृष्टिकोण विविध डेटासेट्स पर मौजूदा प्रॉम्प्ट-ट्यूनिंग बेसलाइन्स की तुलना में प्रदर्शन और दक्षता में महत्वपूर्ण सुधार करता है।

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu2026-06-26
💻 computer science

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

यह शोधपत्र एक स्व-पर्यवेक्षित (self-supervised) ढांचे को प्रस्तुत करता है जो वीडियो फीचर्स को एक वॉल्यूमेट्रिक लेटेंट स्पेस में अनप्रोजेक्ट करके और उन्हें एक्शन-कंडीशन्ड एडवेक्शन के रूप में मॉडल करके निहित 3D भौतिक गतिकी (physical dynamics) को सीखता है, जिससे स्पष्ट भौतिक सिम्युलेटरों पर निर्भर किए बिना मोनोक्यूलर वीडियो से भौतिक रूप से सुसंगत, दीर्घकालिक 3D वर्ल्ड मॉडल का उद्भव संभव होता है।

Zican Wang, Niloy Mitra2026-06-26
🤖 machine learning

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs

यह शोध पत्र स्वायत्त ड्राइविंग प्रक्षेपवक्र पूर्वानुमान (autonomous driving trajectory forecasting) में एक मॉडलिंग-प्रशिक्षण बेमेल (modeling-training mismatch) की पहचान करता है, जहाँ गॉसियन मिश्रण मॉडल (Gaussian mixture models) पर लागू 'विजेता-सब-लेता-है' (winner-take-all) नुकसान अनुinformative पोस्टीरियर्स (uninformative posteriors) का कारण बनते हैं, और हल्के पोस्ट-हॉक अनुमान सुधारों—विशेष रूप से पोस्टीरियर-वेटेड मर्जिंग (posterior-weighted merging) और एक-चरण EM अपडेट (one-step EM update)—का प्रस्ताव देता है ताकि बिना पुनरप्रशिक्षण के सॉफ्ट मोड असाइनमेंट (soft mode assignments) को पुनः प्राप्त किया जा सके और पूर्वानुमान सटीकता में सुधार किया जा सके।

Qiyuan Wu, Katie Z Luo, Bharath Hariharan, Wei-Lun Chao, Mark Campbell2026-06-26
🤖 AI

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

यह शोधपत्र WatchAct प्रस्तुत करता है, जो 3,000 लॉन्ग-होराइजन इंस्टेंस वाला एक व्यापक बेंचमार्क है जो वीडियो के माध्यम से देखे गए मानवीय व्यवहार के बारे में तर्क करने की रोबोटिक मैनिपुलेशन प्रणालियों की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक मॉडल उन कार्यों के लिए काफी संघर्ष करते हैं जिनमें इवेंट ग्राउंडिंग, प्रक्रियात्मक तर्क, इरादा अनुमान और एपिसोडिक ट्रैकिंग की आवश्यकता होती है।

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius2026-06-26
💻 computer science

Forget, Anticipate and Adapt: Test Time Training for Long Videos

यह शोध पत्र फ्रेम फॉरगेटिंग नेटवर्क (FFN) को प्रस्तुत करता है, जो लंबे वीडियो के लिए एक गणनात्मक रूप से कुशल टेस्ट टाइम ट्रेनिंग दृष्टिकोण है, जो वास्तविक समय में बिना लेबल के मॉडल अनुकूलन को सक्षम करने के लिए एक निश्चित तीन-फ्रेम विंडो और एक अनुकूली सरप्राइज-आधारित तंत्र का उपयोग करता है, जिसे एक घंटे लंबे वीडियो के नए डेटासेट पर सत्यापित किया गया है।

Rajat Modi, Sebastian Noel, Xin Liang, Yogesh Singh Rawat2026-06-26
💬 NLP

The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report

यह शोध पत्र "इनअटेंशनल गैप" (Inattentional Gap) को प्रस्तुत करता है, जो एक ऐसी घटना है जहाँ कार्य-आधारित (task-conditioned) एआई मॉडल व्यवस्थित रूप से उन सुरक्षा-महत्वपूर्ण संकेतों को रिपोर्ट करने की अपनी क्षमता को दबा देते हैं जिन्हें वे अन्यथा पहचान सकते हैं, जिससे बेंचमार्क सुरक्षा स्कोर और वास्तविक दुनिया की विश्वसनीयता के बीच एक खतरनाक विच्छेद उत्पन्न होता है।

Kwan Soo Shin2026-06-26
🤖 AI

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

यह शोध पत्र CRISP को प्रस्तुत करता है, जो एक नवीन नैदानिक मूल्यांकन प्रतिमान (diagnostic evaluation paradigm) है जो धारणा (perception) को तर्क (reasoning) से अलग करने के लिए मीट्रिक 3D सीन ग्राफ और ओरेकल हस्तक्षेपों का उपयोग करता है, जिससे यह पता चलता है कि जहाँ प्रोप्राइटरी मॉडल मजबूत लेटेंट रीजनिंग के बावजूद सटीक मीट्रिक अनुमान में त्रुटिपूर्ण होते हैं, वहीं ओपन-सोर्स मॉडल मौलिक रूप से मल्टी-हॉप कंपोजिशनल रीजनिंग की कमी से सीमित हैं।

Zhixing Li, Yinan Yu2026-06-26