🤖 AI

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

यह शोध पत्र DRIVE-CHOREO को प्रस्तुत करता है, जो एक LLM-कोरियोग्राफ्ड मल्टी-एजेंट वर्ल्ड मॉडल है जो एक साझा लेटेंट टोकन सीक्वेंस और को-कंप्रेशन रणनीति के माध्यम से विषम ड्राइविंग नियंत्रणों और मल्टी-व्यू ज्योमेट्री को एकीकृत करता है, जिससे अत्याधुनिक निरंतरता (state-of-the-art consistency) प्राप्त होती है और स्वायत्त ड्राइविंग कार्यों के लिए महत्वपूर्ण डाउनस्ट्रीम उपयोगिता प्रदर्शित होती है।

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan (…)2026-06-17
💻 computer science

Universal Image Restoration via Internalized Chain-of-Thought Reasoning

यह शोध पत्र CoTIR को प्रस्तुत करता है, जो एक सार्वभौमिक इमेज रेस्टोरेशन फ्रेमवर्क है जो एक डिफरेंशिएबल लैग्रेंजियन-प्रेरित ऑब्जेक्टिव का उपयोग करके एक एकल फाइन-ट्यून्ड इमेज एडिटिंग मॉडल के भीतर चेन-ऑफ-थॉट रीजनिंग को आंतरिक रूप से समाहित करता है, और इसके साथ ही एक नए बड़े पैमाने के बेंचमार्क (CoTIR-Bench) का उपयोग करता है, ताकि जटिल डिग्रेडेशन परिदृश्यों में बेहतर परसेप्चुअल क्वालिटी और फिडेलिटी प्राप्त की जा सके और मल्टी-स्टेप प्रोसेसिंग की कम्प्यूटेशनल लागतों से बचा जा सके।

Yu Guo, Zhengru Fang, Shengfeng He, Senkang Hu, Yihang Tao, Phone Lin, Yuguang Fang2026-06-17
💻 computer science

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA एक अनुकूलन योग्य मल्टीमॉडल विजन-लैंग्वेज-एक्शन मॉडल है जो विभिन्न सेंसरों को ऑन-डिमांड टूल्स के रूप में गतिशील रूप से आमंत्रित करता है, उनके रीडिंग को एक एकीकृत "ग्राउंडेड सेंसर इमेज" प्रतिनिधित्व में परिवर्तित करता है, और तापमान, ऑडियो या रडार सेंसिंग की आवश्यकता वाले जटिल रोबोटिक मैनिपुलेशन कार्यों में बेहतर प्रदर्शन प्राप्त करने के लिए एक डेटा सिंथेसिस पाइपलाइन का लाभ उठाता है।

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining G (…)2026-06-17
🤖 AI

SkillMoV: Mixture-of-View Routing with Prototype-Conditioned Gating for Unified Multi-View Proficiency Estimation

SkillMoV एक एकीकृत, पैरामीटर-कुशल ढांचा है जो मल्टी-व्यू दक्षता अनुमान के लिए प्रोटोटाइप-कंडीशन्ड गेटिंग के साथ मिक्स्चर-ऑफ-व्यू प्रोजेक्टर का लाभ उठाता है ताकि सिंक्रोनाइज़्ड कैमरा फीचर्स को अनुकूल रूप से एकत्रित किया जा सके, जिससे इसके केवल एक अंश पैरामीटर्स को प्रशिक्षित करते हुए विविध कौशल डोमेन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Edoardo Bianchi, Antonio Liotta2026-06-17
🤖 AI

Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition

यह शोध पत्र "डिवाइड, डेलिब्रेट, डिसाइड" (विभाजित करें, विचार-विमर्श करें, निर्णय लें) का प्रस्ताव करता है, जो एक पूर्णतः स्थानीय, ज़ीरो-शॉट मल्टी-एजेंट फ्रेमवर्क है जो संरचित वीडियो विभाजन, सहकर्मी-परामर्श विचार-विमर्श और बोर्डा काउंट एकत्रीकरण के माध्यम से एक विषम एनसेंबल वीएलएम (VLM) को ऑर्केस्ट्रेट करके सूक्ष्म ईगोसेंट्रिक एक्शन रिकग्निशन को बढ़ाता है ताकि बिना फाइन-ट्यूनिंग के डिकोरिलेटेड मॉडल प्रायर्स (decorrelated model priors) का लाभ उठाया जा सके।

Alessandro Sottovia, Alessandro Torcinovich, Oswald Lanz2026-06-17
💻 computer science

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

यह शोध पत्र ERQA-Plus को पेश करता है, जो एक नैदानिक बेंचमार्क है जिसमें पांच तर्क श्रेणियों में 1,766 प्रश्न-उत्तर उदाहरण शामिल हैं, जिसका उद्देश्य वर्तमान एम्बोडीड एआई (embodied AI) मॉडलों की समग्र उच्च सटीकता के बावजूद स्थानिक, प्रक्रियात्मक और सामाजिक तर्क में विशिष्ट सीमाओं का मूल्यांकन करना और उन्हें उजागर करना है।

Hong Yang, Basura Fernando2026-06-17
💬 NLP

Vision-language models for chest radiography do not always need the image

यह शोध पत्र प्रदर्शित करता है कि चेस्ट रेडियोग्राफी के लिए कई विजन-लैंग्वेज मॉडल वास्तव में छवियों का विश्लेषण करने के बजाय टेक्स्ट-आधारित प्रायोरिटीज़ (priors) पर निर्भर रहकर उच्च सटीकता प्राप्त करते हैं, और यह तर्क देता है कि सुरक्षित नैदानिक तैनाती सुनिश्चित करने के लिए केवल सटीकता स्कोर ही नहीं, बल्कि ग्राउंडिंग ऑडिट भी आवश्यक हैं।

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh2026-06-17
💻 computer science

Heterogeneous SAR-optical fusion for near-real-time land use and land cover mapping under cloud contamination: A novel framework and global benchmark dataset

यह शोधपत्र CloudLULC-Net को प्रस्तुत करता है, जो क्लाउड-संदूषित ऑप्टिकल और SAR डेटा को मजबूत नियर-रियल-टाइम लैंड यूज़ और लैंड कवर मैपिंग के लिए फ्यूज करने वाला एक नवीन एंड-टू-एंड फ्रेमवर्क है, जिसके साथ इसके मौजूदा तरीकों पर बेहतर प्रदर्शन को मान्य करने के लिए एक बड़े पैमाने के वैश्विक बेंचमार्क डेटासेट (CloudLULC-Set) को भी जारी किया गया है।

Jiangong Xu, Weibao Xue, Xiaoyu Yu, Jun Pan, Xinlian Lianga, Mi Wang2026-06-17
🤖 AI

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams

यह शोध पत्र LiveStarPro को प्रस्तुत करता है, जो एक सक्रिय लाइव स्ट्रीमिंग सहायक है जो स्वायत्त प्रतिक्रिया समय के लिए स्ट्रीमिंग वेरिफिकेशन डिकोडिंग, वृद्धिशील संरेखण के लिए स्ट्रीमिंग कॉज़ल अटेंशन मास्क और कुशल दीर्घकालिक रिकॉल के लिए ट्री-स्ट्रक्चर्ड पदानुक्रमित मेमोरी को संयोजित करने वाले एक नवीन आर्किटेक्चर के माध्यम से लंबी अवधि के स्ट्रीम को संभालने में मौजूदा वीडियो-LLMs की सीमाओं को दूर करता है, जिसे नए OmniStarPro बेंचमार्क द्वारा प्रमाणित किया गया है।

Zhenyu Yang, Kairui Zhang, Bing Wang, Shengsheng Qian, Changsheng Xu2026-06-17
💻 computer science

Million-scale multimodal pollen microscopy with expert-guided foundation models

यह शोध पत्र पोलन एआई एटलस (Pollen AI Atlas) को प्रस्तुत करता है, जो विशेषज्ञ-क्यूरेटेड पराग सूक्ष्मदर्शी छवियों और विजन-लैंग्वेज मॉडल द्वारा जनरेट किए गए संरचित रूपात्मक विवरणों (morphological captions) का एक मिलियन-स्केल मल्टीमॉडल संसाधन है, जो स्केलेबल, व्याख्या योग्य और क्रॉस-रीजनल पराग पहचान के लिए एक नया बेंचमार्क स्थापित करता है।

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai2026-06-17