🤖 AI

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

यह शोध पत्र एक भाषा-केंद्रित ढांचे को प्रस्तुत करता है जो एक वैश्विक अर्थ संबंधी कोडबुक (global semantic codebook) के माध्यम से विविध बहुविध डेटा (multimodal data) को परमाणु प्रस्थापनाओं (atomic propositions) के एक व्याख्या योग्य स्थान में एकीकृत करता है, जिससे स्वायत्त ड्राइविंग जैसे अनुप्रयोगों के लिए उन्नत तर्क, क्रॉस-मोडल रिट्रीवल और जटिल संयोजन सक्षम होता है।

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose (…)2026-07-21
🤖 AI

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

यह शोध पत्र एक वीआर-आधारित मानव-रोबोट इंटरेक्शन फ्रेमवर्क प्रस्तुत करता है जो सिम्युलेटेड खतरनाक वातावरण में खतरों की पहचान करने और उन्हें एनोटेट करने के लिए विजन लैंग्वेज मॉडल्स का लाभ उठाता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण बिना एनोटेशन वाले बेसलाइन की तुलना में ऑपरेटर की स्थितिजन्य जागरूकता, स्पष्टता और सहजता को महत्वपूर्ण रूप से बढ़ाता है।

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek2026-07-21
💻 computer science

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

PAVXploreRL एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रिवॉर्ड-संचालित प्रशिक्षण और शोर-संचालित आउट-ऑफ-डिस्ट्रीब्यूशन एक्शन अन्वेषण के माध्यम से भौतिक संभाव्यता (Physical Plausibility), एक्शन पालन (Action Adherence), और दृश्य निष्ठा (Visual Fidelity) यानी PAV उद्देश्यों को स्पष्ट रूप से अनुकूलित करके एक्शन-कंडीशन्ड वर्ल्ड मॉडल्स को बेहतर बनाता है, जिससे यह मौजूदा एक्सपर्ट-ओनली विधियों की तुलना में श्रेष्ठ सामान्यीकरण और अधिक विश्वसनीय पॉलिसी मूल्यांकन प्राप्त करता है।

Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fenjiao Cheng, Xiaodang Liang, Roy Ka-Wei Lee2026-07-21
💬 NLP

Can Multimodal Large Language Models Understand OCT?

यह शोध पत्र OCT-Bench प्रस्तुत करता है, जो धारणा (perception), संज्ञान (cognition) और तर्क (reasoning) के आयामों में 10,000 से अधिक सूक्ष्म-स्तरीय प्रश्नों वाला एक व्यापक बेंचमार्क है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का व्यवस्थित रूप से मूल्यांकन करता है, और यह प्रकट करता है कि वर्तमान मॉडल—चिकित्सा-अनुकूलित और बड़े पैमाने के वेरिएंट्स सहित—नैदानिक रूप से आधारित OCT इमेज समझ करने की अपनी क्षमता में काफी सीमित हैं।

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song2026-07-21
🤖 AI

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

TellTale एक टेक्स्ट-ओनली दृष्टिकोण है जो साक्षात्कार वीडियो में द्वंद्व (ambivalence) और हिचकिचाहट (hesitancy) को पहचानने के लिए है, जो फाइन-ट्यून्ड मल्टी-इंस्टेंस LoRA टेक्स्ट एनकोडर को ज़ीरो-शॉट LLM जज के साथ जोड़कर अत्याधुनिक प्रदर्शन प्राप्त करता है, और BAH डेटासेट पर विज़न-आधारित बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Abdel-Karim Al-Tamimi, Ali Rodan2026-07-21
💻 computer science

DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution

DRIFT एक दो-चरणीय रेक्टिफाइड फ्लो फ्रेमवर्क है जो थ्रू-प्लेन एमआरआई सुपर-रिज़ॉल्यूशन के लिए एक एनाटॉमिकल प्रोजेक्शन नेटवर्क को नियत इनिशियलाइज़ेशन के लिए और एक फिजिक्स-अवेयर डिफिकल्टी-गाइडेड एडेप्टिव शेड्यूलर को उच्च-निष्ठा, मोटाई-सुसंगत पुनर्निर्माण प्राप्त करने के लिए जोड़ता है, जिससे मौजूदा विधियों की तुलना में इन्फरेंस लागत में काफी कमी आती है।

Yoonseok Choi, Eun-Gyu Ha, Daniel Kim, Mohammed A. Al-masni, Ming-Hsuan Yang, Dong-Hyun Kim2026-07-21
🤖 AI

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model

यह स्थिति पत्र (position paper) तर्क देता है कि स्पष्टीकरण स्थिरता (explanation stability) किसी मॉडल का अंतर्निहित गुण नहीं है, बल्कि विशिष्ट मॉडल-विधि युग्म (model-method pair) की एक उभरती हुई विशेषता है, जिसके लिए सुरक्षा या विश्वसनीयता के भ्रामक दावों से बचने हेतु क्रॉस-मेथड सत्यापन (cross-method validation) आवश्यक है।

Kabilan Elangovan, Daniel Ting2026-07-21
💻 computer science

Foundation-Assisted Active Learning for Object Detection Annotation

यह शोध पत्र रिमोट सेंसिंग ऑब्जेक्ट डिटेक्शन के लिए एक फाउंडेशन-मॉडल-असिस्टेड एक्टिव लर्निंग फ्रेमवर्क प्रस्तावित करता है जो लोकलाइजेशन नॉइज़ और सूडो-डाइवर्सिटी जैसी चुनौतियों से निपटने के लिए डुअल-सोर्स अनसर्टेनिटी एस्टीमेशन, ऑब्जेक्ट-सेंट्रिक डाइवर्सिटी सैंपलिंग और सेमी-ऑटोमैटिक बॉक्स रिफाइनमेंट को एकीकृत करता है, जिससे एनोटेशन दक्षता और कोल्ड-स्टार्ट प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jinchang Zhang, Arnold Zumbrun, Jing Lin, Guoyu Lu2026-07-21
💻 computer science

Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs

यह शोध पत्र MoBE का प्रस्ताव करता है, जो एक पूर्णतः ऑप्टिमाइजेशन-मुक्त ढांचा है जो एंट्रॉपी-गाइडेड डायनेमिक एक्सपर्ट रूटिंग को ऑनलाइन बायेसियन एडेप्टेशन के साथ संयोजित करके मेडिकल विजन-लैंग्वेज मॉडल्स की टेस्ट-टाइम मोडैलिटी जनरलाइजेशन को बढ़ाता है, जिससे बिना किसी ग्रेडिएंट अपडेट की आवश्यकता के विविध मेडिकल बेंचमार्क पर उत्कृष्ट सटीकता प्राप्त होती है।

Raza Imam, Darakshan Rashid, Yutong Xie, Dwarikanath Mahapatra, Brejesh Lall, Mohammad Yaqub2026-07-21
💻 computer science

VisionAssist: An Open-Source Smartphone Assistant for AI-Based Visual Accessibility

VisionAssist एक ओपन-सोर्स, AI-संचालित स्मार्टफोन एप्लिकेशन है जो ऑब्जेक्ट डिटेक्शन, इमेज डिस्क्रिप्शन और इमरजेंसी/रिमाइंडर फीचर्स को एक एकल, हैंड-फ्री, वॉयस-कंट्रोल्ड इंटरफेस में एकीकृत करके कम दृष्टि वाले उपयोगकर्ताओं के लिए स्वतंत्रता को बढ़ाता है।

Ayşe Özlem Çalışkan, Jordi Sanchez-Riera2026-07-21