💻 computer science

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

PAVXploreRL एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रिवॉर्ड-संचालित प्रशिक्षण और शोर-संचालित आउट-ऑफ-डिस्ट्रीब्यूशन एक्शन अन्वेषण के माध्यम से भौतिक संभाव्यता (Physical Plausibility), एक्शन पालन (Action Adherence), और दृश्य निष्ठा (Visual Fidelity) यानी PAV उद्देश्यों को स्पष्ट रूप से अनुकूलित करके एक्शन-कंडीशन्ड वर्ल्ड मॉडल्स को बेहतर बनाता है, जिससे यह मौजूदा एक्सपर्ट-ओनली विधियों की तुलना में श्रेष्ठ सामान्यीकरण और अधिक विश्वसनीय पॉलिसी मूल्यांकन प्राप्त करता है।

Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fenjiao Cheng, Xiaodang Liang, Roy Ka-Wei Lee2026-07-21
💬 NLP

Can Multimodal Large Language Models Understand OCT?

यह शोध पत्र OCT-Bench प्रस्तुत करता है, जो धारणा (perception), संज्ञान (cognition) और तर्क (reasoning) के आयामों में 10,000 से अधिक सूक्ष्म-स्तरीय प्रश्नों वाला एक व्यापक बेंचमार्क है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का व्यवस्थित रूप से मूल्यांकन करता है, और यह प्रकट करता है कि वर्तमान मॉडल—चिकित्सा-अनुकूलित और बड़े पैमाने के वेरिएंट्स सहित—नैदानिक रूप से आधारित OCT इमेज समझ करने की अपनी क्षमता में काफी सीमित हैं।

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song2026-07-21
🤖 AI

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

TellTale एक टेक्स्ट-ओनली दृष्टिकोण है जो साक्षात्कार वीडियो में द्वंद्व (ambivalence) और हिचकिचाहट (hesitancy) को पहचानने के लिए है, जो फाइन-ट्यून्ड मल्टी-इंस्टेंस LoRA टेक्स्ट एनकोडर को ज़ीरो-शॉट LLM जज के साथ जोड़कर अत्याधुनिक प्रदर्शन प्राप्त करता है, और BAH डेटासेट पर विज़न-आधारित बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Abdel-Karim Al-Tamimi, Ali Rodan2026-07-21
💻 computer science

DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution

DRIFT एक दो-चरणीय रेक्टिफाइड फ्लो फ्रेमवर्क है जो थ्रू-प्लेन एमआरआई सुपर-रिज़ॉल्यूशन के लिए एक एनाटॉमिकल प्रोजेक्शन नेटवर्क को नियत इनिशियलाइज़ेशन के लिए और एक फिजिक्स-अवेयर डिफिकल्टी-गाइडेड एडेप्टिव शेड्यूलर को उच्च-निष्ठा, मोटाई-सुसंगत पुनर्निर्माण प्राप्त करने के लिए जोड़ता है, जिससे मौजूदा विधियों की तुलना में इन्फरेंस लागत में काफी कमी आती है।

Yoonseok Choi, Eun-Gyu Ha, Daniel Kim, Mohammed A. Al-masni, Ming-Hsuan Yang, Dong-Hyun Kim2026-07-21
🤖 AI

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model

यह स्थिति पत्र (position paper) तर्क देता है कि स्पष्टीकरण स्थिरता (explanation stability) किसी मॉडल का अंतर्निहित गुण नहीं है, बल्कि विशिष्ट मॉडल-विधि युग्म (model-method pair) की एक उभरती हुई विशेषता है, जिसके लिए सुरक्षा या विश्वसनीयता के भ्रामक दावों से बचने हेतु क्रॉस-मेथड सत्यापन (cross-method validation) आवश्यक है।

Kabilan Elangovan, Daniel Ting2026-07-21
💻 computer science

Foundation-Assisted Active Learning for Object Detection Annotation

यह शोध पत्र रिमोट सेंसिंग ऑब्जेक्ट डिटेक्शन के लिए एक फाउंडेशन-मॉडल-असिस्टेड एक्टिव लर्निंग फ्रेमवर्क प्रस्तावित करता है जो लोकलाइजेशन नॉइज़ और सूडो-डाइवर्सिटी जैसी चुनौतियों से निपटने के लिए डुअल-सोर्स अनसर्टेनिटी एस्टीमेशन, ऑब्जेक्ट-सेंट्रिक डाइवर्सिटी सैंपलिंग और सेमी-ऑटोमैटिक बॉक्स रिफाइनमेंट को एकीकृत करता है, जिससे एनोटेशन दक्षता और कोल्ड-स्टार्ट प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jinchang Zhang, Arnold Zumbrun, Jing Lin, Guoyu Lu2026-07-21
💻 computer science

Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs

यह शोध पत्र MoBE का प्रस्ताव करता है, जो एक पूर्णतः ऑप्टिमाइजेशन-मुक्त ढांचा है जो एंट्रॉपी-गाइडेड डायनेमिक एक्सपर्ट रूटिंग को ऑनलाइन बायेसियन एडेप्टेशन के साथ संयोजित करके मेडिकल विजन-लैंग्वेज मॉडल्स की टेस्ट-टाइम मोडैलिटी जनरलाइजेशन को बढ़ाता है, जिससे बिना किसी ग्रेडिएंट अपडेट की आवश्यकता के विविध मेडिकल बेंचमार्क पर उत्कृष्ट सटीकता प्राप्त होती है।

Raza Imam, Darakshan Rashid, Yutong Xie, Dwarikanath Mahapatra, Brejesh Lall, Mohammad Yaqub2026-07-21
💻 computer science

VisionAssist: An Open-Source Smartphone Assistant for AI-Based Visual Accessibility

VisionAssist एक ओपन-सोर्स, AI-संचालित स्मार्टफोन एप्लिकेशन है जो ऑब्जेक्ट डिटेक्शन, इमेज डिस्क्रिप्शन और इमरजेंसी/रिमाइंडर फीचर्स को एक एकल, हैंड-फ्री, वॉयस-कंट्रोल्ड इंटरफेस में एकीकृत करके कम दृष्टि वाले उपयोगकर्ताओं के लिए स्वतंत्रता को बढ़ाता है।

Ayşe Özlem Çalışkan, Jordi Sanchez-Riera2026-07-21
🤖 AI

Spatiotemporal Facial Action Unit Detection using Twin Cycle Autoencoders for Driver Monitoring

यह शोध पत्र ट्विन साइकिल ऑटोएनकोडर (TCA) का प्रस्ताव करता है, जो एक नवीन स्थानिक-कालिक (spatiotemporal) आर्किटेक्चर है जो चुनौतीपूर्ण इन-कैबिन स्थितियों के तहत ड्राइवर मॉनिटरिंग के लिए फेशियल एक्शन यूनिट्स को मजबूती से पहचानने हेतु स्थानिक उपस्थिति पृथक्करण (spatial appearance disentanglement) और कालिक प्रक्षेपवक्र निरंतरता (temporal trajectory consistency) को एकीकृत करता है, जो एम्बेडेड हार्डवेयर पर रीयल-टाइम थ्रूपुट बनाए रखते हुए बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Sai Sidharth D2026-07-21✓ Author reviewed
💻 computer science

Dataset Distillation by Influence Matching

यह शोध पत्र इन्फ्लुएंस मैचिंग (इन्फ-मैच) प्रस्तुत करता है, जो एक डेटासेट डिस्टिलेशन विधि है जो एक नवीन, कुशल, पूर्णतः अवकलनीय (fully differentiable) नमूना-स्तरीय प्रभाव अनुमानक के माध्यम से उनके अंतिम प्रशिक्षण परिणामों को पूर्ण डेटासेट के साथ संरेखित करके संक्षिप्त सिंथेटिक डेटासेट सीखती है, और इमेज क्लासिफिकेशन एवं विजन-लैंग्वेज रिट्रीवल बेंचमार्क दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करती है।

Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi2026-07-21