💻 computer science

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

यह शोध पत्र एगोसेंट्रिक एक्शन रिकग्निशन (egocentric action recognition) के लिए एक नवीन ढांचे का प्रस्ताव करता है जो वीडियो को टेम्पोरल एक्शन ग्राफ्स (Temporal Action Graphs) में परिवर्तित करके विजुअल परसेप्शन को सिम्बोलिक रीजनिंग से अलग करता है, और यह प्रदर्शित करता है कि स्ट्रक्चर्ड ग्राफ रिप्रेजेंटेशन पर इन-कॉन्टेक्स्ट लर्निंग के माध्यम से विजन-लैंग्वेज मॉडल्स को सिम्बोलिक रीज़नर के रूप में उपयोग करना विविध मॉडल परिवारों में प्रत्यक्ष पिक्सेल-आधारित अनुमान की तुलना में काफी बेहतर प्रदर्शन करता है।

Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla, Marc Pollefeys, Daniel Barath, Zuria Bauer2026-06-16
💻 computer science

Lesion-DDPM: Lesion-Enhanced 3D Diffusion for MS MRI Synthesis

यह शोध पत्र Lesion-DDPM का प्रस्ताव करता है, जो एक लीजन-एन्हांस्ड (lesion-enhanced) 3D कंडीशनल डिफ्यूजन फ्रेमवर्क है जो उच्च लीजन फिडेलिटी (lesion fidelity) के साथ MS MRI स्कैन को प्रभावी ढंग से सिंथेसाइज करता है, और मौजूदा जनरेटिव मॉडल्स की तुलना में पुनर्निर्माण सटीकता (reconstruction accuracy) और डाउनस्ट्रीम लीजन सेगमेंटेशन प्रदर्शन दोनों में महत्वपूर्ण सुधार करता है।

Weidong Zhang, Yongchan Jung, Shafayat Mowla Anik, Furen Xiao, Vasudevan Janarthanan, Enkhzaya Chuluunbaatar, Byeong Kil (…)2026-06-16
💻 computer science

Unlocking Diffusion Hierarchies: Adaptive Timestep Selection for Zero-Shot Segmentation

यह शोध पत्र एक नवीन ज़ीरो-शॉट सेगमेंटेशन पद्धति प्रस्तावित करता है जो उच्च-रिज़ॉल्यूशन वाले अटेंशन मैप्स को U-Net एनकोडर फीचर्स के साथ संलयित करके और एक अनुकूली टाइमस्टेप चयन तंत्र पेश करके प्रदर्शन को बढ़ाता है जो डिफ्यूजन मॉडल्स के भीतर पार्ट-लेवल से ऑब्जेक्ट-लेवल एब्स्ट्रैक्शंस तक की पदानुक्रमित सिमेंटिक प्रगति का लाभ उठाता है।

Ramin Nakhli, Mahesh Ramachandran, Luca Ballan2026-06-16
💻 computer science

DenseControl: Instance-Level Controllable Synthesis of Dense Crowd Image

यह शोधपत्र DenseControl को प्रस्तुत करता है, जो एक नवीन पाइपलाइन है जो सिग्नल एम्बेडिंग और टोपोलॉजिकल अखंडता की चुनौतियों से पार पाने के लिए एक आइसोलेटेड ऑब्जेक्ट एम्बेडिंग मैप, एक इम्प्लिसिट स्केल एम्बेडिंग रणनीति और एक पोजीशन शॉर्टकट तंत्र का लाभ उठाकर स्थिति, स्केल और गुणों पर स्टेट-ऑफ-द-आर्ट इंस्टेंस-लेवल नियंत्रण प्राप्त करने वाली सघन भीड़ वाली छवियों को संश्लेषित करता है।

Juncheng Wang, Lei Shang, Wang Lu, Baigui Sun, Shujun Wang2026-06-16
⚡ electrical engineering

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC

यह शोध पत्र SLS² को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संभाव्यता-आधारित सुरक्षा गारंटी के साथ सुरक्षित, विज़न-आधारित मोशन प्लानिंग को सक्षम करने के लिए एक्शन-कंडीशन्ड लेटेंट वर्ल्ड मॉडल्स को कॉन्फॉर्मल प्रेडिक्शन-एन्हांस्ड रोबस्ट मॉडल प्रिडिक्टिव कंट्रोल के साथ जोड़ता है।

Devesh Nath, Anutam Srinivasan, Haoran Yin, Ruitong Jiang, Jeffrey Fang, Glen Chou2026-06-16
💻 computer science

Parameter-Efficient Adaptation of SAM 3 for Automated ITV Generation from 4DCT Images

यह शोध पत्र एक डेटा-कुशल ढांचे को प्रस्तुत करता है जो केवल सात एनोटेटेड वॉल्यूम पर लो-रैंक फाइन-ट्यूनिंग के माध्यम से SAM 3 को अनुकूलित करता है, जिसे हार्ड नेगेटिव माइनिंग और फेज़-कोहेरेंट टेम्पोरल फ़िल्टरिंग के साथ संयोजित किया गया है, ताकि 4DCT छवियों से आर्टिफैक्ट्स को प्रभावी ढंग से दबाते हुए और कंज्यूमर-ग्रेड हार्डवेयर पर उच्च सटीकता प्राप्त करते हुए मजबूत इंटरनल टारगेट वॉल्यूम कंटूर उत्पन्न किए जा सकें।

Changwoo Song2026-06-16
🤖 AI

Mutual Distillation of Dual-Foundation Models for Semi-Supervised PET/CT Segmentation

यह शोध पत्र MuDuo का प्रस्ताव करता है, जो एक म्यूचुअल डिस्टिलेशन फ्रेमवर्क है जो केवल पांच लेबल किए गए मामलों का उपयोग करके अत्याधुनिक सेमी-सुपरवाइज्ड PET/CT अंग विभाजन के लिए एक लाइटवेट स्टूडेंट नेटवर्क को निर्देशित करने हेतु स्ट्रक्चरल (SAM-Med3D) और फंक्शनल (SegAnyPET) फाउंडेशन मॉडल्स का लाभ उठाता है।

Fuyou Mao, Beining Wu, Yanfeng Jiang, Bohan Xu, Lixin Lin, Naye Ji, Hao Zhang, Yan Tang2026-06-16
💻 computer science

XPASS-Vis: A Dataset for Cross-Domain Personalized Image Aesthetic Assessment

यह शोध पत्र XPASS-Vis को प्रस्तुत करता है, जो कला, फैशन और परिदृश्य डोमेन में 129 एनोटेटरों द्वारा रेट किए गए 6,526 उद्दीपकों (stimuli) के साथ क्रॉस-डोमेन व्यक्तिगत छवि सौंदर्य मूल्यांकन के लिए डिज़ाइन किया गया पहला डेटासेट है, और उन बेसलाइन अनसुपरवाइज्ड डोमेन एडाप्टेशन मॉडलों को स्थापित करता है जो व्यक्तिगत सौंदर्य प्राथमिकताओं की आंशिक हस्तांतरणीयता को प्रदर्शित करते हैं, जबकि शेष प्रदर्शन अंतराल को पाटने के लिए आगे के अनुसंधान की आवश्यकता पर प्रकाश डालते हैं।

Takato Hayashi, Hiroaki Takahara, Candy Olivia Mawalim, Hiromi Narimatsu, Akisato Kimura, Shiro Kumano, Shogo Okada2026-06-16
💻 computer science

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning

यह शोधपत्र विजन-लैंग्वेज मॉडल्स के लिए एक सेल्फ-क्वेश्चनिंग फ्रेमवर्क का प्रस्ताव करता है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग करके मध्यवर्ती उप-प्रश्नों के निर्माण और अंतिम उत्तर की शुद्धता दोनों को पुरस्कृत करके स्वायत्त रूप से कंपोजिशनल विजुअल रीजनिंग रणनीतियों की खोज करता है, जिससे मानव-लिखित डिकम्पोजिशन उदाहरणों की आवश्यकता के बिना जटिल कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Saraswathy Amjith2026-06-16
💻 computer science

3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation

यह शोध पत्र एंडोस्कोपिक नेविगेशन में मोनोक्यूलर वीडियो डेप्थ एस्टीमेशन के लिए एक नवीन स्व-पर्यवेक्षित (self-supervised) ढांचे को प्रस्तुत करता है जो इस कार्य को एक अनकन्स्ट्रेंड मल्टी-व्यू 3D रिकंस्ट्रक्शन समस्या के रूप में पुनर्गठित करता है, जो अत्याधुनिक स्थानिक सटीकता और वैश्विक ज्यामितीय निरंतरता प्राप्त करने के लिए 3D फाउंडेशन मॉडल्स और एक तीन-प्रतिबंध अनुकूलन रणनीति का लाभ उठाता है।

Yuanye Liu, Ke Zhang, Junzhe Jiang, Li Zhang, Vishal Patel, Xiahai Zhuang2026-06-16