💻 computer science

Leveraging Prior Knowledge of Diffusion Model for Person Search

यह शोध पत्र DiffPS प्रस्तुत करता है, जो एक नवीन पर्सन सर्च फ्रेमवर्क है जो मौजूदा ImageNet-आधारित बैकबोन की सीमाओं को दूर करने और डिटेक्शन एवं री-आइडेंटिफिकेशन के बीच अनुकूलन संघर्षों (optimization conflicts) को हल करने के लिए तीन विशिष्ट मॉड्यूल के माध्यम से प्री-ट्रेंड डिफ्यूजन मॉडल प्रायर्स (priors) का लाभ उठाता है, जिससे CUHK-SYSU और PRW बेंचमार्क पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

Giyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom2026-07-15
💻 computer science

Together, Then Apart: Balancing Alignment and Distinctiveness for Multimodal Survival Analysis

यह शोध पत्र TTA का प्रस्ताव करता है, जो एक मल्टीमॉडल सर्वाइवल एनालिसिस फ्रेमवर्क है जो प्रोटोटाइप-आधारित संरेखण (prototype-based alignment), एंकर-गाइडेड कंट्रास्टिव लर्निंग (anchor-guided contrastive learning) और अनबैलेंस्ड ऑप्टिमल ट्रांसपोर्ट (unbalanced optimal transport) के माध्यम से क्रॉस-मोडल संरेखण और मोडैलिटी-विशिष्ट विशिष्टता को संतुलित करने के लिए "टुगेदर देन अपार्ट" (Together Then Apart) रणनीति का उपयोग करता है, जिससे TCGA कोहॉर्ट्स पर कैंसर प्रोग्नोसिस भविष्यवाणी और व्याख्यात्मकता में सुधार होता है।

Wenjing Liu, Qin Ren, Wen Zhang, Yuewei Lin, Chenyu You2026-07-15
💻 computer science

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS एक दो-चरणीय (two-stage) इनवर्स रेंडरिंग फ्रेमवर्क है जो ज्यामिति और सामग्री के अनुमान को स्थिर करने के लिए फाउंडेशन मॉडल प्रायर्स (priors) का लाभ उठाता है, जिससे स्पार्स-व्यू (sparse-view) सेटिंग्स में प्रदर्शन में महत्वपूर्ण सुधार होता है जहाँ पारंपरिक गॉसियन-आधारित विधियाँ अस्पष्टता के कारण संघर्ष करती हैं।

Patrick Noras, Jun Myeong Choi, Didier Stricker, Pieter Peers, Roni Sengupta2026-07-15
💻 computer science

M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention

यह शोध पत्र M2I2HA का प्रस्ताव करता है, जो एक नवीन मल्टी-मोडल ऑब्जेक्ट डिटेक्शन नेटवर्क है जो उच्च-क्रम निर्भरताओं (high-order dependencies) को कैप्चर करने और सटीक क्रॉस-मोडल संरेखण प्राप्त करने में CNNs, Transformers और SSMs की सीमाओं को दूर करने के लिए इंट्रा- और इंटर-मोडल हाइपरग्राफ अटेंशन मैकेनिज्म का लाभ उठाता है, जिससे सार्वजनिक डेटासेट्स पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

Xiaofan Yang, Yubin Liu, Wei Pan, Guoqing Chu, Junming Zhang, Jie Zhao, Zhuoqi Man, Xuanming Cao2026-07-15
🤖 machine learning

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

यह शोध पत्र एक ऐसी प्रशिक्षण पद्धति प्रस्तावित करता है जो उपसमूह-आधारित एट्रिब्यूशन बाधाओं (subset-based attribution constraints) के माध्यम से ऑफ-प्रायर साक्ष्य पर निर्भरता को दंडित करके मॉडलों को मानवीय पूर्वाग्रहों (human priors) के साथ संरेखित करती है, जिससे इमेज क्लासिफिकेशन और GUI एजेंट कार्यों में कार्य सटीकता और निर्णय तर्कसंगतता दोनों में सुधार होता है।

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang (…)2026-07-15
🤖 AI

Egocentric Bias in Vision-Language Models

यह शोधपत्र FlipSet प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जो यह प्रकट करता है कि विजन-लैंग्वेज मॉडल एक व्यवस्थित इगोसेंट्रिक (स्व-केंद्रित) पूर्वाग्रह और एक संरचनात्मक कमी प्रदर्शित करते हैं, जो इन क्षमताओं को अलग-अलग रूप में रखने के बावजूद सामाजिक जागरूकता को स्थानिक तर्क के साथ एकीकृत करने में विफल रहते हैं।

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo2026-07-15
💻 computer science

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

यह शोध पत्र VISA का प्रस्ताव करता है, जो एक प्रशिक्षण-समय (training-time) सिमेंटिक ऑडिटिंग फ्रेमवर्क है जो 3D ऑक्यूपेंसी वर्ल्ड मॉडल्स के लिए संरचित, विश्वसनीयता-जागरूक ऑडिट उत्पन्न करने के लिए ऑफलाइन विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जो इन्फरेंस प्रक्रिया को बदले बिना क्लोज्ड-सेट mIoU और दुर्लभ-वर्ग डिटेक्शन में महत्वपूर्ण सुधार करता है।

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha2026-07-15
💻 computer science

Do You Remember? Toward Memory-Centric Multimodal AI

यह शोध पत्र "DoYouRemember" प्रस्तुत करता है, जो एक स्मृति-केंद्रित मल्टीमॉडल AI आर्किटेक्चर है जो मानक वन-शॉट प्रोसेसिंग को एक साझा मैट्रिक्स और स्थानीय EMA अपडेट का उपयोग करने वाली एक पुनर्रचनात्मक स्मृति प्रणाली से बदल देता है, यह प्रदर्शित करते हुए कि LLM हिडन स्टेट्स विजुअल जानकारी को त्याग देते हैं और मतिभ्रम (hallucination) को दोष के बजाय लॉसवी मेमोरी डीकंप्रेशन के एक अंतर्निहित गुण के रूप में पुनर्परिभाषित करते हैं।

Xuguang Yu, Weigang Zheng, Minyue Yu2026-07-15
💻 computer science

Contrastive Joint-Embedding Prediction for Representation Learning in Structural MRI

यह शोध पत्र COJEPA को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) ढांचा है जो लेबल किए गए डेटा की आवश्यकता के बिना, जुड़वां पहचान (twin retrieval), आयु प्रतिगमन (age regression) और ट्यूमर विभाजन (tumor segmentation) में अत्याधुनिक प्रदर्शन प्राप्त करते हुए, मजबूत 3D मस्तिष्क MRI निरूपणों (representations) को सीखने के लिए कंट्रास्टिव लॉस (contrastive loss) को जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (joint-embedding predictive architecture) के साथ जोड़ता है।

Fabian Mager, Lars Kai Hansen2026-07-15
💻 computer science

An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering

यह शोध पत्र विषम चिकित्सा विज़ुअल क्वेश्चन अनswering (visual question answering) के लिए निरंतर सीखने (continual learning) की विधियों का एक व्यवस्थित अनुभवजन्य मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि मौजूदा दृष्टिकोण विभिन्न उद्देश्यों और पर्यवेक्षण प्रारूपों वाले विविध नैदानिक कार्यों के अनुकूल होने के दौरान स्थिरता और प्लास्टिसिटी के बीच संतुलन बनाने में संघर्ष करते हैं।

Mai A. Shaaban, Tausifa Jan Saleem, Alaa Mohamed, Dilnaz Utemissova, Ufaq Khan, Mohammad Yaqub2026-07-15