💻 computer science

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL मल्टीमॉडल सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक नवीन ढांचा है जो ऑपरेटर-कंडीशन्ड पर्यवेक्षण को आउटकम-कंडीशन्ड, सैंपल-वाइज संरेखण से बदलकर विजुअल ग्राउंडिंग को बढ़ाता है, जिसमें विविध बेंचमार्क पर बेहतर तर्क प्रदर्शन के लिए देखे गए रिवॉर्ड ड्रॉप्स के आधार पर हस्तक्षेपों को गतिशील रूप से रूट करने के लिए एक फ्रोजन ऑडिट पॉलिसी का उपयोग किया जाता है।

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yiron (…)2026-07-16
💻 computer science

CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition

यह शोध पत्र CF-Net प्रस्तुत करता है, जो एक गहरा मल्टीमॉडल नेटवर्क है जो अनकन्स्ट्रेंड (unconstrained) वीडियो में द्वंद्व (ambivalence) और हिचकिचाहट का पता लगाने के लिए स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने हेतु स्पीकर नॉर्मलाइजेशन, क्रॉस-मोडल विसंगति के लिए स्पष्ट संघर्ष संलयन (explicit conflict fusion), और निश्चितता-भारित प्रशिक्षण (certainty-weighted training) का लाभ उठाता है।

Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh2026-07-16
💻 computer science

Screening Is Effective for Visual Recognition

यह शोधपत्र विजनस्क्रीन (VisionScreen) को प्रस्तुत करता है, जो एक नवीन विजन मॉडल है जो क्वेरी-की (query-key) समानता के आधार पर अप्रासंगिक इमेज पैचेस का स्वतंत्र रूप से मूल्यांकन और निष्कासन करके स्क्रीनिंग तंत्र को लैंग्वेज मॉडलिंग से विजुअल रिकग्निशन में अनुकूलित करता है, जिससे यह इमेज क्लासिफिकेशन बेंचमार्क पर पारंपरिक विजन ट्रांसफॉर्मर्स से बेहतर प्रदर्शन करता है।

Shunya Shimomura, Kazuhiro Hotta2026-07-16
⚡ electrical engineering

Traffic-Aware Pedestrian Intention Prediction

यह शोध पत्र एक ट्रैफिक-अवेयर स्पैटियो-टेम्पोरल ग्राफ कन्वोल्यूशनल नेटवर्क (TA-STGCN) प्रस्तावित करता है जो स्वायत्त वाहनों के लिए पैदल यात्री इरादा भविष्यवाणी की सटीकता में महत्वपूर्ण सुधार करने हेतु गतिशील ट्रैफिक सिग्नल अवस्थाओं और बाउंडिंग बॉक्स विशेषताओं को एकीकृत करता है, जिससे PIE डेटासेट पर बेसलाइन मॉडल की तुलना में 4.75% की वृद्धि प्राप्त हुई है।

Fahimeh Orvati Nia, Hai Lin2026-07-15
⚡ electrical engineering

Recent Advances in Transformer and Large Language Models for UAV Applications

यह समीक्षा पत्र यूएवी (UAV) प्रणालियों में हालिया ट्रांसफॉर्मर-आधारित और लार्ज लैंग्वेज मॉडल की प्रगति को व्यवस्थित रूप से वर्गीकृत और मूल्यांकित करता है, जो शोधकर्ताओं और अभ्यासकर्ताओं को क्षेत्र में मार्गदर्शन करने के लिए एक एकीकृत वर्गीकरण, तुलनात्मक प्रदर्शन विश्लेषण, और चुनौतियों एवं भविष्य की दिशाओं का एक आलोचनात्मक मूल्यांकन प्रस्तुत करता है।

Hamza Kheddar, Yassine Habchi, Mohamed Chahine Ghanem, Mustapha Hemis, Dusit Niyato2026-07-15
💻 computer science

Leveraging Prior Knowledge of Diffusion Model for Person Search

यह शोध पत्र DiffPS प्रस्तुत करता है, जो एक नवीन पर्सन सर्च फ्रेमवर्क है जो मौजूदा ImageNet-आधारित बैकबोन की सीमाओं को दूर करने और डिटेक्शन एवं री-आइडेंटिफिकेशन के बीच अनुकूलन संघर्षों (optimization conflicts) को हल करने के लिए तीन विशिष्ट मॉड्यूल के माध्यम से प्री-ट्रेंड डिफ्यूजन मॉडल प्रायर्स (priors) का लाभ उठाता है, जिससे CUHK-SYSU और PRW बेंचमार्क पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

Giyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom2026-07-15
💻 computer science

Together, Then Apart: Balancing Alignment and Distinctiveness for Multimodal Survival Analysis

यह शोध पत्र TTA का प्रस्ताव करता है, जो एक मल्टीमॉडल सर्वाइवल एनालिसिस फ्रेमवर्क है जो प्रोटोटाइप-आधारित संरेखण (prototype-based alignment), एंकर-गाइडेड कंट्रास्टिव लर्निंग (anchor-guided contrastive learning) और अनबैलेंस्ड ऑप्टिमल ट्रांसपोर्ट (unbalanced optimal transport) के माध्यम से क्रॉस-मोडल संरेखण और मोडैलिटी-विशिष्ट विशिष्टता को संतुलित करने के लिए "टुगेदर देन अपार्ट" (Together Then Apart) रणनीति का उपयोग करता है, जिससे TCGA कोहॉर्ट्स पर कैंसर प्रोग्नोसिस भविष्यवाणी और व्याख्यात्मकता में सुधार होता है।

Wenjing Liu, Qin Ren, Wen Zhang, Yuewei Lin, Chenyu You2026-07-15
💻 computer science

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS एक दो-चरणीय (two-stage) इनवर्स रेंडरिंग फ्रेमवर्क है जो ज्यामिति और सामग्री के अनुमान को स्थिर करने के लिए फाउंडेशन मॉडल प्रायर्स (priors) का लाभ उठाता है, जिससे स्पार्स-व्यू (sparse-view) सेटिंग्स में प्रदर्शन में महत्वपूर्ण सुधार होता है जहाँ पारंपरिक गॉसियन-आधारित विधियाँ अस्पष्टता के कारण संघर्ष करती हैं।

Patrick Noras, Jun Myeong Choi, Didier Stricker, Pieter Peers, Roni Sengupta2026-07-15
💻 computer science

M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention

यह शोध पत्र M2I2HA का प्रस्ताव करता है, जो एक नवीन मल्टी-मोडल ऑब्जेक्ट डिटेक्शन नेटवर्क है जो उच्च-क्रम निर्भरताओं (high-order dependencies) को कैप्चर करने और सटीक क्रॉस-मोडल संरेखण प्राप्त करने में CNNs, Transformers और SSMs की सीमाओं को दूर करने के लिए इंट्रा- और इंटर-मोडल हाइपरग्राफ अटेंशन मैकेनिज्म का लाभ उठाता है, जिससे सार्वजनिक डेटासेट्स पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

Xiaofan Yang, Yubin Liu, Wei Pan, Guoqing Chu, Junming Zhang, Jie Zhao, Zhuoqi Man, Xuanming Cao2026-07-15
🤖 machine learning

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

यह शोध पत्र एक ऐसी प्रशिक्षण पद्धति प्रस्तावित करता है जो उपसमूह-आधारित एट्रिब्यूशन बाधाओं (subset-based attribution constraints) के माध्यम से ऑफ-प्रायर साक्ष्य पर निर्भरता को दंडित करके मॉडलों को मानवीय पूर्वाग्रहों (human priors) के साथ संरेखित करती है, जिससे इमेज क्लासिफिकेशन और GUI एजेंट कार्यों में कार्य सटीकता और निर्णय तर्कसंगतता दोनों में सुधार होता है।

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang (…)2026-07-15