💻 computer science

T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models

यह शोधपत्र T-VSS का प्रस्ताव करता है, जो एक हल्का टेस्ट-टाइम एडेप्टेशन (test-time adaptation) तरीका है जो विजन-लैंग्वेज मॉडल्स की एडवर्सरियल रोबस्टनेस (adversarial robustness) को बढ़ाता है, जो दूषित विजुअल फीचर्स को सीधे एक सैंपल-विशिष्ट लो-रैंक सबस्पेस (low-rank subspace) के भीतर स्थिर भविष्यवाणियों की ओर निर्देशित करके, पिछले दृष्टिकोणों की तुलना में बेहतर दक्षता और प्रदर्शन प्राप्त करता है।

Jaehyuk Jang, Minseok Seo. Seungju Cho, Kangwook Ko, Changick Kim2026-06-23
🤖 AI

Interpretable Probabilistic Medical Image Segmentation via Gaussian Process with Explicit Modelling of Annotation Bias and Variability

यह शोध पत्र स्टोकैस्टिक वेरिएशनल गॉसियन प्रोसेस का उपयोग करके एक व्याख्यात्मक लॉजिट-स्पेस संभाव्यता विभाजन ढांचे (इंटरप्रिटेबल लॉजिट-स्पेस प्रोबेबिलिस्टिक सेगमेंटेशन फ्रेमवर्क) का प्रस्ताव करता है, जो एनोटेटर-विशिष्ट पूर्वाग्रह और भिन्नता को स्पष्ट रूप से मॉडल करता है, जिससे अनिश्चितता अंशांकन (अनसर्टेन्टी कैलिब्रेशन) में सुधार होता है और इस बात का सीधा विश्लेषण सक्षम होता है कि रेटर परिवर्तनशीलता मेडिकल इमेजिंग में भविष्य कहनेवाला वितरणों को कैसे प्रभावित करती है।

Qi Li, Yuliang Huang, Shaheer U. Saeed, Qianye Yang, Vasilis Stavrinides, Zachary M. C. Baum, Dean C. Barratt, J. Alison (…)2026-06-23
⚡ electrical engineering

NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling

यह शोध पत्र नेवरबोर-गाइडेड पैच सैंपलिंग (NGPS) का प्रस्ताव दिया है, जो वॉल्यूमेट्रिक मेडिकल इमेजिंग डिनोइजिंग के लिए एक हल्का स्व-पर्यवेक्षित ढांचा है जो शोर-कम किए गए गाइड पर संरचना मिलान को कच्चे पड़ोसी स्लाइसों पर सिग्नल पुनर्प्राप्ति से अलग करके इंटर-स्लाइस मिसअलाइनमेंट की समस्या को दूर करता है, जिससे बिना स्पष्ट पंजीकरण या मास्किंग के प्रभावी छद्म-लक्ष्य (pseudo-targets) का निर्माण होता है।

Jaehyun Cho, YoungJoon Yoo2026-06-23
💻 computer science

Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets

यह अध्ययन प्रकट करता है कि व्यापक रूप से उपयोग किए जाने वाले LAION-5B डेटासेट में महत्वपूर्ण और सुसंगत जनसांख्यिकीय पूर्वाग्रह मौजूद हैं, जिसमें युवा श्वेत पुरुषों का अत्यधिक प्रतिनिधित्व और अल्पसंख्यक समूहों एवं वृद्ध महिलाओं का कम प्रतिनिधित्व शामिल है, साथ ही लिंग और भावनात्मक अभिव्यक्तियों के बीच रूढ़िवादी जुड़ाव भी हैं जो डाउनस्ट्रीम एआई प्रणालियों को नकारात्मक रूप से प्रभावित कर सकते हैं।

Iris Dominguez-Catena, Daniel Paternain, Mikel Galar2026-06-23
💬 NLP

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

यह शोध पत्र काउंटरफैक्चुअल पॉलिसी ऑप्टिमाइज़ेशन (CFPO) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो एक क्रॉस-मोडल काउंटरफैक्चुअल तंत्र के माध्यम से कॉज़ल कंसिस्टेंसी (कारण संबंधी निरंतरता) को लागू करके लार्ज विजन-लैंग्वेज मॉडल्स की मल्टीमॉडल रीजनिंग को बढ़ाता है, जिससे बिना किसी बाहरी रिवॉर्ड मॉडल की आवश्यकता के मतिभ्रम (hallucinations) और ग्राउंडिंग विफलताओं को काफी हद तक कम किया जा सकता है।

Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao2026-06-23
💻 computer science

PhysFlow: Frequency Decoupled with Dual-Field Rectified Flow for Remote Photoplethysmography

PhysFlow एक नवीन फ्रीक्वेंसी-डिकपल्ड डुअल-फील्ड रेक्टिफाइड फ्लो फ्रेमवर्क है जो फिजियोलॉजिकल सिग्नल्स के ट्रेंड और एम्प्लीट्यूड घटकों को अलग से मॉडल करके रिमोट फोटोप्लेथिस्मोग्राफी की मजबूती में सुधार करता है ताकि बदलती रोशनी और सिर की हलचल जैसे जटिल व्यवधानों के हस्तक्षेप को कम किया जा सके।

Zixu Li, jianjun Qian, Hang Shao, Lei Luo, Jian Yang2026-06-23
💻 computer science

Privacy-Preserving Person Re-Identification from Temporal Sequences with Transformer and Hungarian Optimization

यह शोध पत्र एक गोपनीयता-संरक्षित व्यक्ति पुन: पहचान (पर्सन री-आइडेंटिफिकेशन) ढांचे का प्रस्ताव करता है जो व्यक्तिगत पहचान की रक्षा करते हुए टॉप-व्यू डेटासेट पर प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए डेप्थ इमेजेस और टेम्पोरल सीक्वेंस के साथ एक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है, जिसे हंगेरियन एल्गोरिदम और बैच हार्ड ट्रिपलेट लॉस के माध्यम से अनुकूलित किया गया है।

Raphaël Delécluse, Hazem Wannous, Laurent Guimas2026-06-23
🤖 AI

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

SteerVTE एक एकीकृत ढांचा है जो विशेष एन्कोडर्स, एक नवीन लॉस फंक्शन, प्रोग्रेसिव ट्रेनिंग और एक बड़े पैमाने के सिंथेटिक डेटासेट के माध्यम से एक फ्रोजन वीडियो डिफ्यूजन मॉडल को नियंत्रित करके स्टाइल और ग्लिफ कंट्रोल के साथ सटीक वीडियो टेक्स्ट एडिटिंग को सक्षम बनाता है।

Kai Zeng, Moran Li, Zhengwei Wang, Yingchen Yu, Yiheng Lin, Ruichuan An, Ming Lu, Qi She, Wentao Zhang2026-06-23
🤖 machine learning

Transfer learning-based method for automated ewaste recycling in smart cities

यह शोध पत्र 12 वर्गों से स्मार्टफोन को वर्गीकृत करने में 98% सटीकता प्राप्त करने के लिए एक फाइन-ट्यून्ड एलेक्सनेट (AlexNet) मॉडल का उपयोग करते हुए एक ट्रांसफर लर्निंग-आधारित दृष्टिकोण प्रस्तावित करता है, जो स्मार्ट शहरों में स्वचालित ई-कचरा पुनर्चक्रण के लिए एक प्रभावी एआई-संचालित समाधान प्रदर्शित करता है।

Nermeen Abou Baker, Paul Szabo-Müller, Uwe Handmann2026-06-23
🤖 AI

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent एक ऑल-इन-वन मल्टी-एजेंट फ्रेमवर्क है जो शॉट प्लानिंग, क्रॉस-मोडल रिट्रीवल और एक मल्टी-एजेंट ऑर्केस्ट्रेशन सिस्टम को एकीकृत करके मौजूदा स्वचालित वीडियो प्रणालियों की सीमाओं को दूर करता है ताकि उच्च सफलता दर और कम लागत के साथ पेशेवर-गुणवत्ता वाली, सुसंगत लंबी-वीडियो समझ और संपादन प्राप्त किया जा सके।

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang2026-06-23