🤖 AI

Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning

यह शोध पत्र क्रॉस-मोडल आइडेंटिटी मैपिंग (CIM) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक छवि और उसके टेक्स्ट-रिट्रीव्ड विजुअल समकक्षों के बीच निरंतरता के लिए अनुकूलित करके इमेज कैप्शनिंग में सूचना हानि को कम करता है, जिससे बिना किसी अतिरिक्त एनोटेशन की आवश्यकता के उत्कृष्ट प्रदर्शन प्राप्त होता है।

Haonan Jia, Shichao Dong, Xin Dong, Zenghui Sun, Jin Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang2026-06-16
💻 computer science

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

यह शोध पत्र DPC-VQA का प्रस्ताव करता है, जो एक लागत प्रभावी ढांचा है जो एक फ्रोजन मल्टीमॉडल लार्ज लैंग्वेज मॉडल और एक लाइटवेट ब्रांच का उपयोग करके परसेप्चुअल प्रायर एक्सट्रैक्शन को रेसिडुअल कैलिब्रेशन से अलग करता है, जिससे न्यूनतम ट्रेन करने योग्य पैरामीटर्स और एनोटेशन डेटा के साथ कुशल वीडियो क्वालिटी असेसमेंट सक्षम होता है।

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai2026-06-16
💬 NLP

MolSight: Molecular Property Prediction with Images

MolSight एक व्यवस्थित बड़े पैमाने का अध्ययन है जो यह प्रदर्शित करता है कि एक विजन एनकोडर द्वारा संसाधित एक एकल 2D कंकाल छवि (skeletal image), विशेष रूप से जब इसे रसायन-सूचित पाठ्यक्रम (chemistry-informed curriculum) के साथ प्रशिक्षित किया जाता है, ग्राफ-आधारित या भाषा मॉडल दृष्टिकोणों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ विविध कार्यों में प्रतिस्पर्धी आणविक गुण भविष्यवाणी प्राप्त करती है।

Aaditya Baranwal, Akshaj Gupta, Yogesh S Rawat, Shruti Vyas2026-06-16
💻 computer science

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM एक प्रतिनिधित्व-केंद्रित (representation-centric) विश्व क्रिया मॉडल पेश करता है जो संरेखित अर्थपूर्ण लेटेंट स्पेस (aligned semantic latent spaces) सीखने के लिए एक नवीन विजुअल-एक्शन टोकेनाइज़र का उपयोग करता है, जो पारंपरिक पुनर्निर्माण-उन्मुख (reconstruction-oriented) दृष्टिकोणों की तुलना में बेहतर निर्देश-अनुपालन और क्लोज्ड-लूप रोबोट हेरफेर प्रदर्शन को सक्षम बनाता है।

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu2026-06-16
🤖 AI

RAMS: Resource-Adaptive and Detection-Conditioned Model Switching for Embedded Edge Perception

RAMS एक हल्का, संसाधन-अनुकूलित रनटाइम कंट्रोलर है जो बिना मॉडल-रीलोड ओवरहेड के, डिवाइस प्रेशर और हालिया असुरक्षित-सड़क-उपयोगकर्ता (vulnerable-road-user) डिटेक्शन के आधार पर एम्बेडेड एज हार्डवेयर पर इन्फरेंस लेटेंसी और डिटेक्शन क्वालिटी को अनुकूलित करने के लिए YOLOv8 मॉडल टियर्स के बीच गतिशील रूप से स्विच करता है।

Kushal Khemani, Evan Leri, George Xu, Amit Hod2026-06-16
💻 computer science

AI for Maritime Security: Comparative Evaluation of CNN and Vision Transformer Architectures for Maritime Object Detection

यह अध्ययन विभिन्न मौसम स्थितियों में समुद्री वस्तु पहचान के लिए छह डीप लर्निंग आर्किटेक्चर का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि जहाँ हल्के मॉडल संसाधन-बाधित उपकरणों के अनुकूल होते हैं, वहीं विजन ट्रांसफॉर्मर (ViT) 100% सटीकता और सबसे तेज़ प्रसंस्करण गति के साथ बेहतर प्रदर्शन प्राप्त करता है।

Ismet Gocer, Zakirul Bhuiayn, Shakeel Ahmad, Raza Hasan2026-06-16
💻 computer science

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis

FairGen एक निष्पक्षता-जागरूक (fairness-aware) डिफ्यूजन फ्रेमवर्क है जो चिकित्सक-संरेखित प्राथमिकताओं को समाहित करके जनसांख्यिकीय रूप से संतुलित चिकित्सा छवियों को संश्लेषित करता है, जो उच्च नैदानिक सटीकता बनाए रखते हुए डर्मेटोलॉजी, रेडियोलॉजी और न्यूरोइमेजिंग कार्यों में सबग्रुप कवरेज में उल्लेखनीय सुधार करता है और नैदानिक पूर्वाग्रह को कम करता है।

Zhimin Li, Ruichen Zhang, Zhen Tan, Howard J Aizenstein, Jingtong Hu, Tianlong Chen2026-06-16
💻 computer science

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

यह शोध पत्र FUSE को प्रस्तुत करता है, जो एक बेयसियन ढांचा (Bayesian framework) है जो आउटपुट की शुद्धता को विश्वसनीय रूप से अनुमानित करने और विजन-लैंग्वेज मॉडल्स में अत्याधुनिक अंशांकन (state-of-the-art calibration) प्राप्त करने के लिए एलीटोरिक एम्बेडिंग-स्तरीय (aleatoric embedding-level) और एपिस्टेमिक मॉडल-स्तरीय (epistemic model-level) अनिश्चितताओं को विश्लेषणात्मक रूप से संलयित (fuse) करके एक स्केलर माप उत्पन्न करता है।

Harry Zhang, Luca Carlone2026-06-16
💻 computer science

Hierarchical GRU with Input-Conditioned Slot Queries for Ball Action Anticipation

यह शोध पत्र SoccerNet बेंचमार्क पर अत्याधुनिक बॉल एक्शन एंटिसिपेशन प्राप्त करने के लिए इनपुट-कंडीशन्ड स्लॉट क्वेरीज़ और फ्रीक्वेंसी-रीवेटेड हंगेरियन मैचिंग से उन्नत एक पदानुक्रमित (hierarchical) GRU मॉडल प्रस्तावित करता है, जो 30 सेकंड की अवलोकन विंडो से भविष्य की क्रियाओं को प्रभावी ढंग से भविष्यवाणी करके 17.91% mAP प्राप्त करता है।

Parthsarthi Rawat2026-06-16
💻 computer science

BBR-Net: Boundary-Balanced Replay for Continual Medical Image Segmentation

यह शोध पत्र BBR-Net का प्रस्ताव करता है, जो मेडिकल इमेज सेगमेंटेशन के लिए एक निरंतर सीखने (continual learning) वाला फ्रेमवर्क है जो शारीरिक संरचनाओं को संरक्षित करने के लिए बाउंड्री-अवेयर और क्लास-बैलेंस्ड रिप्ले का उपयोग करता है, और यह प्रदर्शित करता है कि डोमेन शिफ्ट के तहत ज्ञान प्रतिधारण (knowledge retention) की प्रभावशीलता केवल मेमोरी क्षमता पर नहीं, बल्कि संग्रहीत रिप्ले नमूनों की संरचनात्मक विश्वसनीयता पर महत्वपूर्ण रूप से निर्भर करती है।

Zahid Ullah, Sieun Choi, Jihie Kim2026-06-16