💻 computer science

Surgical Anatomy Recognition with Context Learning using Foundation Representations

यह शोधपत्र न्यूनतम आक्रामक सर्जरी (मिनिमली इनवेसिव सर्जरी) के लिए एक बड़े पैमाने के एनोटेटेड डेटासेट, ATLAS-120k, और ATLAS, एक वीडियो सेगमेंटेशन मॉडल को प्रस्तुत करता है जो सटीक और सामयिक रूप से सुसंगत शारीरिक पहचान प्राप्त करने के लिए फाउंडेशन रिप्रेजेंटेशन्स और कॉन्टेक्स्ट लर्निंग का लाभ उठाता है।

Ronald L. P. D. de Jong, Tim J. M. Jaspers, Raf A. H. Vervoort, Aron F. H. A. Bakker, Yiping Li, Jip L. Tolenaar, Jelle (…)2026-06-23
💻 computer science

Feed-forward Motion In-betweening for Any 4D

यह शोध पत्र एक नवीन फीड-फॉरवर्ड इन-बिटवीनिंग फ्रेमवर्क प्रस्तावित करता है जो लंबी अवधि के 4D मेश अनुक्रमों को किसी भी आकार में कुशलतापूर्वक उत्पन्न करने और उन्नत स्थानिक-कालिक नियंत्रण क्षमता प्रदान करने के लिए एक फ्रेम-वार मेश VAE और एक कीफ्रेम-कंडीशनड रेक्टिफाइड फ्लो मॉडल का लाभ उठाता है, जिससे मौजूदा विधियों में धीमी अनुमान प्रक्रिया और त्रुटि संचय की सीमाओं को दूर किया जा सके।

Hiroki Nishizawa, Hubert P. H. Shum, Yoshihiro Fukuhara, Hirokatsu Kataoka, Shigeo Morishima2026-06-23
💻 computer science

Failure Analysis in Transition: An Industry Survey of Challenges, Priorities, and Standardization Needs in Advanced Packaging and Heterogeneous Integration

यह शोध पत्र लगभग एक सौ प्रतिक्रियाओं के एक उद्योग सर्वेक्षण को प्रस्तुत करता है जो यह प्रकट करता है कि विषम एकीकरण (हेटरोजीनियस इंटीग्रेशन) और हाइब्रिड बॉन्डिंग के उदय से विफलता विश्लेषण (फेलियर एनालिसिस) गंभीर रूप से चुनौतीपूर्ण हो गया है, जिसमें विशेषज्ञ इन विकसित होती जटिलताओं को संबोधित करने के लिए उच्च-रिज़ॉल्यूशन वाले गैर-विनाशकारी इमेजिंग और औपचारिक डेटा मानकीकरण को प्राथमिकता दे रहे हैं।

Himanandhan Reddy Kottur, Nusra Akter Takia, Mahamudul Hassan Fuad, Istiaq Firoz Shiam, Matthew Walsh, Navid Asadizanjan (…)2026-06-23
💻 computer science

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

यह शोध पत्र एक धारणा-सत्यापित स्व-प्रशिक्षण ढांचे (perception-verified self-training framework) का प्रस्ताव करता है जो अनसुपरवाइज्ड कैप्शन मूल्यांकन और एक दो-चरणीय पाठ्यक्रम शिक्षण रणनीति के माध्यम से धारणा को तर्क से अलग करके विजन-लैंग्वेज मॉडल्स में दृश्य मतिभ्रम (visual hallucinations) और भाषाई शॉर्टकट को कम करता है।

Sourabh Sharma, Sonam Gupta, Sadbhawna Thakur2026-06-23
💻 computer science

From Convolution to Transformer: A Comparative Study of U-Net Variants for Brain Tumor and Retinal Vessel Segmentation

यह शोध पत्र ब्रेन ट्यूमर और रेटिनल वेसल सेगमेंटेशन कार्यों पर पांच U-Net वेरिएंट्स का एक तुलनात्मक अध्ययन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि ट्रांसफॉर्मर-आधारित Swin UNETR वैश्विक संदर्भ संबंधी जानकारी को प्रभावी ढंग से कैप्चर करके बेहतर समग्र प्रदर्शन प्राप्त करता है, जबकि अवशिष्ट शिक्षण (residual learning) सूक्ष्म संरचनात्मक विवरणों के लिए लाभकारी बना रहता है।

Khoa Pham, Sindhuja Penchala, Jiacheng Li, Andy Perkins, Noorbakhsh Amiri Golilarz2026-06-23
💻 computer science

Dual-Stream EEG Decoding for 3D Visual Perception

यह शोध पत्र एक जैव-प्रेरित (bio-inspired) ड्यूल-स्ट्रीम ईईजी (EEG) डिकोडिंग मॉडल प्रस्तुत करता है जो वेंट्रल और डोर्सल मार्गों के माध्यम से वस्तु की पहचान और स्थानिक अभिविन्यास को अलग-अलग डिकोड करके, सर्कुलर रिग्रेशन और ईईजी-कंडीशन्ड डिफ्यूजन का उपयोग करते हुए, सटीक 3D पुनर्निर्माण द्वारा 3D दृश्य धारणाओं को सफलतापूर्वक पुनर्निर्मित करता है।

Ninon Lizé Masclef, Taisija Demcenko, Antonella Catanzaro, Nataliya Kosmyna2026-06-23
⚡ electrical engineering

Resolving Multi-Target Association in OFDM-based ISAC via Vision-aided Multi-Modal Learning

यह शोध पत्र एक विजन-असिस्टेड OFDM-ISAC ढांचे का प्रस्ताव करता है जो विजुअल और वायरलेस डेटा को फ्यूज करने के लिए डीप जॉइंट सोर्स-चैनल कोडिंग और मल्टी-मोडल लर्निंग का लाभ उठाता है, जिससे मल्टी-टारगेट एसोसिएशन की अस्पष्टताओं को हल किया जा सके और एकीकृत सेंसिंग एवं संचार प्रणालियों में रिज़ॉल्यूशन सीमाओं को पार किया जा सके।

Meng Hua, Chenghong Bian, Deniz Gunduz2026-06-23
💻 computer science

Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation

Multi4D एक उच्च-निष्ठा (high-fidelity) वाला डायनेमिक गॉसियन स्प्लेटिंग फ्रेमवर्क पेश करता है जो एक मल्टी-लेवल कॉम्पिटिटिव एलोकेशन रणनीति का उपयोग करके स्थिर (static), निरंतर (persistent) और क्षणिक (transient) प्रिमिटिव्स के बीच मॉडलिंग क्षमता को गतिशील रूप से वितरित करता है, जिससे गति निरंतरता (motion consistency) और दृश्य निष्ठा (visual fidelity) के बीच के समझौते को हल किया जा सके, और इस प्रकार अत्याधुनिक रेंडरिंग गुणवत्ता, रियल-टाइम प्रदर्शन और कुशल 4D सेगमेंटेशन प्राप्त किया जा सके।

Rui Wang, Quentin Lohmeyer, Siyu Tang, Mirko Meboldt2026-06-23
💻 computer science

MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learninga

यह शोध पत्र MultiMem को प्रस्तुत करता है, जो मल्टी-मोडल कंट्रास्टिव लर्निंग में मेमोराइजेशन (memorization) को मापने के लिए पहला मीट्रिक है, जो यह प्रकट करता है कि क्रॉस-मोडल सिमेंटिक मिसअलाइनमेंट और टेक्स्ट मेमोराइजेशन के प्राथमिक चालक हैं, और यह प्रदर्शित करता है कि लक्षित ऑग्मेंटेशन (augmentations) इस समस्या को प्रभावी ढंग से कम करके मॉडल के सामान्यीकरण (generalization) में सुधार कर सकते हैं।

Wenhao Wang, Franziska Boenisch, Michael Backes, Adam Dziedzic2026-06-23
💻 computer science

Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT-Quantization Embedding

यह शोध पत्र DiffuseNet का प्रस्ताव करता है, जो एक कुशल RGB-DCT अर्ली-फ्यूजन आर्किटेक्चर है जिसमें मल्टी-लेवल विसंगति (discrepancy) फीचर्स और एक यूनिफाइड DCT-क्वांटाइजेशन एम्बेडिंग शामिल है, जो पिछले तरीकों की तुलना में काफी अधिक थ्रूपुट के साथ विभिन्न डोमेन में दस्तावेज़ छेड़छाड़ को स्थानीयकृत करने में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Mohamed Dhouib, Ye Zhu, Sonia Vanier, Aymen Shabou2026-06-23