💻 computer science

CVKD-UDA: Cross-View Knowledge Distillation for 3D Unsupervised Domain Adaptive Segmentation

यह शोध पत्र CVKD-UDA का प्रस्ताव करता है, जो 3D अनसुपरवाइज्ड डोमेन एडेप्टिव सेगमेंटेशन के लिए एक नवीन फ्रेमवर्क है, जो सोर्स सुपरविजन पर निर्भर हुए बिना सेल्फ-ट्रेनिंग के लिए विश्वसनीय वॉर्म-अप मॉडल उत्पन्न करने हेतु विभिन्न वोक्सेल आकारों के साथ क्रॉस-व्यू नॉलेज डिस्टिलेशन और एक डिकपल्ड अडैप्टर का लाभ उठाकर डोमेन-समान रिप्रजेंटेशन का निर्माण करता है।

Zhimin Yuan, Ming Cheng, Shangshu Yu, Wen Li, Dunqiang Liu, Xin Huang, Cheng Wang2026-07-14
💻 computer science

EMBRACE: A Multi-task Framework for Comprehensive Quality Assessment in Cleavage-stage Embryo

यह शोध पत्र EMBRACE को प्रस्तुत करता है, जो एक मल्टी-टास्क डीप लर्निंग फ्रेमवर्क है जो एक साझा ResNet-50 बैकबोन और विशिष्ट मॉड्यूल का लाभ उठाकर क्लीवेज-स्टेज भ्रूण छवियों पर साइटोप्लाज्मिक फ्रैगमेंटेशन सेगमेंटेशन, विकासात्मक चरण वर्गीकरण और ब्लास्टोमेर सिमिट्री ग्रेडिंग को एक साथ निष्पादित करता है, जो उच्च सटीकता प्राप्त करता है और IVF के लिए एकीकृत स्वचालित गुणवत्ता मूल्यांकन की व्यवहार्यता को प्रदर्शित करता है।

Anwar Hussain Sofi, Jung-Hua Wang, Ming-Jer Chen, Tsung-Hsien Lee, Yu-Chiao Yi, Ming-Kuan Lin, Yi-Chung Lai2026-07-14
💻 computer science

DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence

DynaFilter एक क्लाउड-संचालित डायनेमिक फ़िल्टरिंग तकनीक है जो सैटेलाइट एज डिवाइसेस को लो-लेवल कंप्रेशन सिंटैक्स सहसंबंधों (correlations) का उच्च-स्तरीय सिमेंटिक क्वेरीज़ के साथ लाभ उठाकर सीधे कंप्रेस्ड डोमेन में चयनात्मक रीजन-ऑफ-इंटरेस्ट इन्फरेंस करने में सक्षम बनाती है, जिससे बैंडविड्थ उपयोग, ऊर्जा खपत और इन्फरेंस लेटेंसी में उल्लेखनीय कमी आती है।

Ziyang Zhang, Jie Liu, Luca Mottola2026-07-14
💻 computer science

TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues

यह शोधपत्र TextGaze का प्रस्ताव करता है, जो एक एकीकृत क्रॉस-मोडल आर्किटेक्चर है जो स्केलेबल टेक्स्टुअल सीन क्यूज़ (textual scene cues) प्रदान करने के लिए एक लार्ज विजन-लैंग्वेज मॉडल का लाभ उठाता है, जिससे विविध डेटासेट्स में विजुअल सेलियंसी (visual saliency) और वास्तविक गेज़ इंटेंट (gaze intent) के बीच संतुलन बनाते हुए एक सुदृढ़ और एनोटेशन-कुशल गेज़ टारगेट एस्टीमेशन सक्षम होता है।

Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang2026-07-14
🤖 AI

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation

EmoStyle, अफेक्टिवआर्ट (AffectiveArt) चैलेंज 2026 के लिए प्रथम स्थान प्राप्त करने वाला एक फ्रेमवर्क है जो एक LLM का उपयोग करके अफेक्टिव संकेतों (affective cues) का अनुमान लगाने और एक Z-इमेज-आधारित जनरेटर को नियंत्रित करने के लिए स्टाइल-विशिष्ट LoRA विशेषज्ञों का उपयोग करके भावनात्मक छवि निर्माण में नियंत्रण अंतराल को पाटता है, जिससे यह सुनिश्चित होता है कि आउटपुट प्रॉम्प्ट, कलात्मक शैलियों और लक्षित भावनाओं के अनुरूप हो।

Dexiang Hong, Yijie Guo, Weidong Chen, Xinyan Liu, Zixuan Zou, Zhendong Mao, Yongdong Zhang2026-07-14
💻 computer science

ScratNet: A Swin-Based Multi-Scale Dilated Network with Precision Refinement for Semiconductor Scratch Segmentation

यह शोध पत्र ScratNet का प्रस्ताव करता है, जो एक नवीन एंड-टू-एंड फ्रेमवर्क है जो अनियमित, कम कंट्रास्ट वाले सेमीकंडक्टर स्क्रैच दोषों को सेगमेंट करने में बेहतर सटीकता प्राप्त करने के लिए मल्टी-स्केल एग्रीगेशन और प्रिसिजन रिफाइनमेंट मॉड्यूल वाले एक विशेष डिकोडर के साथ एक संशोधित स्विन ट्रांसफॉर्मर बैकबोन को जोड़ता है।

Sachin Ranjan, Hoon Kim2026-07-14
💻 computer science

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

यह शोध पत्र InterPet4D प्रस्तुत करता है, जो व्यापक एनोटेशन के साथ सिंक्रोनाइज़्ड मानव-कुत्ता अंतःक्रियाओं को कैप्चर करने वाला पहला बड़े पैमाने का मल्टीमॉडल डेटासेट है, और InterPetMoGen फ्रेमवर्क का प्रस्ताव करता है जो यथार्थवादी मानव-पालतू गति उत्पन्न करने में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu2026-07-14
💬 NLP

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

यह शोध पत्र ChartSync प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और मूल्यांकन ढांचा है जिसे सांख्यिकीय चार्ट पर विज़ुअल-लॉजिकल कैस्केडिंग एडिटिंग (visuo-logical cascading editing) करने में वर्तमान जनरेटिव मॉडलों की सीमाओं का आकलन करने और उन्हें संबोधित करने के लिए डिज़ाइन किया गया है, जो विशेष रूप से ओपन-सोर्स और फ्रंटियर प्रोप्रायटरी मॉडलों के बीच ज्यामितीय सिंक्रोनाइज़ेशन (geometric synchronization) क्षमताओं में महत्वपूर्ण अंतर को उजागर करता है।

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu2026-07-14
💻 computer science

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

यह शोध पत्र VVM-Tuning का प्रस्ताव करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो RGB डेटा से विविध दृश्य मोडालिटीज़ (visual modalities) को संश्लेषित करता है ताकि लार्ज मल्टीमॉडल मॉडल्स को इनवेरिएंट सीन सिमेंटिक्स (invariant scene semantics) को मोडालिटी-विशिष्ट अपीयरेंस (modality-specific appearances) से अलग करना सिखाया जा सके, जिससे बिना इन-मोडालिटी प्रशिक्षण के अनदेखी विजुअल मोडालिटीज़ के लिए ज़ीरो-शॉट जनरलाइजेशन (zero-shot generalization) सक्षम हो सके।

Shihao Yuan, Yuanze Li, Ruyi Zhang, Ming Liu, Wangmeng Zuo2026-07-14
🤖 AI

GRC-ProbNet: Uncertainty-aware Feature Extraction for Cardiovascular Disease Classification

यह शोध पत्र GRC-ProbNet को प्रस्तुत करता है, जो एक अनिश्चितता-जागरूक (uncertainty-aware) फ्रेमवर्क है जो कई सेगमेंटेशन मास्क उत्पन्न करने और अनिश्चितता विशेषताओं को निकालने के लिए डीप एनसेम्बल्स का लाभ उठाता है, जिससे नियत बेसलाइन (deterministic baseline) GRC-Net की तुलना में हृदय रोग वर्गीकरण प्रदर्शन में महत्वपूर्ण सुधार होता है।

Yash Shah, Omar Todd, Philipp Seeböck, Georg Langs, Ben Glocker, Raghav Mehta2026-07-14