🤖 AI

EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis

EchoStyle एक स्केलेबल टेक्स्ट-ड्रिवन फ्रेमवर्क है जो एक वीडियो-टू-वीडियो आर्किटेक्चर, बड़े पैमाने पर V-Style20k डेटासेट बनाने के लिए एक रिवर्स-सिंथेसिस पाइपलाइन और टेम्पोरल कंसिस्टेंसी (सामयिक निरंतरता) के लिए विशेष तंत्र पेश करके उच्च-फिडेलिटी, लंबी-वीडियो स्टाइलइज़ेशन प्राप्त करता है।

Huaqiu Li, Jiahao Wang, Sijia Cai, Hualian Sheng, Bing Deng, Jieping Ye, Wenhan Luo2026-06-25
💻 computer science

TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition

यह शोध पत्र TACO को प्रस्तुत करता है, जो एक ओपन-वोकेबुलरी वीडियो रिकग्निशन फ्रेमवर्क है, जो आउट-ऑफ-डिस्ट्रीब्यूशन अलाइनमेंट को संरक्षित करने के लिए रिलेटिव स्ट्रक्चर डिस्टिलेशन का उपयोग करके और टास्क-स्पेसिफिक अडैप्टेशन को टेस्ट-टाइम रिप्रेजेंटेशन स्पेस से डीकपल करने के लिए एक स्पेशलाइजेशन प्रोजेक्शन का उपयोग करके ऑब्जेक्टिव इनकंसिस्टेंसी के कारण होने वाले रिप्रेजेंटेशन डेविएशन को कम करता है, जिससे विविध बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

Minghao Zhu, Xiao Lin, Mengxian Hu, Xun Zhou, Liuyi Wang, Xiaoyan Qi, Chengju Liu, Qijun Chen2026-06-25
💻 computer science

Cross-View Variance Correlation in Path-Traced Stereo:A Hidden Shortcut in Synthetic Training Data

यह शोध पत्र यह प्रकट करता है कि पाथ-ट्रेस्ड सिंथेटिक स्टीरियो डेटा में डिस्पैरिटी अलाइनमेंट के बाद बाएं और दाएं दृश्यों के वेरिएंस फील्ड्स के बीच एक पूर्व में अज्ञात, उच्च सहसंबंध (हाई कोरिलेशन) होता है, जो मोंटे कार्लो रेंडरिंग की एक अनूठी छिपी हुई मैचिंग क्यू (हिडन मैचिंग क्यू) के रूप में कार्य करता है जो डिस्पैरिटी-एस्टिमेशन नेटवर्क को प्रशिक्षित करने में एक महत्वपूर्ण सिम-टू-रियल शॉर्टकट हो सकता है।

Po-Ting Lin2026-06-25
💻 computer science

C2RM-Seg: Causal Counterfactual Reasoning with Structural-Semantic Priors for Weakly Supervised Histopathological Tissue Segmentation

यह शोध पत्र C2RM-Seg का प्रस्ताव करता है, जो एक दो-चरणीय कमजोर रूप से पर्यवेक्षित (weakly supervised) ढांचा है जो अत्याधुनिक हिस्टोपैथोलॉजिकल ऊतक विभाजन (histopathological tissue segmentation) प्राप्त करने के लिए आकृति-संरेखित छद्म-लेबल (morphology-aligned pseudo-labels) उत्पन्न करने हेतु कारण प्रतितथ्यात्मक तर्क (causal counterfactual reasoning) को एक संरचना-जागरूक अर्थ संबंधी वास्तुकला (structure-aware semantic architecture) और अनिश्चितता-गेटेड लॉस (uncertainty-gated loss) के साथ जोड़ता है।

Hualong Zhang, Siyang Feng, Zihan Huan, Yi Qian, Zhenbing Liu, Rushi Lan, Xipeng Pan2026-06-25
💻 computer science

ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

यह शोध पत्र ASSCG प्रस्तुत करता है, जो एक अनुकूलन योग्य गेटिंग तंत्र (adaptive gating mechanism) है जो एक हल्के RWKV बैकबोन के माध्यम से, जिसे सुदृढीकरण शिक्षण (reinforcement learning) के साथ प्रशिक्षित किया गया है, फ्रेम-स्तरीय क्वेरी, पुन: उपयोग या ड्रॉप निर्णय लेकर स्वायत्त ड्राइविंग में खर्चीले LLM स्लो-प्लानर्स के आह्वान को अनुकूलित करता है, जिससे कई बेंचमार्क में अनुमान विलंबता (inference latency) को कम करते हुए नियोजन प्रदर्शन में महत्वपूर्ण सुधार होता है।

Sining Ang, Yuan Chen, Liu Haiyan, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang2026-06-25
💻 computer science

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

यह शोधपत्र 3D CT इमेजिंग के लिए एक रोग-केंद्रित विजन-लैंग्वेज प्रीट्रेनिंग फ्रेमवर्क प्रस्तावित करता है जो ज़ीरो-शॉट डायग्नोसिस और रिपोर्ट जनरेशन में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक CNN-ViT हाइब्रिड एनकोडर, क्वेरी टोकन्स के साथ डिजीज-लेवल कॉन्ट्रास्टिव लर्निंग, और डायग्नोसिस-अवेयर प्रॉम्प्ट्स को एकीकृत करता है।

Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang2026-06-25
💻 computer science

Energy-Efficient CNN Acceleration with MSDF Digit-Serial Arithmetic on FPGA

यह शोध पत्र U-Net कनवल्शनल परतों में विलंबता बाधाओं (latency bottlenecks) को दूर करने के लिए FPGA पर MSDF डिजिट-सीरियल अंकगणित का उपयोग करते हुए एक मर्ज्ड मल्टीप्लाई-ऐड (MMA) आर्किटेक्चर प्रस्तावित करता है, जो मौजूदा कार्यान्वयनों की तुलना में 15.14 GOPS/W ऊर्जा दक्षता और बिजली की खपत में 9 गुना कमी प्राप्त करता है।

Muhammad Usman, Yousef Sadegheih, Dorit Merhof2026-06-25
💻 computer science

FeVOS: Foresight Expression Video Object Segmentation

यह शोध पत्र FeVOS पेश करता है, जो एक नया कार्य और डेटासेट है जो आगामी घटनाओं के आधार पर भविष्य के ऑब्जेक्ट मास्क की भविष्यवाणी करने के लिए 'फोरसाइट एक्सप्रेशन वीडियो ऑब्जेक्ट सेगमेंटेशन' (Foresight Expression Video Object Segmentation) की आवश्यकता रखता है, साथ ही FeVOS-R1 भी पेश करता है, जो सुपरवाइज्ड फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।

Kehan Lan, Kaining Ying, Henghui Ding2026-06-25
💻 computer science

ScaleHP: Estimating Hand Pose in Metric Space

ScaleHP एक नवीन एंड-टू-एंड फ्रेमवर्क है जो आंतरिक मानवशास्त्रीय पूर्व-ज्ञान (anthropometric priors) और एक स्केल टोकन वाले ट्रांसफार्मर-आधारित डिकोडर का लाभ उठाकर स्टेट-ऑफ-द-आर्ट मेट्रिक-स्पेस हैंड पोज़ एस्टीमेशन प्राप्त करता है, जिससे नाजुक एक्सट्रिंसिक डेप्थ मॉड्यूल्स की आवश्यकता समाप्त हो जाती है।

Ruitao Jing, Xingyu Chen, Hongyang Li, Qing Jiang, Yukai Shi, Lei Zhang2026-06-25
💻 computer science

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

यह शोध पत्र SSMNBench प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जो क्रॉस-व्यू मानव-वस्तु समझ कार्यों को 'सिंगल-व्यू सफिशिएंसी' (एकल-दृश्य पर्याप्तता) और 'मल्टी-व्यू नेसेसिटी' (बहु-दृश्य आवश्यकता) में वर्गीकृत करता है ताकि यह प्रकट किया जा सके कि वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स अनावश्यक दृश्यों में विजुअल डिस्ट्रैक्शन (दृश्य व्याकुलता) के साथ संघर्ष करते हैं और कई कैमरों के बीच खंडित ज्यामितीय साक्ष्यों को वास्तविक रूप से संश्लेषित करने में विफल रहते हैं।

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu2026-06-25