🤖 AI

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

تقدم هذه الورقة MaLSF، وهو إطار عمل جديد للتحقق متعدد الوسائط يتغلب على قيود الدمج الشمولي السلبي من خلال توظيف أزواج قناع-تسمية كمرتكزات دلالية واستخدام التحقق المتبادل ثنائي الاتجاه عبر الوسائط مع التجميع الهرمي للكشف بنشاط عن التناقضات الدلالية المحلية الدقيقة في المعلومات المضللة المعقدة وتفسيرها.

Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin2026-03-30
💻 computer science

Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline

تُعد هذه الورقة البحثية رائدة في مجال تقييم طلاقة الفيديو (VFA) كمهة إدراكية مستقلة من خلال تقديم مجموعة بيانات FluVid، وهي معيار شامل لـ 23 طريقة، ونموذج أساسي مبتكر يسمى FluNet يستخدم الانتباه الذاتي المتبدل زمنياً لتحقيق أداء رائد في تقييم اتساق حركة الفيديو واستمرارية الإطارات.

Qizhi Xie, Kun Yuan, Yunpeng Qu, Ming Sun, Chao Zhou, Jihong Zhu2026-03-30
🤖 machine learning

MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

تقترح الورقة البحثية إطار عمل MUST، وهو إطار عمل مبتكر يعزز التنبؤ بالبقاء على قيد الحياة في مجال طب الأورام الدقيق من خلال تفكيك التمثيلات متعددة الوسائط إلى مكونات محددة ومشتركة لتحديد المعلومات المفقودة، والتي يتم بعد ذلك إعادة بنائها باستخدام نماذج الانتشار الكامن الشرطية لتحقيق أقصى قدر من المتانة ضد البيانات السريرية غير المكتملة بما يحقق أفضل النتائج الحالية.

Kyungwon Kim, Dosik Hwang2026-03-30
⚡ electrical engineering

Experimental study on surveillance video-based indoor occupancy measurement with occupant-centric control

تقدم هذه الورقة دراسة تجريبية تثبت أن خط معالجة قياس الإشغال القائم على الرؤية والمعزز بنماذج اللغات الكبيرة (YOLOv8+DeepSeek) يحسن دقة التتبع بشكل كبير ويمكّن من خفض استهلاك طاقة أنظمة التدفئة والتهوية وتكييف الهواء بنسبة 17.94% من خلال التحكم المتمحور حول شاغلي المباني في المباني الذكية.

Irfan Qaisar, Kailai Sun, Qingshan Jia, Qianchuan Zhao2026-03-30
💻 computer science

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

تقدم الورقة البحثية TaxaAdapter، وهي طريقة خفيفة الوزن تدمج نماذج التصنيف الرؤيوي مثل BioCLIP في نماذج الانتشار المجمدة لتحسين دقة وفاء النوع على المستوى الدقيق والتعميم لتوليد الصور من النصوص عبر شجرة الحياة بشكل كبير، مصحوبة بمقياس متعدد الوسائط جديد لتقييم الاتساق المورفولوجي.

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sa (…)2026-03-30
💻 computer science

InstaVSR: Taming Diffusion for Efficient and Temporally Consistent Video Super-Resolution

يُعد InstaVSR إطار عمل انتشار خفيف الوزن يحقق دقة فائقة للفيديو بكفاءة واتساق زمني من خلال الجمع بين هيكل أساسي مقلم بـخطوة واحدة، والتدريب المتكرر الموجه بالتدفق، والتعلم التنافسي ثنائي الفضاء لتقليل التكاليف الحسابية بشكل كبير مع الحفاظ على جودة إدراكية عالية.

Jintong Hu, Bin Chen, Zhenyu Hu, Jiayue Liu, Guo Wang, Lu Qi2026-03-30
💻 computer science

IP-Bench: Benchmark for Image Protection Methods in Image-to-Video Generation Scenarios

تقدم هذه الورقة IP-Bench، وهو أول معيار منهجي مصمم لتقييم فعالية ومتانة طرق حماية الصور ضد سوء الاستخدام في سيناريوهات توليد الصور إلى فيديو من خلال اختبارها عبر نماذج واستراتيجيات هجوم وظروف قابلية نقل متعددة.

Xiaofeng Li, Leyi Sheng, Zhen Sun, Zongmin Zhang, Jiaheng Wei, Xinlei He2026-03-30
💻 computer science

Provably Contractive and High-Quality Denoisers for Convergent Restoration

تقدم هذه الورقة بنية مبتكرة لتقليل الضجيج تجمع بين الطبقات القريبة (proximal layers) والالتفافات المحكومة بليبتشيتز (Lipschitz-controlled convolutions) لتحقيق انكماش مثبت (ثابت ليبتشيتز عالمي < 1)، مما يضمن الاستقرار ضد اضطرابات المدخلات ويضمن التقارب في خوارزميات الترميم من نوع "الوصل والتشغيل" (Plug-and-Play) دون التضحية بجودة الصورة التنافسية.

Shubhi Shukla, Pravin Nair2026-03-30
💻 computer science

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

تقدم هذه الورقة CREval، وهو مسار تقييم آلي وقابل للتفسير قائم على الأسئلة والأجوبة، وCREval-Bench، وهو معيار شامل يضم أكثر من 800 عينة، لتقييم وكشف القيود الحالية لنماذج تحرير الصور المتطورة في التعامل مع مهام التلاعب المعقدة والإبداعية بشكل منهجي.

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao2026-03-30
🤖 AI

Progressive Learning with Anatomical Priors for Reliable Left Atrial Scar Segmentation from Late Gadolinium Enhancement MRI

تقترح هذه الورقة إطار عمل تعلم تدريجي ثلاثي المراحل مستوحى سريرياً، مع دالة فقدان مدركة للتشريح لتحسين موثوقية ودقة تقسيم ندبات الأذين الأيسر من صور الرنين المغناطيسي لتعزيز تباين غادولينيوم متأخر (LGE MRI)، وذلك عن طريق دمج الأولويات التشريحية والاستدلال التشخيصي في عملية التعلم العميق.

Jing Zhang, Bastien Bergere, Emilie Bollache, Jonas Leite, Mikaël Laredo, Alban Redheuil, Nadjia Kachenoura2026-03-30