💻 computer science

TriFusion-SR: Joint Tri-Modal Medical Image Fusion and SR

تقترح الورقة البحثية TriFusion-SR، وهو إطار عمل انتشار شرطي موجه بالمويجات يقوم بشكل مشترك بدمج الصور الطبية ثلاثية الأنماط وتراكب الدقة العالية من خلال تفكيك الميزات إلى نطاقات ترددية واستخدام ميزات مويجة مصححة مع دمج مكاني-ترددي تكيفي لتحقيق أداء رائد في الدقة والجودة الإدراكية.

Fayaz Ali Dharejo, Sharif S. M. A., Aiman Khalil, Nachiket Chaudhary, Rizwan Ali Naqvi, Radu Timofte2026-03-11
💻 computer science

FrameDiT: Diffusion Transformer with Frame-Level Matrix Attention for Efficient Video Generation

تقترح الورقة البحثية FrameDiT، وهي بنية مبتكرة لتوليد الفيديو تقدم "انتباه المصفوفة" (Matrix Attention) لنمذجة الديناميكيات المكانية والزمانية العالمية بكفاءة من خلال معالجة الإطارات كمصفوفات، مما يحقق جودة فيديو وتماسكاً زمنياً يمثلان أحدث ما توصل إليه العلم مع الحفاظ على كفاءة حوسبية تضاهي الانتباه المحلي المُجزأ.

Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran2026-03-11
💻 computer science

ENIGMA-360: An Ego-Exo Dataset for Human Behavior Understanding in Industrial Scenarios

تقدم هذه الورقة البحثية ENIGMA-360، وهي مجموعة بيانات (ego-exo) مُطلقة للعموم ومتزامنة زمنياً تحتوي على 360 فيديو إجرائياً مشروحاً من سيناريوهات صناعية حقيقية لتعزيز فهم السلوك البشري ووضع خطوط أساس لمهام مثل تقسيم الإجراءات وكشف التفاعل.

Francesco Ragusa, Rosario Leonardi, Michele Mazzamuto, Daniele Di Mauro, Camillo Quattrocchi, Alessandro Passanisi, Iren (…)2026-03-11
💻 computer science

LogoDiffuser: Training-Free Multilingual Logo Generation and Stylization via Letter-Aware Attention Control

تُعد LogoDiffuser طريقةً لا تعتمد على التدريب، حيث تستفيد من نماذج الانتشار المحولة متعددة الوسائط والتحكم في الانتباه المدرك للحروف لتوليد تصميمات شعارات عالية الجودة ومتعددة اللغات عبر إدخال الحروف المستهدفة كصور للحفاظ على السلامة الهيكلية مع تطبيق أساليب إبداعية.

Mingyu Kang, Hyein Seo, Yuna Jeong, Junhyeong Park, Yong Suk Choi2026-03-11
💻 computer science

Removing the Trigger, Not the Backdoor: Alternative Triggers and Latent Backdoors

تتحدى هذه الورقة الافتراض القائل بأن تحييد المحفزات المعروفة يقضي على الأبواب الخلفية من خلال إثبات أن "المحفزات البديلة" المتميزة إدراكياً يمكنها تفعيل اتجاهات الأبواب الخلفية الكامنة في فضاء السمات بشكل موثوق، وبالتالي تدعو إلى دفاعات تستهدف أنماط التمثيل الأساسية هذه بدلاً من محفزات مدخلات محددة.

Gorka Abad, Ermes Franch, Stefanos Koffas, Stjepan Picek2026-03-11
💻 computer science

RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding

تقدم هذه الورقة مهمة جديدة للتعلم السمعي البصري دقيقة التفاصيل تسمى فهم مصدر الصوت المدرك للمنطقة (RA-SSU)، مدعومة بمجموعتي بيانات جديدتين (f-Music و f-Lifescene) ونموذج متطور يسمى SSUFormer، والذي يستخدم وحدات متخصصة لتحقيق تجزئة دقيقة لمصدر الصوت وأوصاف نصية مفصلة على مستوى الإطار.

Muyi Sun, Yixuan Wang, Hong Wang, Chen Su, Man Zhang, Xingqun Qi, Qi Li, Zhenan Sun2026-03-11
💻 computer science

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

يُعد ConfCtrl إطار عمل للتدخل البيني للفيديو يعتمد على الوعي بالثقة، والذي يتيح تحكماً دقيقاً في الكاميرا في نماذج انتشار الفيديو لتوليد مناظر جديدة عبر الجمع بين إسقاطات السحب النقطية الموزونة بالثقة وآلية تنبؤ وتحديث مستوحاة من مرشح كالمان لتحقيق التوازن بين توجيه الوضعية والاتساق الهندسي مع إعادة بناء المناطق غير المرئية.

Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada2026-03-11
💻 computer science

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

تقدم هذه الورقة البحثية VLM-Loc، وهو إطار عمل يستفيد من النماذج اللغوية البصرية الكبيرة لتحقيق تحديد دقيق للمواقع من النص إلى السحابة النقطية عن طريق تحويل الخرائط ثلاثية الأبعاد إلى صور من منظور عين الطائر ورسوم بيانية للمشهد لتعزيز الاستدلال المكاني، إلى جانب إصدار معيار CityLoc للتقييم المنهجي.

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu2026-03-11
🤖 AI

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

تقدم هذه الورقة MA-EgoQA، وهو معيار وقاعدة بيانات مبتكرة تضم 1,700 سؤالاً عبر خمس فئات مصممة لتقييم قدرة نماذج الذكاء الاصطناعي على الفهم والاستدلال عبر فيديوهات متعددة طويلة الأمد من منظور الشخص الأول (egocentric) لوكلاء مجسدين، إلى جانب نموذج أساسي مقترح يسمى EgoMAS يسلط الضوء على القيود الحالية في فهم الأنظمة متعددة الوكلاء.

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang2026-03-11
💻 computer science

MissBench: Benchmarking Multimodal Affective Analysis under Imbalanced Missing Modalities

تقدم هذه الورقة MissBench، وهو معيار وإطار عمل للحوسبة العاطفية متعددة الوسائط يعالج الفجوة في تقييم النماذج تحت ظروف فقدان الوسائط الواقعية وغير المتوازنة من خلال توحيد البروتوكولات واقتراح مقاييس تشخيصية جديدة (MEI وMLI) للكشف عن عدم المساواة الخفية في الوسائط واختلال توازن التحسين.

Tien Anh Pham, Phuong-Anh Nguyen, Duc-Trong Le, Cam-Van Thi Nguyen2026-03-11