💻 computer science

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

تُعد TeDiO طريقةً لا تتطلب تدريباً وتعمل أثناء مرحلة الاستدلال، حيث تعمل على تعزيز التماسك الزمني في نماذج الانتشار للفيديو من خلال اكتشاف وتنظيم الأنماط القطرية غير المنتظمة في خرائط الانتباه الذاتي لإنتاج حركة أكثر سلاسة واستقراراً دون تعديل أوزان النموذج.

Nurislam Tursynbek, Zhiqiang Lao, Heather Yu, Gedas Bertasius, Marc Niethammer2026-05-15
💻 computer science

You Only Landmark Once: Lightweight U-Net Face Super Resolution with YOLO-World Landmark Heatmaps

تقترح هذه الورقة بنية U-Net خفيفة الوزن لرفع دقة صور الوجوه بمقدار 8 أضعاف (extreme 8x face super-resolution)، والتي تستخدم خرائط حرارية للمعالم (landmark heatmaps) ناتجة عن نموذج YOLO-World كأوزان مكانية في دالة فقد (loss function) مبتكرة لا تتطلب تدريباً مساعداً، وذلك لتعزيز إعادة بناء التفاصيل دون الحاجة إلى تدريب تنافسي أو شبكات محاذاة إضافية.

Riccardo Carraro, Anna Briotto, Endi Hysa, Marco Fiorucci, Lamberto Ballan2026-05-15
💻 computer science

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

يُعد CoReDiT إطار عمل فعال لتقليم الرموز (token pruning) لنماذج محولات الانتشار (Diffusion Transformers)، حيث يستفيد من التماسك المكاني لتحديد وتخطي الرموز الزائدة مع إعادة بناء مخرجاتها عبر الرموز المجاورة، مما يحقق تسريعًا كبيرًا في العمليات الحسابية وتوفيرًا في الذاكرة دون المساس بالجودة البصرية.

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli2026-05-15
💻 computer science

MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving

يُعد MAPLE إطار عمل قابلاً للتوسع وخالياً من المحاكيات، يعزز القيادة الذاتية من الطرف إلى الطرف من خلال تمكين التدريب التفاعلي متعدد الوكلاء في حلقة مغلقة داخل الفضاء الكامن لنماذج الرؤية واللغة والعمل عبر الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي مع مكافآت التنوع.

Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi, Meysam Sadeghigooghari, Hanno Ackermann, Litian (…)2026-05-15
💻 computer science

Automatic Landmark-Based Segmentation of Human Subcortical Structures in MRI

تقترح هذه الورقة إطار عمل للتجزئة ثلاثية الأبعاد بتوجيه المعالم، والذي يحاكي بروتوكول أطلس هارفارد-أوكسفورد اليدوي من خلال الجمع بين كشف المعالم العالمي، والتجزئة الدلالية الأولية، ومعالجة ما بعد التجزئة الموجهة بالمعالم لتحقيق تحديد دقيق ومتسق تشريحياً لـ 26 بنية تحت قشرية بشرية في التصوير بالرنين المغناطيسي.

Ahmed Rekik, R. Jarrett Rushmore, Sylvain Bouix, Linda Marrakchi-Kacem2026-05-15
💻 computer science

Implicit spatial-frequency fusion of hyperspectral and lidar data via kolmogorov-arnold networks

تقترح هذه الورقة البحثية IFGNet، وهو إطار عمل مبتكر يستفيد من شبكات كولموغوروف-أرنولد (Kolmogorov-Arnold Networks) ووحدة تجميع ضمني موجهة ببيانات ليدار (LiDAR-guided implicit aggregation module) لدمج البيانات فائقة الطيف وبيانات ليدار بفعالية في كل من النطاقين المكاني والترددي، مما يحقق أداء تصنيف فائق في المشاهد المعقدة مقارنة بالطرق الحالية.

Zekun Long, Judy X. Yang, Jing Wang, Ali Zia, Guanyiman Fu, Jun Zhou2026-05-15
🤖 machine learning

Towards Real-Time Autonomous Navigation: Transformer-Based Catheter Tip Tracking in Fluoroscopy

تقدم هذه الورقة البحثية مساراً زمنياً حقيقياً ومتعدد الخيوط لتتبع طرف القسطرة باستخدام نماذج التجزئة القائمة على التعلم العميق، وتُظهر تحديداً أن بنية "SegFormer" ثنائية الفئات تتفوق على الأساليب الحالية في الدقة والمتانة لتوفير أساس موثوق للملاحة الذاتية لعمليات استئصال الخثرة الميكانيكية القائمة على التعلم التعزيزي.

Harry Robertshaw, Yanghe Hao, Weiyuan Deng, Benjamin Jackson, S. M. Hadi Sadati, Nikola Fischer, Tom Vercauteren, Alejan (…)2026-05-15
💻 computer science

Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

تقدم هذه الورقة البحثية "تدخل إشارة الحذف" (OSI)، وهي طريقة تكتشف وتضخم "إشارة حذف" محددة داخل تمثيلات النصوص (text embeddings) للتخفيف بفعالية من حذف المفاهيم في نماذج المحولات الانتشارية متعددة الوسائط (Multimodal Diffusion Transformers).

Kanghyun Baek, Jaihyun Lew, Chaehun Shin, Jungbeom Lee, Sungroh Yoon2026-05-15
💻 computer science

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

تقدم هذه الورقة CreFlow، وهو إطار عمل جديد للتعلم التعزيزي عبر الإنترنت يستخدم نموذج مكافأة قائماً على المنطق الزمني الخطي التركيبي ودوال فقدان متخصصة لتصحيح انتهاكات القيود الفيزيائية بفعالية في نماذج انتشار الفيديو المجسدة ذات المكافآت الشحيحة، مما يحسن بشكل كبير من نجاح مهام التلاعب في المراحل اللاحقة.

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran W (…)2026-05-15
💬 NLP

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

تقترح هذه الورقة MMGuard، وهي آلية دفاع استباقية تولد أمثلة متعددة الوسائط غير قابلة للتعلم عن طريق حقن اضطرابات غير محسوسة للبشر وتعطيل الروابط بين الوسائط المتعددة لمنع الضبط الدقيق غير المصرح به لنماذج الرؤية واللغة الكبيرة، مما يحمي حقوق الطبع والنشر وخصوصية مالكي البيانات.

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu2026-05-15