🤖 AI

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

إن Place-it-R1 هو إطار عمل متكامل يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) مع تسلسل التفكير (Chain-of-Thought) لتنسيق انتشار الفيديو عبر نموذج "فكر ثم ضع" (Think-then-Place)، مما يضمن إدراج كائنات الفيديو بشكل متسق فيزيائياً ومدرك للبيئة من خلال التحسين المتكرر والموازنة بين واقعية المظهر ودقة التفاصيل التي يمكن للمستخدم التحكم بها.

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo2026-03-09
🤖 AI

VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models

تقدم هذه الورقة VLM-RobustBench، وهو معيار شامل لتقييم متانة أربع عائلات من نماذج الرؤية واللغة عبر 133 إعداداً للفساد، كاشفةً أن النماذج الحالية قوية دلالياً ولكنها هشة مكانياً، حيث تسبب التشوهات الهندسية منخفضة الشدة انخفاضات في الأداء أكبر بكثير من الفسادات الضوئية شديدة الوضوح بصرياً.

Rohit Saxena, Alessandro Suglia, Pasquale Minervini2026-03-09
💻 computer science

A Semi-Supervised Framework for Breast Ultrasound Segmentation with Training-Free Pseudo-Label Generation and Label Refinement

تقترح هذه الورقة إطار عمل شبه مُشرف لتقسيم صور الموجات فوق الصوتية للثدي، يستفيد من المحفزات القائمة على المظهر والخالية من التدريب في نماذج الرؤية واللغة لتوليد تسميات مستعارة متسقة هيكلياً، والتي يتم تنقيحها بعد ذلك من خلال آلية المعلم المزدوج والتعلم التبايني لتحقيق أداء بمستوى الإشراف الكامل باستخدام 2.5% فقط من البيانات المصنفة.

Ruili Li, Jiayi Ding, Ruiyu Li, Yilun Jin, Shiwen Ge, Yuwen Zeng, Xiaoyong Zhang, Eichi Takaya, Jan Vrba, Noriyasu Homma2026-03-09
💻 computer science

Making Training-Free Diffusion Segmentors Scale with the Generative Power

تتناول هذه الورقة البحثية قيود القابلية للتوسع في أدوات تقسيم الصور المعتمدة على نماذج الانتشار (diffusion segmentors) التي لا تتطلب تدريباً، وذلك من خلال تحديد ومعالجة الفجوات في تجميع خرائط الانتباه وعدم توازن درجات الرموز (token scores) عبر تقنيات مقترحة تتمثل في التجميع التلقائي وإعادة القياس لكل بكسل، مما يتيح استخداماً أفضل للنماذج التوليدية القوية في مهام التقسيم الدلالي.

Benyuan Meng, Qianqian Xu, Zitai Wang, Xiaochun Cao, Longtao Huang, Qingming Huang2026-03-09
🤖 AI

CRIMSON: A Clinically-Grounded LLM-Based Metric for Generative Radiology Report Evaluation

تقدم هذه الورقة CRIMSON، وهو إطار تقييم قائم على الأسس السريرية لتوليد تقارير الأشعة السينية للصدر، والذي يستفيد من سياق المريض، والوزن الشديد القائم على الإرشادات، وتصنيف شامل للأخطاء لتحقيق توافق متفوق مع أحكام أطباء الأشعة مقارنة بالمقاييس الحالية.

Mohammed Baharoon, Thibault Heintz, Siavash Raissi, Mahmoud Alabbad, Mona Alhammad, Hassan AlOmaish, Sung Eun Kim, Oishi (…)2026-03-09
💻 computer science

SpaCRD: Multimodal Deep Fusion of Histology and Spatial Transcriptomics for Cancer Region Detection

تقدم الورقة البحثية SpaCRD، وهي طريقة دمج عميق متعدد الوسائط تعتمد على التعلم بنقل المعرفة، تدمج صور الأنسجة وبيانات النسخ المكاني لتحقيق كشف قوي ودقيق لمناطق السرطان عبر عينات ومنصات ودفعات متنوعة، متفوقة بذلك على الأساليب الحالية المتطورة.

Shuailin Xue, Jun Wan, Lihua Zhang, Wenwen Min2026-03-09
💻 computer science

Point-Supervised Skeleton-Based Human Action Segmentation

تقدم هذه الورقة إطار عمل يعتمد على الإشراف النقطي لتجزئة الأفعال البشرية القائمة على الهيكل العظمي، والذي يستفيد من الميزات متعددة الوسائط واستراتيجية تسمية مستعارة مبتكرة لتحقيق أداء تنافسي مع تقليل تكاليف التوسيم بشكل كبير مقارنة بالطرق الخاضعة للإشراف الكامل.

Hongsong Wang, Yiqin Shen, Pengbo Yan, Jie Gui2026-03-09
💻 computer science

EntON: Eigenentropy-Optimized Neighborhood Densification in 3D Gaussian Splatting

تقدم الورقة البحثية EntON، وهي طريقة جديدة لتقنية "Gaussian Splatting" ثلاثية الأبعاد تستخدم استراتيجية تكثيف تبادلية واعية بـ "الاعتلاج الذاتي" (Eigenentropy) لتحسين الدقة الهندسية وجودة الرندرة في آن واحد، مع تقليل عدد الـ "Gaussians" ووقت التدريب بشكل كبير.

Miriam Jäger, Boris Jutzi2026-03-09
💻 computer science

Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution

تقترح الورقة البحثية StrSR، وهو إطار عمل جديد للتقطير التنافسي ذو الخطوة الواحدة يستخدم التقطير التمييزي غير المتماثل ومطابقة توزيع التردد للتغلب على عدم تطابق المسار والآثار الدورية، مما يحقق أداءً هو الأفضل في حالته في مجال تحسين دقة الصور في العالم الحقيقي باستخدام محولات الانتشار (Diffusion Transformers).

Jingkai Wang, Yixin Tang, Jue Gong, Jiatong Li, Shu Li, Libo Liu, Jianliang Lan, Yutong Liu, Yulun Zhang2026-03-09
🤖 AI

DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models

تقدم الورقة البحثية DEX-AR، وهي طريقة تفسير ديناميكية مبتكرة تولد خرائط حرارية على مستوى كل رمز (per-token) وعلى مستوى التسلسل للنماذج الرؤية-اللغوية ذات التوليد الذاتي (autoregressive) عبر حساب التدرجات لكل طبقة واستخدام الترشيح الديناميكي للتمييز بين الرموز المرتبطة بصرياً والرموز اللغوية، مما يؤدي إلى تحسين القابلية للتفسير والأداء عبر معايير قياس متعددة.

Walid Bousselham, Angie Boggust, Hendrik Strobelt, Hilde Kuehne2026-03-09