💻 computer science

Equivariant symmetry-aware head pose estimation for fetal MRI

تقدم الورقة البحثية E(3)-Pose، وهي طريقة مبتكرة تستفيد من التكافؤ E(3) ونمذجة التماثل الصريح لتحقيق تقدير قوي وفائق للأداء لـ 6 درجات حرية لوضعية رأس الجنين من أحجام الرنين المغناطيسي منخفضة الدقة، مما يتيح الوصف التلقائي التكيفي للشرائح التشخيصية ثنائية الأبعاد رغم الغموض التشريحي وعيوب الحركة.

Ramya Muthukrishnan, Borjan Gagoski, Aryn Lee, P. Ellen Grant, Elfar Adalsteinsson, Benjamin Billot, Polina Golland2026-03-19
💻 computer science

PubTables-v2: A new large-scale dataset for full-page and multi-page table extraction

تقدم الورقة البحثية PubTables-v2، وهي مجموعة بيانات جديدة واسعة النطاق مصممة لتطوير استخراج الجداول كاملة الصفحة ومتعددة الصفحات من خلال معالجة نقص البيانات المشروحة وتحديد أداء خط الأساس لنماذج الرؤية واللغة، مع تسليط الضوء بشكل خاص على تحدي التعرف على هيكل الجداول متعددة الصفحات.

Brandon Smock, Valerie Faucon-Morin, Max Sokolov, Libin Liang, Tayyibah Khanam, Amrit Ramesh, Maury Courtland2026-03-19
💻 computer science

Generative Refocusing: Flexible Defocus Control from a Single Image

تقدم هذه الورقة "إعادة التركيز التوليدي" (Generative Refocusing)، وهو إطار عمل مكون من خطوتين يجمع بين DeblurNet وBokehNet لتمكين التحكم المرن وعالي الجودة في عمق المجال (defocus) وأشكال فتحة العدسة المخصصة من صورة واحدة عبر الدمج الفعال بين بيانات البوكيه الاصطناعية والواقعية.

Chun-Wei Tuan Mu, Cheng-De Fan, Jia-Bin Huang, Yu-Lun Liu2026-03-19
🤖 AI

Where It Moves, It Matters: Referring Surgical Instrument Segmentation via Motion

تقدم هذه الورقة SurgRef، وهو إطار عمل مبتكر موجه بالحركة مقترن بمجموعة بيانات Ref-IMotion، والذي يحقق أداءً هو الأفضل في مجال التجزئة المرجعية للأدوات الجراحية من خلال الاستفيد من إشارات الحركة الديناميكية بدلاً من الميزات البصرية الثابتة للتغلب على تحديات مثل الاحتجاب والمصطلحات الغامضة.

Meng Wei, Kun Yuan, Shi Li, Yue Zhou, Long Bai, Nassir Navab, Hongliang Ren, Hong Joo Lee, Tom Vercauteren, Nicolas Pado (…)2026-03-19
🤖 AI

YOLO26: An Analysis of NMS-Free End to End Framework for Real-Time Object Detection

تقدم هذه الورقة تحليلاً شاملاً لـ YOLO26، وهو إطار عمل لكشف الأشياء من طرف إلى طرف وخالٍ من تقنية NMS، يستفيد من آليات مبتكرة مثل MuSGD وSTAL وProgLoss لتحقيق أداء في الوقت الفعلي وتقليل زمن التأخير مع قياس مقايضات السرعة والدقة مقابل بنيات CNN وTransformer الحديثة على مجموعة بيانات COCO.

Sudip Chakrabarty2026-03-19
🤖 AI

Unsupervised Decomposition and Recombination with Discriminator-Driven Diffusion Models

تقترح هذه الورقة نموذج انتشار مدفوع بمميز يتيح تعلم تمثيل عامل غير خاضع للإشراف وتوليدًا تركيبيًا عالي الجودة من خلال استخدام إشارة تنافسية لضمان الاتساق الفيزيائي والدلالي في العينات المعاد دمجها، مما يظهر أداءً فائقًا في اختبارات الصور وقدرات معززة في الاستكشاف الروبوتي.

Archer Wang, Emile Anand, Yilun Du, Marin Soljačić2026-03-19
🤖 AI

PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification

تقترح الورقة البحثية إطار عمل PAND، وهو إطار ثنائي المراحل يعزز التصنيف البصري دقيق التفاصيل خفيف الوزن من خلال فصل المعايرة الدلالية عن النقل الهيكلي عبر مراسي دلالية مدركة للمطالبات وتقطير هيكلي مدرك للجوار، محققاً أداءً هو الأفضل في فئته على عدة معايير مرجعية.

Qiuming Luo, Yuebing Li, Feng Li, Chang Kong2026-03-19
⚡ electrical engineering

NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving

يُعد NutVLM إطار عمل دفاعي ذاتي التكيف لنماذج الرؤية واللغة في القيادة الذاتية، حيث يستخدم آلية كشف وتنقيه موحدة (NutNet++) لتحديد وتحييد التهديدات العدائية المحلية والعالمية من خلال قناع رمادي فعال وضبط مطالبات عدائية بتوجيه الخبراء (EAPT)، مما يعزز المتانة بشكل كبير دون المساس بأداء العينات النظيفة.

Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay2026-03-19
💻 computer science

LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency

يُعد LaS-Comp إطار عمل يعتمد على التعلم الصفري ولا يتطلب تدريباً، حيث يستفيد من الأولويات المستمدة من النماذج التأسيسية ثلاثية الأبعاد عبر تصميم ثنائي المراحل يتكون من الاستبدال الصريح والتحسين الضمني لتحقيق إكمال أشكال ثلاثية الأبعاد عالية الجودة وغير مرتبطة بفئة معينة، وهو ما تم التحقق منه بواسطة معيار Omni-Comp الجديد.

Weilong Yan, Haipeng Li, Hao Xu, Nianjin Ye, Yihao Ai, Shuaicheng Liu, Jingyu Hu2026-03-19
💻 computer science

SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model

يُعد SkyReels V4 نموذجاً تأسيسياً موحداً متعدد الوسائط يستفيد من بنية MMDiT ثنائية المسار واتباع التعليمات القائم على نماذج اللغات الكبيرة متعددة الوسائط (MLLM) لتوليد، وترميم، وتحرير فيديوهات عالية الدقة بدقة 1080p ومدة 15 ثانية مع صوت متزامن من مدخلات متنوعة في آن واحد، وذلك باستخدام استراتيجية فعالة ثنائية المراحل لإنتاج مخرقات سينمائية طويلة الأمد.

Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yi (…)2026-03-19