🤖 AI

Interpreting Physics in Video World Models

تتقصى هذه الورقة كيفية تمثيل نماذج عالم الفيديو للخصائص الفيزيائية، حيث اكتشفت أنها لا تستخدم متغيرات عاملية مثل المحركات الكلاسيكية، بل تعتمد بدلاً من ذلك على تمثيل عالي الأبعاد وموزع ينبثق عند عمق وسيط محدد داخل بنية النموذج.

Sonia Joseph, Quentin Garrido, Randall Balestriero, Matthew Kowal, Thomas Fel, Shahab Bakhtiari, Blake Richards, Mike Ra (…)2026-02-10
💻 computer science

Contactless estimation of continuum displacement and mechanical compressibility from image series using a deep learning based framework

تقدم هذه الورقة إطار عمل فعال للتعلم العميق من طرف إلى طرف يتفوق على الطرق التكرارية التقليدية من خلال التقدير المباشر لإزاحة المتصلة وانضغاطية المادة من سلاسل الصور، مستفيداً من السمات المعرفية عالية الرتبة للحفاظ على دقة عالية حتى في ظل وجود انحرافات في التعيين المحلي.

A. N. Maria Antony, T. Richter, E. Gladilin2026-02-10
⚡ electrical engineering

MRI Cross-Modal Synthesis: A Comparative Study of Generative Models for T1-to-T2 Reconstruction

تقدم هذه الورقة دراسة مقارنة لنماذج Pix2Pix GAN وCycleGAN وVAE لإعادة بناء صور الرنين المغناطيسي من نوع T1 إلى T2 باستخدام مجموعة بيانات BraTS 2020، حيث وجدت أنه في حين يحقق CycleGAN أعلى جودة هيكلية وإشارية، فإن Pix2Pix GAN يقدم أدنى معدلات الخطأ، بينما يوفر VAE مزايا فريدة في الفضاء الكامن.

Ali Alqutayfi, Sadam Al-Azani2026-02-10
🤖 AI

MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation

تُعد MosaicThinker تقنية للحوسبة أثناء الاستدلال مخصصة للذكاء الاصطناعي المجسد ذي الموارد المحدودة، حيث تعمل على تعزيز قدرات الاستدلال المكاني للنماذج البصرية اللغوية الكبيرة (VLMs) الصغيرة من خلال دمج المعلومات المجزأة من إطارات فيديو متعددة في خريطة دلالية عالمية موحدة تُستخدم للتلقين البصري.

Haoming Wang, Qiyao Xue, Weichen Liu, Wei Gao2026-02-10
🤖 AI

Reasoning-Augmented Representations for Multimodal Retrieval

تقترح الورقة إطار عمل متمحور حول البيانات للاسترجاع متعدد الوسائط الشامل، والذي يعمل على تحسين الأداء باستخدام نموذج رؤية ولغة لاستخراج الاستدلال الضمني من خلال التوصيف الكثيف للمتن وإعادة كتابة الاستعلام، يليه تدريب المسترجع على هذه التمثيلات الغنية دلالياً.

Jianrui Zhang, Anirudh Sundara Rajan, Brandon Han, Soochahn Lee, Sukanta Ganguly, Yong Jae Lee2026-02-10
💻 computer science

Privacy in Image Datasets: A Case Study on Pregnancy Ultrasounds

تتقصى هذه الورقة مخاطر الخصوصية في مجموعات البيانات الضخمة التي تم جمعها عبر كشط الويب من خلال إثبات أن مجموعة بيانات LAION-400M تحتوي على صور أشعة تلفزيونية (سونار) حساسة للحمل إلى جانب آلاف الحالات من معلومات تحديد الهوية الشخصية، مثل الأسماء والمواقع.

Rawisara Lohanimit, Yankun Wu, Amelia Katirai, Yuta Nakashima, Noa Garcia2026-02-10
💻 computer science

DuMeta++: Spatiotemporal Dual Meta-Learning for Generalizable Few-Shot Brain Tissue Segmentation Across Diverse Ages

يُعد DuMeta++ إطار عمل تعلم ميتا مزدوج يحقق تجزئة عامة لنسيج الدماغ في حالات التعلم القليل من العينات عبر أعمار متنوعة، وذلك من خلال دمج تعلم الميزات الميتا والتهيئة الميتا مع استراتيجية تنظيم قائمة على بنك الذاكرة لضمان الاتساق الطولي دون الحاجة إلى بيانات طولية مقترنة.

Yongheng Sun, Jun Shu, Jianhua Ma, Fan Wang2026-02-10
💻 computer science

Condition Matters in Full-head 3D GANs

لمعالجة انهيار النمط والانحيازات المعتمدة على زاوية الرؤية في نماذج GAN ثلاثية الأبعاد للرأس الكامل، تقترح هذه الورقة استخدام سمات دلالية ثابتة تجاه زاوية الرؤية — مستخرجة من مناظر أمامية لمجموعة بيانات مُخلّقة جديدة — كإشارات شرطية لفصل القدرة التوليدية عن اتجاه الرؤية، مما يعزز الدقة والتنوع والتماسك العالمي لتخليق الرأس ثلاثي الأبعاد.

Heyuan Li, Huimin Zhang, Yuda Qiu, Zhengwentai Sun, Keru Zheng, Lingteng Qiu, Peihao Li, Qi Zuo, Ce Chen, Yujian Zheng (…)2026-02-10
💻 computer science

Understanding Real-World Traffic Safety through RoadSafe365 Benchmark

تُعد RoadSafe365 معياراً ضخماً للرؤية واللغة يتميز بتصنيف هرمي وتوصيفات متعددة الوسائط واسعة النطاق، صُممت لسد الفجوة بين تحليل حركة المرور القائم على البيانات ومعايير السلامة الرسمية من خلال التقييم الدقيق لأحداث المرور في العالم الحقيقي.

Xinyu Liu, Darryl C. Jacob, Yuxin Liu, Xinsong Du, Muchao Ye, Bolei Zhou, Pan He2026-02-10