🤖 machine learning

Learning Multimodal Embeddings for Traffic Accident Prediction and Causal Estimation

تقدم هذه الورقة إطار عمل للتعلم متعدد الوسائط يدمج هياكل شبكات الطرق مع صور الأقمار الصناعية عالية الدقة والبيانات البيئية لتحسين دقة التنبؤ بحوادث المرور بشكل كبير وتمكين التقدير السببي لعوامل الخطر الرئيسية مثل هطول الأمطار، وسرعة الطريق، والأنماط الموسمية.

Ziniu Zhang, Minxuan Duan, Haris N. Koutsopoulos, Hongyang R. Zhang2026-05-15
💻 computer science

SuperF: Neural Implicit Fields for Multi-Image Super-Resolution

تقدم هذه الورقة البحثية SuperF، وهو أسلوب تحسين في وقت الاختبار لرفع دقة الصور المتعددة يستفيد من مجال ضمني عصبي مشترك لتحسين محاذاة دون البكسل وإعادة بناء الدقة العالية بشكل مشترك دون الحاجة إلى بيانات تدريب عالية الدقة.

Sander Riisøen Jyhne, Christian Igel, Morten Goodwin, Per-Arne Andersen, Serge Belongie, Nico Lang2026-05-15
💻 computer science

RePack then Refine: Efficient Diffusion Transformer with Vision Foundation Model

تقترح الورقة البحثية إطار عمل "إعادة التعبئة ثم الصقل" (RePack then Refine)، وهو إطار عمل ثلاثي المراحل يعمل على تعزيز نماذج محولات الانتشار (Diffusion Transformers) عبر ضغط ميزات نماذج الرؤية التأسيسية الفائضة في متشعب منخفض الأبعاد لتدريب فعال، ومن ثم صقل المخرجات لاستعادة التفاصيل عالية التردد، مما يحقق كفاءة تقارب وجودة صورة رائدة في مجموعة بيانات ImageNet-1K.

Guanfang Dong, Luke Schultz, Negar Hassanpour, Chao Gao2026-05-15
🤖 machine learning

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

تقدم هذه الورقة معيار Do-Undo، وهو إطار عمل جديد يقيم قدرة نماذج الرؤية واللغة على فهم ديناميكيات الحركة في العالم الحقيقي من خلال مطالبتها بتوليد تحولات منطقية للمشهد ثم عكسها لاحقاً إلى حالاتها الأصلية.

Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli2026-05-15
💻 computer science

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation

تقترح الورقة البحثية Video-OPD، وهو إطار عمل فعال لما بعد التدريب لعملية التمركز الزمني في الفيديو (Temporal Video Grounding)، يستفيد من التقطير القائم على السياسة (on-policy distillation) مع معلم رائد لتحويل المكافآت المتفرقة إلى إشراف كثيف على مستوى الرموز (token-level supervision)، مما يتفوق على طرق GRPO الحالية في سرعة التقارب والكفاءة الحسابية.

Jiaze Li, Hao Yin, Haoran Xu, Boshen Xu, Wenhui Tan, Zewen He, Jianzhong Ju, Zhenbo Luo, Jian Luan2026-05-15
💻 computer science

ImmuVis: Hyperconvolutional Foundation Model for Imaging Mass Cytometry

يُعد ImmuVis نموذجاً تأسيسياً فائق الالتفاف (hyperconvolutional) تم تدريبه على مجموعة بيانات IMC17M الضخمة، وهو يعالج تباين مجموعات العلامات في قياس كتلة التصوير عبر استخدام نوى متكيفة مع العلامات لتمكين التحليل الفعال، الخالي من إعادة التدريب، مع معايرة عدم اليقين عبر أي مجموعات فرعية عشوائية من العلامات.

Dawid Uchal, Marcin MoĊejko, Krzysztof Gogolewski, Piotr Kupidura, Szymon Łukasik, Jakub Giezgała, Tomasz Nocoń, Kacper (…)2026-05-15
💻 computer science

M2^2E-UAV: A Benchmark and Analysis for Onboard Motion-on-Motion Event-Based Tiny UAV Detection

تقدم هذه الورقة M2^2E-UAV، وهي المعيار والمجموعة البيانية الأولى المصممة لمعالجة تحدي اكتشاف الطائرات بدون طيار الصغيرة من كاميرا أحداث مثبتة على متن طائرة في ظروف حركة-على-حركة، حيث توفر تدفقات أحداث متزامنة، وبيانات وحدة القياس بالقصور الذاتي (IMU)، وبروتوكولات تقييم تكشف عن قصور النماذج المرجعية الحالية في التعامل مع ضجيج الخلفية الكثيف وإشارات الأهداف الشحيحة.

Weiqi Yan, Lixin Chen, Xiangrui Hou, Zhipeng Cai, Youbiao Wang, Yangyang Shi, Yu Zang, Cheng Wang2026-05-15
💻 computer science

Contrastive Multi-Modal Hypergraph Reasoning for 3D Crowd Mesh Recovery

تقترح هذه الورقة البحثية إطار عمل "الاستدلال عبر المخطط الفائق متعدد الوسائط التبايني" (CoMHR)، وهو إطار عمل مبتكر يدمج الإشارات الدلالية والهندسية والوضعية ضمن مخطط فائق ذي طوبولوجيا مشتركة لتحقيق إعادة بناء ثلاثية الأبعاد لشبكات المش (mesh) متعددة الأشخاص في المشاهد المزدحمة، وذلك من خلال معالجة حالات الحجب وغموض العمق بفعالية عبر نشر السياق العالمي.

Minghao Sun, Chongyang Xu, Yitao Xie, Buzhen Huang, Kun Li2026-05-15
💻 computer science

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

يُعد MoZoo محلاً ديناميكياً توليدياً يستفيد من ابتكارات معمارية جديدة مثل "التموضع الدوراني المعتمد على الدور" (Role-Aware RoPE) و"الانتباه المنفصل غير المتماثل" (Asymmetric Decoupled Attention)، جنباً إلى جنب مع مسار بيانات من الاصطناعي إلى الواقع ومعيار مرجعي جديد، لتخليق فيديوهات حيوانية عالية الدقة ذات فراء وديناميكيات عضلية واقعية من شبكات هندسية خشنة بكفاءة.

Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li2026-05-15
💻 computer science

Seed3D 2.0: Advancing High-Fidelity Simulation-Ready 3D Content Generation

يُعد Seed3D 2.0 نظاماً متطوراً لتوليد المحتوى ثلاثي الأبعاد يعزز بشكل كبير من دقة الهندسة والقدرات الجاهزة للمحاكاة من خلال مسار عمل من الخشن إلى الناعم، ونمذجة موحدة لمواد PBR، ومجموعة نماذج شاملة لتخطيط المشاهد والتمفصل، متفوقاً بذلك على النماذج التجارية الرائدة في دراسات التفضيل البشري.

Diandian Gu, Jing Lin, Gaohong Liu, Jiahang Liu, Su Ma, Guang Shi, Jun Wang, Qinlong Wang, Qianyi Wu, Zhongcong Xu, Xuan (…)2026-05-15