💻 computer science

Pulp Motion: Framing-aware multimodal camera and human motion generation

تقدم هذه الورقة PulpMotion، وهو إطار عمل ومجموعة بيانات مبتكرة تحقق أداءً رائدًا في التوليد المشترك لحركة البشر ومسارات الكاميرا المشروط بالنص، وذلك من خلال الاستفادة من التأطير على الشاشة كنمط مساعد لضمان التماسك السينمائي بين هذين النمطين.

Robin Courant, Xi Wang, David Loiseaux, Marc Christie, Vicky Kalogeiton2026-04-02
🤖 machine learning

D4C: Data-Free Quantization for Contrastive Language-Image Pre-training Models

تقدم هذه الورقة البحثية D4C، وهو أول إطار عمل للكمية (quantization) بدون بيانات لنماذج CLIP يتغلب على قيود الأساليب الحالية من خلال تخليق صور زيفة غنية دلاليًا ومتنوعة هيكليًا عبر الحقن الموجه بالنماذج (prompt-guided injection)، والتوليد التبايني الهيكلي، والتعزيز المدرك للاضطراب، مما يؤدي إلى استعادة أداء النموذج بشكل كبير دون الوصول إلى بيانات حقيقية.

Wenlun Zhang, Yunshan Zhong, Zihao Ding, Xinyu Li, Kentaro Yoshioka2026-04-02
💻 computer science

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

يُعد Ar2Can إطار عمل جديدًا ثنائي المراحل يتغلب على قيود النماذج الحالية في توليد صور متعددة البشر من خلال فصل تخطيط المخطط المكاني عن رندرة الهوية، وذلك باستخدام "مهندس" (Architect) للتنبؤ بالمواضع الهيكلية و"فنان" (Artist) لتخليق صور واقعية بدقة عالية في عدد الأشخاص مع الحفاظ على الهوية من خلال تحسين GRPO.

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hay (…)2026-04-02
🤖 AI

Enhancing Floor Plan Recognition: A Hybrid Mix-Transformer and U-Net Approach for Precise Wall Segmentation

تقدم هذه الورقة البحثية MitUNet، وهي شبكة عصبية هجينة تجمع بين مشفر Mix-Transformer وفك تشفير U-Net معزز بالانتباه وفقدان Tversky لتحقيق تقسيم عالي الدقة للجدران من أجل إعادة البناء ثلاثي الأبعاد الآلي من المخططات الأرضية ثنائية الأبعاد، متفوقة بذلك على الأساليب الحالية في مجموعات بيانات CubiCasa5k والبيانات الإقليمية.

Dmitriy Parashchuk, Alexey Kaspshitskiy, Yuriy Karyakin2026-04-02
💻 computer science

Beyond the Ground Truth: Enhanced Supervision for Image Restoration

تقترح هذه الورقة إطار عمل مبتكر يعزز استعادة الصور في العالم الحقيقي من خلال توليد صور حقائق أرضية محسنة إدراكياً عبر الخلط التكيفي في مجال الترددات والارتقاء بالدقة، والتي تُستخدم بعد ذلك لتدريب شبكة تنقية خفيفة الوزن تعزز الأداء دون إدخال عيوب ناتجة عن الهلوسة.

Donghun Ryou, Inju Ha, Sanghyeok Chu, Bohyung Han2026-04-02
🤖 machine learning

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

يُعدّ SPDMark إطار عمل مبتكر للعلامات المائية في مرحلة التوليد، يستخدم إزاحة معلمات انتقائية قائمة على تقنية LoRA لدمج علامات مائية غير مرئية ومتينة في الفيديوهات المُولَّدة، مما يتيح استعادة الرسائل بدقة عالية وتحديد التلاعب الزمني حتى بعد التعديلات الشائعة على الفيديو.

Samar Fares, Nurbek Tastan, Karthik Nandakumar2026-04-02
💻 computer science

ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion

يُعد ActionMesh نموذجاً توليدياً سريعاً يعمل بنظام التغذية الأمامية، ويستخدم إطار عمل مبتكر لـ "الانتشار ثلاثي الأبعاد الزمني" لإنتاج شبكات ثلاثية الأبعاد متحركة جاهزة للإنتاج، وخالية من الهياكل العظمية، ومتسقة طوبولوجياً من مدخلات متنوعة مثل النصوص أو مقاطع الفيديو أحادية العدسة، محققاً أداءً هو الأفضل في فئته من حيث الدقة الهندسية والاتساق الزمني.

Remy Sabathier, David Novotny, Niloy J. Mitra, Tom Monnier2026-04-02
💻 computer science

Vision-Language-Model-Guided Differentiable Ray Tracing for Fast and Accurate Multi-Material RF Parameter Estimation

تقترح هذه الورقة إطار عمل لتتبع الأشعة القابل للتفاضل بتوجيه من نموذج الرؤية واللغة، والذي يستفيد من التحليل الدلالي للمشهد لتوفير تهيئة مستنيرة ووضع أمثل للمستشعرات، مما يؤدي إلى تسريع التقارب بشكل كبير وتعزيز دقة تقدير معاملات الترددات الراديوية متعددة المواد للتوائم الرقمية لشبكات الجيل السادس (6G).

Zerui Kang, Yishen Lim, Zhouyou Gu, Seung-Woo Ko, Tony Q. S. Quek, Jihong Park2026-04-02
💻 computer science

Suppressing Non-Semantic Noise in Masked Image Modeling Representations

تقدم هذه الورقة البحثية طريقة "إسقاط المشغولات الدلالية المتعامدة" (SOAP)، وهي طريقة لا تتطلب تدريباً وتُطبق بعد عملية التدريب (post-hoc)، تعمل على كبح الضجيج غير الدلالي في تمثيلات نمذجة الصور المقنعة لتحسين أداء الاستدلال في حالة الصفر (zero-shot inference).

Martine Hjelkrem-Tan, Marius Aasan, Rwiddhi Chakraborty, Gabriel Y. Arteaga, Changkyu Choi, Adín Ramírez Rivera2026-04-02
⚡ electrical engineering

Pupil Design for Computational Wavefront Estimation

تقدم هذه الورقة مقياساً كمياً لعدم التماثل، وتثبت من خلال عمليات المحاكاة والتجارب أن زيادة عدم تماثل الحدقة تعزز بشكل كبير من إمكانية استعادة جبهة الموجة من قياسات شدة الضوء الفردية، مع تحليل المقايضات المرتبطة بها في تدفق الضوء وأداء الضوضاء.

Ali Almuallem, Nicholas Chimitt, Bole Ma, Qi Guo, Stanley H. Chan2026-04-02