💻 computer science

Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity Constraints

تقترح هذه الورقة طريقة مبتكرة لتحويل النص إلى رسوم متحركة تخطيطية (sketch-animation) تستفيد من نموذج انتشار (diffusion model) مدرب مسبقاً لتحويل النص إلى فيديو بتوجيه من فقدان SDS، مع إدخال تنظيم الطول والمساحة (length-area regularization) لضمان الاتساق الزمني، وفقدان "الأكثر صلابة بقدر الإمكان" (As-Rigid-As-Possible loss) للحفاظ على طوبولوجيا الرسم التخطيطي، مما يؤدي إلى تفوقها على الأساليب الرائدة حالياً في كل من التقييمات الكمية والنوعية.

Gaurav Rai, Ojaswa Sharma2026-02-27
💻 computer science

PPT: Pretraining with Pseudo-Labeled Trajectories for Motion Forecasting

تقدم الورقة البحثية إطار عمل PPT، وهو إطار تدريب مسبق قابل للتوسع يستفيد من مسارات التسمية الزائفة المولدة تلقائيًا من كواشف جاهزة لتعزيز أداء نماذج التنبؤ بالحركة وقدرتها على التعميم، لا سيما في سيناريوهات البيانات المنخفضة والعبور بين النطاقات، مع تقليل الاعتماد على التوسيم اليدوي المكلف.

Yihong Xu, Yuan Yin, Éloi Zablocki, Tuan-Hung Vu, Alexandre Boulch, Matthieu Cord2026-02-27
💻 computer science

Joint Optimization for 4D Human-Scene Reconstruction in the Wild

تقترح هذه الورقة البحثية JOSH، وهو أسلوب قائم على الأمثلة يعمل على إعادة بناء الحركة البشرية رباعية الأبعاد والمشاهد المحيطة بها بشكل مشترك من مقاطع فيديو الويب أحادية العدسة عبر الاستفضاء من قيود تلامس الإنسان والمشهد، بالإضافة إلى متغيره الفعال القائم على التعلم JOSH3R المدرب على تسميات مستعارة مشتقة من JOSH.

Zhizheng Liu, Joe Lin, Wayne Wu, Bolei Zhou2026-02-27
💻 computer science

CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models

تقدم هذه الورقة البحثية U-F2^2-CBM، وهي طريقة مبتكرة تحول أي مصنف بصري مجمد إلى نموذج عنق زجاجة مفاهيمي (Concept Bottleneck Model) غير مُشرف، وخالٍ من التسميات، وخالٍ من نموذج CLIP، وذلك عبر محاذاة توزيعه الفئوي مع نظائره في الرؤية واللغة، مما يحقق أداءً هو الأفضل حالياً دون الحاجة إلى تعليقات توضيحية يدوية أو نماذج CLIP مدربة مسبقاً.

Fawaz Sammani, Jonas Fischer, Nikos Deligiannis2026-02-27
💻 computer science

LAMM-ViT: AI Face Detection via Layer-Aware Modulation of Region-Guided Attention

تقدم الورقة البحثية LAMM-ViT، وهو نموذج محول رؤية (Vision Transformer) مبتكر يعزز كشف الوجوه بواسطة الذكاء الاصطناعي من خلال دمج الانتباه متعدد الرؤوس الموجه بالمنطقة مع التعديل الديناميكي للطبقات الواعية بالطبقات لالتقاط عدم الاتساق الهيكلي الهرمي عبر النماذج التوليدية المتنوعة، محققاً أداء تعميم هو الأفضل في فئته.

Jiangling Zhang, Weijie Zhu, Jirui Huang, Yaxiong Chen2026-02-27
⚡ electrical engineering

LinGuinE: Longitudinal Guidance Estimation for Volumetric Tumour Segmentation

تُعد LinGuinE إطار عمل جديداً يعتمد على PyTorch ولا يتطلب تدريباً، حيث يحقق أداءً فائقاً في التجزئة الحجمية الطولية للأورام وتتبع الآفات عبر مجموعات بيانات متعددة من خلال الجمع بين تسجيل الصور والتجزئة الموجهة من خلال مطالبة واحدة من طبيب الأشعة، مما يتيح تحليلاً مرناً غير مرتبط باتجاه محدد دون الحاجة إلى تدريب على البيانات الطولية.

Nadine Garibli, Mayank Patwari, Bence Csiba, Yi Wei, Kostantinos Sidiropoulos2026-02-27
💻 computer science

Human-Guided Shade Artifact Suppression in CBCT-to-MDCT Translation via Schrödinger Bridge with Conditional Diffusion

تقترح هذه الورقة إطار عمل جديدًا موجهًا بشريًا لترجمة التصوير المقطعي المحوسب بالحزمة المخروطية (CBCT) إلى التصوير المقطعي المحوسب بكثافة متعددة (MDCT)، والذي يستفيد من صياغة جسر شرودنغر مع الانتشار الشرطي والتوجيه الخالي من المصنف لتثبيط عيوب التظليل بفعالية مع الحفاظ على الدقة التشريحية والمواءمة مع التفضيلات السريرية من خلال التغذية الراجعة البشرية المتكررة.

Sung Ho Kang, Hyun-Cheol Park2026-02-27
🤖 machine learning

Is Exchangeability better than I.I.D to handle Data Distribution Shifts while Pooling Data for Data-scarce Medical image segmentation?

تتناول هذه الورقة "معضلة إضافة البيانات" في تقسيم الصور الطبية من خلال اقتراح إطار عمل قائم على التبادلية يتحكم في التباينات بين سمات المقدمة والخلفية عبر طبقات الشبكة العميقة، محققاً أداءً هو الأفضل حالياً على خمس مجموعات بيانات بما في ذلك مجموعة صور موجات فوق صوتية منسقة وجديدة.

Ayush Roy, Samin Enam, Jun Xia, Won Hwa Kim, Vishnu Suresh Lokhande2026-02-27
🤖 AI

LayerT2V: A Unified Multi-Layer Video Generation Framework

يُعد LayerT2V إطار عمل موحداً يولد فيديوهات متعددة الطبقات (بما في ذلك الخلفيات، والمقدمات، والأقنعة الشفافة "alpha mattes") متسقة دلالياً وقابلة للتعديل في تمريرة استدلال واحدة، وذلك عبر الاستففادة من التسلسل الزمني داخل هيكل DiT مشترك، مدعوماً بمجموعة بيانات VidLayer الجديدة واسعة النطاق.

Guangzhao Li, Kangrui Cen, Baixuan Zhao, Yi Xin, Siqi Luo, Guangtao Zhai, Lei Zhang, Xiaohong Liu2026-02-27
🤖 AI

Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP

تقدم هذه الورقة "Dyslexify"، وهي آلية دفاع لا تتطلب تدريباً تعمل على استئصال رؤوس انتباه محددة انتقائياً في مشفرات الرؤية لنموذج CLIP لتحييد الهجمات الطباعية، مما يحسن المتانة بشكل كبير ضد التلاعبات القائمة على النصوص مع الحفاظ على دقة التعرف القياسية.

Lorenz Hufe, Constantin Venhoff, Erblina Purelku, Maximilian Dreyer, Sebastian Lapuschkin, Wojciech Samek2026-02-27