💻 computer science

Shot-Aware Frame Sampling for Video Understanding

تقدم الورقة البحثية InfoShot، وهو أسلوب لأخذ عينات من الإطارات يعتمد على الوعي باللقطات وغير مرتبط بمهمة محددة، يقوم باختيار إطارات رئيسية متكاملة بناءً على هدف نظري معلوماتي للحفاظ على سياق الفيديو العام والأحداث الحرجة قصيرة الأمد من أجل فهم فعال للفيديوهات الطويلة، إلى جانب معيار مرجعي اصطناعي جديد، SynFlash، لتقييم مثل هذه الشذوذات.

Mengyu Zhao, Di Fu, Yongyu Xie, Jiaxing Zhang, Zhigang Yuan, Shirin Jalali, Yong Cao2026-03-19
💻 computer science

Toward Phonology-Guided Sign Language Motion Generation: A Diffusion Baseline and Conditioning Analysis

تقترح هذه الورقة نموذجاً مرجعياً قائماً على الانتشار لتوليد حركات لغة الإشارة ثلاثية الأبعاد يتفوق على الأساليب الرائدة من خلال التحليل المنهجي لكيفية تأثير مشفرات النصوص واستراتيجيات تكييف السمات الفونولوجية، ولا سيما ترجمة التوصيفات الرمزية إلى لغة طبيعية، على جودة التوليد.

Rui Hong, Jana Kosecka2026-03-19
💻 computer science

Gesture-Aware Pretraining and Token Fusion for 3D Hand Pose Estimation

تقترح هذه الورقة إطار عمل ثنائي المراحل يستفيد من دلالات الإيماءات كتحيز استقرائي من خلال التدريب المسبق المدرك للإيماءات ودمج الرموز لتحسين دقة تقدير وضعية اليد ثلاثية الأبعاد من الصور أحادية اللون (RGB) بشكل كبير.

Rui Hong, Jana Kosecka2026-03-19
💻 computer science

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

تقترح الورقة البحثية إطار عمل AR-CoPO، وهو إطار عمل مبتكر يعمل على تكييف تحسين السياسة التباينية مع توليد الفيديو التوليفي المتدفق من خلال إدخال التفرع على مستوى القطعة والتدريب شبه المعتمد على السياسة للتغلب على قيود أساليب التعلم المعزز من التغذية الراجعة البشرية الحالية، مما يحقق محاذاة وتعميماً فائقين دون حدوث اختراق للمكافأة.

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li2026-03-19
🤖 AI

Revisiting Cross-Attention Mechanisms: Leveraging Beneficial Noise for Domain-Adaptive Learning

تقترح هذه الورقة إطار عمل المطابقة عبر المقاييس المتكيف مع النطاق (DACSM)، والذي يستفيد من آلية "الضجيج المفيد" المبتكرة ضمن الانتباه المتقاطع لفصل المحتوى عن الأسلوب ومحاذاة الميزات عبر المقاييس، محققاً أداءً هو الأفضل في فئته في مهام التكيف مع النطاق غير الخاضعة للإشراف.

Zelin Zang, Yehui Yang, Fei Wang, Liangyu Li, Baigui Sun2026-03-19
💬 NLP

UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models

تقدم هذه الورقة البحثية UniSAFE، وهو أول معيار شامل مصمم لتقييم مخاطر السلامة على مستوى النظام عبر 7 تركيبات من الأنماط في النماذج متعددة الوسائط الموحدة، مما يكشف عن ثغرات أمنية حرجة في مهام الصور المتعددة وتوليد الصور بين 15 نموذجاً من أحدث النماذج المتطورة.

Segyu Lee, Boryeong Cho, Hojung Jung, Seokhyun An, Juhyeong Kim, Jaehyun Kwak, Yongjin Yang, Sangwon Jang, Youngrok Park (…)2026-03-19
🤖 AI

AdapTS: Lightweight Teacher-Student Approach for Multi-Class and Continual Visual Anomaly Detection

يُعد AdaTS إطار عمل موحداً وخفيف الوزن يعتمد على نموذج (المعلم-الطالب)، وهو يعالج تحديات اكتشاف الشذوذ البصري متعدد الفئات والمستمر من خلال استخدام عمود فقري مشترك ومجمد مع محولات ديناميكية مختارة بالنماذج الأولية، محققاً أداءً رائدًا مع تقليل عبء الذاكرة بشكل كبير من أجل النشر الفعال على الحافة.

Manuel Barusco, Davide Dalle Pezze, Francesco Borsatti, Gian Antonio Susto2026-03-19
💻 computer science

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

تكشف هذه الورقة أنه في حين أن عملية الضبط الدقيق للنماذج اللغوية الكبيرة متعددة الوسائط عبر الفيديو (Video-SFT) تعزز باستمرار الفهم الزمني، إلا أنها غالباً ما تضعف القدرات المكانية على الصور الثابتة، وهي مقايضة يمكن التخفيف من حدتها جزئياً من خلال استراتيجية الإطارات الهجينة المدركة للتعليمات.

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqia (…)2026-03-19
🤖 AI

FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion

تُعد FrescoDiffusion طريقةً لا تتطلب تدريباً تُمكّن من توليد فيديو من صورة بدقة 4K بشكل متماسك من مدخلات معقدة، وذلك عبر دمج تنبؤات إزالة الضجيج لكل بلاطة (per-tile) مع مسبق سابق لـ "اللا-تجسيد" (latent prior) منخفض الدقة تم حسابه مسبقاً من خلال هدف المربعات الصغرى الموزونة ذي الصيغة المغلقة، مما يحافظ على كل من التفاصيل المحلية الدقيقة والاتساق المكاني-الزماني العالمي.

Hugo Caselles-Dupré, Mathis Koroglu, Guillaume Jeanneret, Arnaud Dapogny, Matthieu Cord2026-03-19
💻 computer science

Face anonymization preserving facial expressions and photometric realism

تقترح هذه الورقة إطار عمل لإخفاء هوية الوجه مع الحفاظ على الملامح، والذي يوسع نموذج DeepPrivacy عبر دمج معالم كثيفة ونماذج معالجة لاحقة لإنتاج صور واقعية تخفي الهوية بفعالية مع الحفاظ على دقة عالية في تعبيرات الوجه والإضاءة ولون البشرة، مما يعالج فجوة حرجة في الأساليب الحالية للحفاظ على الخصوصية.

Luigi Celona, Simone Bianco, Raimondo Schettini2026-03-19