💻 computer science

PushupBench: Your VLM is not good at counting pushups

تقدم الورقة البحثية **PushupBench**، وهي مجموعة بيانات فيديو طويلة جديدة مصممة لتقييم عد التكرارات في نماذج الرؤية واللغة (VLMs)، والتي تكشف أن النماذج الحالية تعاني في الاستنتاج الزمني ولكن يمكنها التحسن في فهم الفيديو العام من خلال الضبط الدقيق القائم على العد.

Shengzhi Li, Jiarun Chen, Karun Sharma, Jiaqi Su, Shichao Pei2026-04-28
💻 computer science

A Heterogeneous Two-Stream Framework for Video Action Recognition with Comparative Fusion Analysis

تقترح الورقة البحثية إطار عمل **DualStreamHybrid**، وهو إطار عمل ثنائي المسار غير متجانس يستخدم نماذج خلفية متخصصة لكل من صور RGB والتدفق البصري (ViT-Tiny وMobileNetV2 على التوالي)، وتُظهر أن استراتيجية الدمج المثلى للتعرف على الأفعال في الفيديو تختلف باختلاف حجم وتعقيد مجموعة البيانات.

Md. Afzalur Rahaman, Tahmid Rahman2026-04-28
💻 computer science

Sphere-Depth: A Benchmark for Depth Estimation Methods with Varying Spherical Camera Orientations

تقدم هذه الورقة البحثية Sphere-Depth، وهو معيار مرجعي جديد صُمم لتقييم متانة نماذج تقدير العمق أحادي العدسة للصور المستطيلة المتساوية (equirectangular) ضد التغيرات غير المقصودة في وضعية الكاميرا، مما يكشف أن حتى النماذج المدركة للمجال الكروي تعاني من تدهور كبير في الأداء عند مواجهة مثل هذه الاضطرابات.

Soulayma Gazzeh, Giuseppe Mazzola, Liliana Lo Presti, Marco La Cascia2026-04-28
🤖 machine learning

Leveraging Spatial Transcriptomics as Alternative to Manual Annotations for Deep Learning-Based Nuclei Analysis

تقترح هذه الورقة إطار عمل يستخدم بيانات النسخ المكاني لتوليد تسميات لأنواع الخلايا وأقنعة نووية تلقائياً، مما يوفر بديلاً قابلاً للتوسع لعمليات التوسيم اليدوي المكلفة لتدريب نماذج التعلم العميق في تقسيم وتصنيف النوى.

Kazuya Nishimura, Ryoma Bise, Haruka Hirose, Yasuhiro Kojima2026-04-28
💻 computer science

AusSmoke meets MultiNatSmoke: a fully-labelled diverse smoke segmentation dataset

لمعالجة أوجه القصور في مجموعات بيانات دخان حرائق الغابات الحالية، تقدم هذه الورقة البحثية **AusSmoke**، وهي مجموعة بيانات جديدة تعتمد على أستراليا، و**MultiNatSmoke**، وهي معيار دولي أكبر بكثير، ومتنوع جغرافياً، ومصنف بالكامل، صُمم لتحسين قدرة نماذج تقسيم الدخان المدعومة بالذكاء الاصطناعي على التعميم.

Weihao Li, Hongjin Zhao, Gao Zhu, Ge-Peng Ji, Nicholas Wilson, Marta Yebra, Nick Barnes2026-04-28
💻 computer science

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

يُعد PhysLayer إطار عمل مبتكر يتيح تحريك الصور بشكل واقعي وموجه لغوياً عبر تفكيك المشاهد إلى طبقات قائمة على العمق وتطبيق محاكاة فيزيائية مدركة للعمق لتوليد حركة متماسكة زمنياً ومنطقية فيزيائياً دون الحاجة إلى إعادة بناء ثلاثية الأبعاد كاملة.

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi2026-04-28
⚡ electrical engineering

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

يُعد Talker-T2AV إطار عمل انتشار ذاتي الانحدار لتوليد الصوت والفيديو بشكل مشترك، وهو يحقق تماسكاً وكفاءة فائقتين عبر الوسائط من خلال استخدام عمود فقري مشترك للاستدلال الدلالي عالي المستوى وفك تشفير خاص بكل وسيط للتحسين منخفض المستوى.

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, W (…)2026-04-28
💻 computer science

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

تقدم الورقة البحثية Hallo-Live، وهو إطار عمل للبث المباشر في الوقت الفعلي لتوليد الصور الرمزية (Avatar) المشتركة للصوت والفيديو، والذي يحقق أداءً عالي السرعة ومنخفض التأخير من خلال الانتشار ثنائي المسار غير المتزامن باستخدام "انتباه التوسع المستقبلي" (Future-Expanding Attention) و"نموذج التوزيع الموجه بالتفضيل المتمحور حول الإنسان" (Human-Centric Preference-Guided DMD)، متفوقاً بشكل كبير على النماذج الحالية في كل من الكفاءة وجودة التوليد.

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu2026-04-28
💻 computer science

VDLF-Net: Variational Feature Fusion for Adaptive and Few-Shot Visual Learning

تُعد VDLF-Net بنية مبتكرة تدمج مشفرًا تلقائيًا تباينيًا مدمجًا مع عمود فقري لشبكة عصبية تلافيفية متعدد المقاييس وآلية دمج ميزات ذات بوابات "softmax" لتحقيق أداء فائق في كل من مهام التصنيف الخاضع للإشراف والتعلم من عينات قليلة على معايير CIFAR-100 وMini-ImageNet.

Jiawei Yan2026-04-28
💻 computer science

RaV-IDP: A Reconstruction-as-Validation Framework for Faithful Intelligent Document Processing

يُعد RaV-IDP إطار عمل مبتكر لمعالجة المستندات الذكية يضمن دقة الاستخراج من خلال إعادة بناء الكيانات المستخرجة إلى شكلها المرئي الأصلي لحساب درجة جودة قائمة على التأسيس وخالية من الملصقات، مما يؤدي إلى تفعيل آلية تراجع قائمة على الرؤية عند اكتشاف أي تباينات مع المستند المصدر.

Pritesh Jha2026-04-28