💻 computer science

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

تقدم الورقة البحثية HEED، وهي طريقة تقطير خالية من التدريب تستخدم محاذاة البواقي الموزونة بالكثافة لإعطاء الأولوية لقطع الصور ذات المعلومات العالية، مما يعالج الانخفاض الكبير في الأداء في مهام التعرف الضوئي على الحروف (OCR) والمهام المستندية الملحوظ عند تقطير النماذج الرؤية-اللغوية الكبيرة إلى بنيات هجينة فعالة، مع تحقيق دقة تضاهي دقة النموذج المعلم مع مكاسب كبيرة في الذاكرة والإنتاجية.

Yihao Liang, Niraj K. Jha2026-05-19
💻 computer science

Visual Timelines of Police Encounters in Body-Worn Camera Footage: Operational Context and Activity Cataloging for Training and Analysis in OpenBWC

تقدم هذه الورقة نظاماً يراعي الخصوصية يقوم بتحويل لقطات كاميرات الجسم إلى جداول زمنية مرئية من خلال تصنيف نوافذ مدتها 10 ثوانٍ للسياق العملياتي وكثافة الحركة، مما يسرع مراجعة الحوادث ويعزز سير عمل تدريب الضباط.

Angela Srbinovska, Christopher Homan, Adrian Martin, Ernest Fokoué2026-05-19
💻 computer science

A Systematic Survey on Deep Learning Architectures for Point Cloud Classification and Segmentation

تقدم هذه الورقة مسحاً منهجياً لبنيات التعلم العميق لتصنيف وتقسيم السحب النقطية ثلاثية الأبعاد، تغطي خصائص البيانات، والتصنيف المنهجي، وتقييمات المعايير المرجعية، واتجاهات البحث المستقبلية.

Minhas Kamal, Hiranya Garbha Kumar, Balakrishnan Prabhakaran2026-05-19
💻 computer science

CAM-VFD: Cross-Attention Multimodal Video Forgery Detection

يُعد CAM-VFD إطار عمل مبتكرًا متعدد الوسائط يعتمد على الانتباه المتقاطع، حيث يقوم بالكشف عن فيديوهات التزييف العميق من خلال نمذجة التناقضات بين الوسائط عبر سمات المظهر والحركة والعمق، محققًا بذلك دقة فائقة ومتانة ضد مختلف الاضطرابات في مجموعات البيانات المرجعية.

Hoda Osama Elkhodary, Sherin Mostafa Youssef, Marwa Elshenawy, Dalia Sobhy2026-05-19
💻 computer science

Collaborative Learning for Semi-Supervised LiDAR Semantic Segmentation

تقدم هذه الورقة CoLLiS، وهو إطار عمل للتعلم التعاوني يتدرب فيه عدة تمثيلات لبيانات ليدار (LiDAR) في آن واحد كطلاب متساوين لتخفيف حدة الانحياز التأكيدي وانتشار الخطأ في التجزئة الدلالية شبه المشرفة، محققاً بذلك أداءً هو الأفضل في فئته، لا سيما في أنظمة البيانات ذات الملصقات المحدودة.

Bin Yang, Alexandru Paul Condurache2026-05-19
💻 computer science

When Bits Break Recourse: Counterfactual-Faithful Quantization

تقدم هذه الورقة البحثية طريقة "الكمية المتوافقة مع الواقع المضاد" (CFQ)، وهي طريقة تحافظ على استقرار التراجع القابل للتنفيذ في النماذج ذات البتات المنخفضة من خلال تحسين تخصيص البتات ومعلمات المكمم للحفاظ على صلاحية وتكلفة الواقع المضاد، مما يعالج نمط فشل حرج حيث يؤدي التكميم القياسي إلى تدهور التراجع رغم الحفاظ على الدقة التنبؤية.

Chaymae Yahyati, Ismail Lamaakal, Khalid El Makkaoui, Ibrahim Ouahbi2026-05-19
💻 computer science

Factorized Latent Dynamics for Video JEPA: An Empirical Study of Auxiliary Objectives

تستقصي هذه الورقة تجريبيًا الأهداف المساعدة في تدريب نموذج Video-JEPA صغير النطاق، كاشفةً عن مقايضات سعة متأصلة عبر مختلف المهام اللاحقة، ومثبتةً أن طريقة FWM-HW-LD المقترحة، التي تُجزئ التمثيلات الكامنة إلى فضاءات فرعية للمظهر والديناميكيات مع وزن منطقة صلب، تُحسن بشكل كبير الأداء في معايير الاستدلال الزمني والمظهر مع الحفاظ على قدرات الحركة دقيقة التفاصيل.

Santosh Premi2026-05-19
💻 computer science

iMiGUE-3K: A Large-Scale Benchmark for Micro-Gesture Analysis with Self-Supervised Learning

تقدم هذه الورقة البحثية iMiGUE-3K، وهي أكبر مجموعة بيانات فيديو واسعة النطاق في البيئات الواقعية وتضم 3.4 ألف مقطع للاعبي تنس محترفين تتميز بـ 32 فئة من الإيماءات الدقيقة، وتقترح نموذج التأسيس MG-FMs للنهوض بفهم العواطف القائم على الإيماءات الدقيقة من خلال مهام تقييم شاملة.

Chengyan Wang, Haoyu Chen, Hui Wei, Yueyi Yang, Yunquan Chen, Guoying Zhao2026-05-19
💻 computer science

OPTNet: Ordering Point Transformer Network for Post-disaster 3D Semantic Segmentation

يقدم OPTNet وحدة فرز نقاط (Point Sorter) قابلة للتعلم تعمل على تحسين ترتيب النقاط ديناميكيًا عبر التعلم ذاتي الإشراف لتعزيز المحلية في آليات الانتباه، مما يحقق كفاءة ودقة فائقتين في التجزئة الدلالية ثلاثية الأبعاد لما بعد الكوارث مقارنة بطرق التسلسل الثابتة الحالية.

Nhut Le, Ehsan Karimi, Maryam Rahnemoonfar2026-05-19
💻 computer science

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

تقدم الورقة البحثية LiteFrame، وهو مشفر فيديو فعال تم تدريبه عبر تقنية "تقطير الرموز المضغوطة" (Compressed Token Distillation) لتجاوز المعالجة المكلفة لكل إطار، مما يمكّن نماذج الفيديو اللغوية الكبيرة (Video LLMs) من التعامل مع عدد أكبر بكثير من الإطارات مع تقليل زمن الاستجابة وتحسين دقة الفهم.

Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun, Bohyung Han, Ming-Hsuan Yang, Boqing Gong2026-05-19