💻 computer science

PrivHAR-Bench: A Graduated Privacy Benchmark Dataset for Video-Based Action Recognition

تقدم هذه الورقة PrivHAR-Bench، وهو عبارة عن مجموعة بيانات معيارية متعددة المستويات ومتدرجة وأدوات تقييم مصممة لتوحيد عملية تقييم المقايضة بين الخصوصية والمنفعة في التعرف على الأنشطة البشرية القائم على الفيديو، وذلك من خلال تطبيق طيف من تحويلات الخصوصية البصرية على مجموعة متنوعة من فيديوهات الحركة.

Samar Ansari2026-04-02
🤖 machine learning

Multimodal Language Models Cannot Spot Spatial Inconsistencies

تقدم هذه الورقة معياراً جديداً لتقييم اتساق الحركة ثلاثية الأبعاد في النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) من خلال توليد أزواج صور غير متسقة مكانياً، مما يكشف أن النماذج الحالية المتطورة تؤدي بشكل أقل بكثير من البشر وتفتقر إلى فهم قوي للبنية الفيزيائية ثلاثية الأبعاد.

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash2026-04-02
💻 computer science

Compact Keyframe-Optimized Multi-Agent Gaussian Splatting SLAM

تقدم هذه الورقة إطار عمل للتعرف على الموقع ورسم الخرائط (SLAM) متعدد الوكلاء يعتمد على تقنية "Gaussian Splatting" ومُحسَّن عبر الإطارات المفتاحية، مما يقلل بشكل كبير من عرض نطاق الاتصال من خلال إزالة عناصر "3D Gaussians" الزائدة وإجراء إغلاق حلقي مركزي دون تخمينات أولية، محققاً انخفاضاً بنسبة 85-95% في البيانات المرسلة مع الحفاظ على دقة الخريطة من أجل النشر في العالم الحقيقي.

Monica M. Q. Li, Pierre-Yves Lajoie, Jialiang Liu, Giovanni Beltrame2026-04-02
💻 computer science

Video Patch Pruning: Efficient Video Instance Segmentation via Early Token Reduction

تقدم هذه الورقة تقنية "تقليم رقع الفيديو" (Video Patch Pruning - VPP)، وهي إطار عمل مبتكر يستفيد من المعرفة المسبقة الزمنية ووحدة تعيين قابلة للتفاضل لتمكين تقليل الرموز في الطبقات المبكرة بكفاءة في نماذج المحولات الرؤيوية (Vision Transformers)، محققةً ما يصل إلى 60% من تخلخل الرقع مع حد أدنى من فقدان الأداء في مهام تقسيم مثيل الفيديو.

Patrick Glandorf, Thomas Norrenbrock, Bodo Rosenhahn2026-04-02
💻 computer science

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

تقدم هذه الورقة البحثية MotionGrounder، وهو إطار عمل قائم على محول الانتشار (Diffusion Transformer)، يتيح نقل حركة متعددة الكائنات بشكل قابل للتحكم في توليد الفيديو من خلال استخدام إشارة حركة قائمة على التدفق (Flow-based Motion Signal) لضمان استقرار أولويات الحركة، وفقدان محاذاة وصف الكائن (Object-Caption Alignment Loss) لربط أوصاف الكائنات بمناطقها المكانية، متفوقاً بذلك على الأساليب الحالية المخصصة لكائن واحد عبر مختلف التقييمات.

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim2026-04-02
💻 computer science

Shape Representation using Gaussian Process mixture models

تقترح هذه الورقة تمثيلاً شكلياً وظيفياً خفيف الوزن وخاصاً بالأجسام، يستخدم نماذج الخليط للعمليات الغاوسية لتعلم حقول مسافة اتجاهية مستمرة من سحب النقاط المتفرقة، مما يوفر بديلاً مدمجاً وفعالاً للتمثيلات ثلاثية الأبعاد الصريحة التقليدية مثل المشبكات وسحب النقاط.

Panagiotis Sapoutzoglou, George Terzakis, Georgios Floros, Maria Pateraki2026-04-02
💻 computer science

A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video

تقترح هذه الورقة إطار عمل لا يتطلب تدريباً يزود النماذج اللغوية الكبيرة متعددة الوسائط بتمثيلات مكانية زمانية صريحة رباعية الأبعاد مستمدة من فيديوهات جراحية أحادية العدسة، مما يعزز بشكل كبير قدرات الاستدلال والربط الوكيل في جراحة الأنسجة الرخوة دون الحاجة إلى ضبط دقيق إضافي.

Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmote (…)2026-04-02
🤖 AI

PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding

تُعد PixelPrune طريقةً لتقليل الرموز (tokens) على مستوى البكسل وتكيفيةً ولا تتطلب تدريباً، حيث تستفيد من الترميز التنبؤي لإزالة رقع الصور الزائدة قبل مُشفر المحول الرؤيوي (Vision Transformer)، مما يسرع بشكل كبير عمليات التدريب والاستدلال لنماذج الرؤية واللغة مع الحفاظ على دقة تنافسية في اختبارات قياس المستندات وواجهات المستخدم الرسومية (GUI).

Nan Wang, Zhiwei Jin, Chen Chen, Haonan Lu2026-04-02
🤖 machine learning

Super-Resolving Coarse-Resolution Weather Forecasts With Flow Matching

تقدم هذه الورقة إطار عمل لمطابقة التدفق (flow matching) نمطيًا يولد بكفاءة تنبؤات جوية عالية الدقة من خلال تطبيق عملية تعزيز دقة عشوائية متعلمة كخطوة معالجة لاحقة للتنبؤات ذات الدقة المنخفضة، مما يحافظ على الهياكل واسعة النطاق مع إدخال تباين في المقاييس الصغيرة متسق فيزيائيًا بتكاليف حوسبة أقل بكثير من النمذجة عالية الدقة من البداية إلى النهاية.

Aymeric Delefosse, Anastase Charantonis, Dominique Béréziat2026-04-02
🤖 AI

Representation Selection via Cross-Model Agreement using Canonical Correlation Analysis

تقترح هذه الورقة طريقة لاحقة (post-hoc) وخالية من التدريب تستخدم تحليل الارتباط الكنسي (CCA) للاستفضاء من الاتفاق بين النموذجين عبر مشفرات الصور المدربة مسبقاً، مما يساهم بفعالية في اختيار واستخلاص المحتوى الدلالي المشترك لتقليل الأبعاد بنسبة تزيد عن 75% مع تحسين الأداء في المهام اللاحقة.

Dylan B. Lewis, Jens Gregor, Hector Santos-Villalobos2026-04-02