🤖 machine learning

Recent Advances in Multi-Agent Human Trajectory Prediction: A Comprehensive Review

تقدم هذه الدراسة مراجعة شاملة للتطورات الأخيرة القائمة على التعلم العميق في التنبؤ بمسارات البشر متعددة الوكلاء من عام 2020 إلى عام 2025، حيث تصنف الأساليب حسب البنية والتمثيل والاستراتيجية مع تحديد التحديات الرئيسية واتجاهات البحث المستقبلية.

Céline Finet, Stephane Da Silva Martins, Jean-Bernard Hayet, Ioannis Karamouzas, Javad Amirian, Sylvie Le Hégarat-Mascle (…)2026-04-27
🤖 AI

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

تقدم هذه الورقة البحثية تقنية "المطابقة عند وقت الاختبار" (TTM)، وهي خوارزمية تكرارية ذاتية التحسين تعمل على تصحيح عيوب التقييم من خلال درجة مطابقة مجموعات مبتكرة، وتعزز بشكل كبير قدرات الاستدلال التركيبي في النماذج متعددة الوسائط، مما يمكنها من تجاوز النتائج السابقة المتفوقة والأداء البشري المقدر في المعايير الرئيسية.

Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang2026-04-27
💻 computer science

Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?

تُثبت هذه الورقة أن نماذج الفيديو ذاتية الانحدار الكبيرة يمكن أن تُظهر قدرات مذهلة في التعلم الصفري في مجال التصوير الطبي، حيث تؤدي بشكل تنافسي في مهام مثل تقسيم الأعضاء، وإزالة الضجيج، وتحسين الدقة، بل وتحقق دقة هي الأفضل في حالتها في التنبؤ بحركة الأشعة المقطعية رباعية الأبعاد دون أن يتم تدريبها مسبقاً على أي بيانات طبية.

Yuxiang Lai, Jike Zhong, Ming Li, Yuheng Li, Xiaofeng Yang2026-04-27
🤖 AI

OREN: Octree Residual Network for Real-Time Euclidean Signed Distance Mapping

تُعد OREN طريقة إعادة بناء هجينة تجمع بين الاستيفاء الشجري الثماني (octree interpolation) والانحدار عبر الشبكة العصبية لتحقيق رسم خرائط دالة المسافة الإقليدية الموقعة (ESDF) غير المقتطعة، والفعالة، والقابلة للتوسع، والقابلة للاشتقاق من السحب النقطية.

Zhirui Dai, Qihao Qian, Tianxing Fan, Nikolay Atanasov2026-04-27
⚡ electrical engineering

Extremal Contours: Gradient-driven contours for compact visual attribution

تقدم هذه الورقة "الكنتورات القصوى" (Extremal Contours)، وهي طريقة تفسير لا تتطلب تدريباً تستبدل الأقنعة الكثيفة المتجزئة بكنتورات ناعمة ومحدبة نجمياً يتم تحسينها عبر تدرجات المصنف لإنتاج عزويات بصرية مدمجة ومستقرة وأمينة لنماذج الرؤية.

Reza Karimzadeh, Albert Alonso, Frans Zdyb, Julius B. Kirkegaard, Bulat Ibragimov2026-04-27
💻 computer science

3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale

يُعد 3DAlign-DAER إطار عمل موحداً يعزز المحاذاة الدقيقة بين النصوص والنماذج ثلاثية الأبعاد من خلال سياسة انتباه ديناميكية مُحسّنة بواسطة بحث شجرة مونت كارلو واستراتيجية استرجاع هرمية فعالة، مدعوماً بمجموعة بيانات Align3D-2M الضخمة التي تم إنشاؤها حديثاً.

Yijia Fan, Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Keze Wang2026-04-27
💻 computer science

Adapting MLLMs for Nuanced Video Retrieval

تقترح هذه الورقة إعادة توظيف نموذج لغوي كبير متعدد الوسائط (MLLM) مولد للنصوص وتحويله إلى نموذج تضمين موحد من خلال الضبط الدقيق التبايني المقتصر على النصوص مع استخدام سلبيات صعبة، مما يحقق أداءً هو الأفضل في مهام استرجاع الفيديو الدقيقة التي تتضمن تعقيدات زمنية، ونفيًا، وتعدد الوسائط.

Piyush Bagad, Andrew Zisserman2026-04-27
💻 computer science

Soft Anisotropic Diagrams for Differentiable Image Representation

تُعد المخططات متباينة الخواص الناعمة (SAD) تمثيلاً صورياً جديداً قابلاً للتفاضل، يستخدم تقسيمات فورونوي تكيفية ومتباينة الخواص وذات أوزان إضافية لتحقيق ضغط فائق، وسرعات تدريب أسرع، وعرض فعال مقارنة بالطرق الحالية المتطورة.

Laki Iinbor, Zhiyang Dou, Wojciech Matusik2026-04-27
🤖 machine learning

LTBs-KAN: Linear-Time B-splines Kolmogorov-Arnold Networks

يقدم LTB-KAN بنية شبكة كولموغوروف-أرنولد (Kolmogorov-Arnold Network) مبتكرة تحقق تعقيداً زمنياً خطياً وتقليلاً في أعداد المعلمات من خلال استبدال حسابات B-spline المكثفة بنهج base-spline أكثر كفاءة واستخدام تحليل مصفوفة حاصل الضرب لمجموع العناصر (product-of-sums matrix factorization).

Eduardo Said Merin-Martinez, Andres Mendez-Vazquez, Eduardo Rodriguez-Tello2026-04-27
🤖 AI

EgoMAGIC- An Egocentric Video Field Medicine Dataset for Training Perception Algorithms

تقدم هذه الورقة البحثية EgoMAGIC، وهو عبارة عن مجموعة بيانات فيديو طبي من منظور الشخص الأول واسعة النطاق، صُممت لدعم تطوير المساعدين الافتراضيين المتكاملين مع الواقع المعزز من خلال مهام مثل اكتشاف الأفعال، وتحديد الأشياء، وتصحيح الأخطاء.

Brian VanVoorst, Nicholas Walczak, Christopher Gilleo, Charles Meissner, Fabio Felix, Iran Roman, Bea Steers, Claudio Si (…)2026-04-27