🤖 AI

Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding

يُعد SAVEMem إطار عمل ثنائي المرحلة وخالٍ من التدريب، يعمل على تعزيز فهم الفيديو المتدفق عبر الإنترنت من خلال دمج البروز الدلالي في توليد الذاكرة واستخدام الاسترجاع المتكيف مع الاستعلام، مما يحسن الأداء بشكل كبير في اختبارات مثل OVO-Bench مع تقليل ذروة استخدام ذاكرة وحدة معالجة الرسومات.

Hang Wu, Sherin Mary Mathews, Yujun Cai, Ming-Hsuan Yang, Yiwei Wang2026-05-11
📊 statistics

Consistency Regularised Gradient Flows for Inverse Problems

تقترح هذه الورقة إطار عمل موحد لتدفق التدرج من نوع "Euclidean-Wasserstein-2" يقوم بشكل مشترك بعمليات أخذ عينات اللاحقة وتحسين المطالبات في الفضاء الكامن لنماذج الانتشار الكامنة للرؤية واللغة، مما يتيح جودة إعادة بناء هي الأفضل في مجالها للمشكلات العكسية بتكاليف حوسبة أقل بكثير وعدد أقل من تقييمات الدوال العصبية دون الحاجة إلى الانتشار العكسي عبر المشفرات التلقائية.

Alessio Spagnoletti, Tim Y. J. Wang, Marcelo Pereyra, O. Deniz Akyildiz2026-05-11
🤖 machine learning

Flatness and Gradient Alignment Are Both Necessary: Spectral-Aware Gradient-Aligned Exploration for Multi-Distribution Learning

تُثبت هذه الورقة أن كلاً من تسطح مشهد الخسارة ومحاذاة التدرج ضروريان بنيوياً لتقليل المخاطر الزائدة في التعلم متعدد التوزيعات، مما أدى إلى اقتراح SAGE، وهي طريقة مبتكرة تعمل على تحسين هاتين الخاصيتين في آن واحد عبر الاضطرابات المدركة طيفياً وحقن الضوضاء متناحية الخواص لتحقيق أداء رائد في تعميم النطاق والتعلم متعدد المهام.

Aristotelis Ballas, Christos Diou2026-05-11
🤖 AI

TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning

تقدم هذه الورقة TAVIS، وهو معيار شامل وبنية تحتية للتقييم لتعلم التقليد بالرؤية النشطة، يتميز بمجموعات مهام متنوعة، ومنصات مجسدة، ومقاييس مبتكرة مثل "زمن استباق النظرة للفعل" (Gaze-Action Lead Time) للقياس المنهجي لفوائد وقيود النظرة الاستباقية في المعالجة الروبوتية.

Giacomo Spigler2026-05-11
🤖 machine learning

DVD: Discrete Voxel Diffusion for 3D Generation and Editing

تقدم هذه الورقة البحثية نموذج الانتشار الفوكسلي المنفصل (DVD)، وهو إطار عمل يعامل الإشغال الفوكسلي كمتغير منفصل أصيل لتمكين التوليد الفعال، وتقدير عدم اليقين، والتحرير في جولة واحدة للسقالات الفوكسلية المتفرقة ضمن مسارات العمل ثلاثية الأبعاد دون الحاجة إلى عتبة التحويل من المستمر إلى المنفصل.

Zhengrui Xiang, Jiaqi Wu, Fupeng Sun, Heliang Zheng, Yingzhen Li2026-05-11
⚡ electrical engineering

Uncertainty Quantification for Cardiac Shape Reconstruction with Deep Signed Distance Functions via MCMC methods

تقترح هذه الورقة إطاراً احتمالياً يجمع بين دوال المسافة الموقعة العميقة وأخذ عينات ماركوف تشين مونت كارلو لتمكين إعادة بناء دقيقة وشاملة لليقين لشكل القلب من بيانات متفرقة أو مشوشة، مما يعزز الموثوقية السريرية.

Jan Verhülsdonk, Thomas Grandits, Francisco Sahli Costabal, Thomas Beiert, Simone Pezzuto, Alexander Effland2026-05-11
🤖 AI

Multi-Modality Distillation via Learning the teacher's modality-level Gram Matrix

تقترح هذه الورقة إطار عمل جديد لتقطير المعرفة متعدد الوسائط يعمل على سد الفجوة بين شبكتي المعلم والطالب من خلال إجبار الطالب على تعلم مصفوفة "جرام" (Gram Matrix) الخاصة بالمعلم على مستوى الوسائط، مما يتيح التقاط معلومات العلاقات الجوهرية بين الوسائط بدلاً من مجرد المخرجات النهائية.

Peng Liu2026-05-08
💻 computer science

LiCamPose: Combining Multi-View LiDAR and RGB Cameras for Robust Single-timestamp 3D Human Pose Estimation

تقدم هذه الورقة LiCamPose، وهو مسار عمل لتقدير وضعية جسم الإنسان ثلاثي الأبعاد في زمن أحادي الطابع يتسم بالمتانة، يقوم بدمج بيانات RGB متعددة المشاهد وبيانات ليدار (LiDAR) متفرقة باستخدام بنية حجمية، مستفيداً من مولد بيانات اصطناعية وتكيف النطاق غير الخاضع للإشراف لتحقيق تعميم قوي عبر سيناريوهات متنوعة دون الحاجة إلى تعليقات توضيحية يدوية ثلاثية الأبعاد.

Zhiyu Pan, Zhicheng Zhong, Wenxuan Guo, Yifan Chen, Jianjiang Feng, Jie Zhou2026-05-08
⚡ electrical engineering

Estimating Earthquake Magnitude in Sentinel-1 Imagery via Ranking

تقترح هذه المقالة نهجاً لتعلم المقاييس يدمج التصنيفات الزوجية لتحسين تقدير أقدار الزلازل من صور القمر الصناعي "سنتينل-1"، محققةً انخفاضاً في متوسط الخطأ المطلق بنسبة تزيد عن 30% مقارنة بطرق الانحدار الصرفة التقليدية، لا سيما في النماذج القائمة على بنيات المحولات (Transformer).

Daniele Rege Cambrin, Isaac Corley, Paolo Garza, Peyman Najafirad2026-05-08
⚡ electrical engineering

A Wavelet Diffusion GAN for Image Super-Resolution

تقترح هذه الورقة البحثية نموذج "وايديجان" (WaDiGAN)، وهو نموذج انتشار شرطي قائم على المويجات (wavelet-based conditional diffusion model) يعمل على تسريع عملية التدريب والاستنتاج بشكل كبير لعملية تعلية دقة الصورة الواحدة (single-image super-resolution) مع الحفاظ على مخرجات عالية الدقة، مما يعالج بفعالية قيود السرعة التي تواجهها نماذج الانتشار التقليدية.

Lorenzo Aloisi, Luigi Sigillo, Aurelio Uncini, Danilo Comminiello2026-05-08