🤖 machine learning

MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization

يُعد MGVQ إطار عمل جديد للكمية المتجهة لنماذج الرؤية واللغة، يتغلب على عدم تطابق التوزيع عبر الوسائط وانجراف التدرج من خلال دمج التكميم متعدد الدقة الموجه بالحساسية مع تعويض الخطأ من الدرجة الثانية المدرك للتدرج، محققاً أداءً هو الأفضل في فئته في إعدادات البتات شديدة الانخفاض.

Zhong Wang, Zukang Xu, Xing Hu, Dawei Yang2026-05-26
💻 computer science

Soft Tuy-Completeness for Robust Projection Selection in Cone-Beam CT

تقدم هذه الورقة إطار عمل قابلاً للتفاضل، يعتمد على اكتمال "توي" (Tuy's completeness)، لاختيار الإسقاطات القوية في التصوير المقطعي بالحزمة المخروطية، والذي يجمع بين خوارزمية جشعة تحت-نمطية (submodular greedy algorithm) وبرنامج خطي مختلط الأعداد الصحيحة لتحقيق تغطية شبه مثالية، ومقياساً جديداً لـ "دقة المكان الفعالة" للتنبؤ بجودة إعادة البناء دون إجراء عملية إعادة البناء نفسها.

Linda-Sophie Schneider, Andreas Maier2026-05-26
💻 computer science

Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating

تقترح هذه الورقة تدخلاً لا يتطلب تدريباً يسمى "بوابة المسار السببي" (Causal Route Gating) يعمل على التخفيف من الهلوسة في النماذج اللغوية البصرية الكبيرة عن طريق تفكيك رؤوس الانتباه إلى مسارات بصرية ونصية لتثبيط المسارات المهيمنة نصياً بشكل انتقائي مع الحفاظ على الأدلة البصرية.

Zhe Cheng, Wenyu Chen, Fode Zhang, Dehuan Shen2026-05-26
🤖 AI

Mode-as-Sequence: Translating Multimodal Motion Prediction into Unified Sequential Mode Modeling

تقترح الورقة البحثية إطار عمل موحداً بعنوان "النمط كمتتالية" (Mode-as-Sequence)، يقوم بتحويل تنبؤات الحركة متعددة الوسائط غير المرتبة إلى متتالية مرتبة لنمذجة تبعيات الأنماط بشكل صريح، مما يعالج مشكلات انهيار النمط ومعايرة الثقة من خلال استراتيجيات فك تشفير متكررة أو متوازية حققت مراتب متقدمة في تحديات مجموعة بيانات وايمو (Waymo Open Dataset).

Zikang Zhou, Haibo Hu, Xinhong Chen, Yifan Zhang, Nan Guan, Yung-Hui Li, Chun Jason Xue, Jianping Wang2026-05-26
💻 computer science

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

تقدم هذه الورقة البحثية D2-V2X، وهو معيار ونموذج مرجعي مدرك مكانيًا يستفيد من بيانات ليدار (LiDAR) التعاونية لتعزيز قدرة أنظمة القيادة الذاتية بشكل كبير على التفكير في المخاطر المحجوبة وتقليل أخطاء التقدير المكاني من خلال مسوغات تسلسل الأفكار باللغة الطبيعية.

Kevin Richard, Alphin Varghese, Colin Pham, David Oh, Srijan Das2026-05-26
💻 computer science

Loki: Representation over Architecture for Diffusion-Based Portrait Animation

يقدم Loki إطار عمل جديد للرسوم المتحركة للصور الشخصية يعتمد على الانتشار، يستبدل التكييف القائم على RGB بنموذج وجه بارامتري متعامد الهوية وحقن مفتاح-قيمة خفيف الوزن، محققاً تحكماً فائقاً في الوضعية والتعبير مع عدد أقل بكثير من المعلمات وبيانات التدريب مع تمكين إعادة التمثيل عبر الهويات (cross-ID) دون تدريب مسبق.

Pouyan Navard, Sernam Lim2026-05-26
🤖 machine learning

Single View Seafloor Recovery from Imaging Sonar via Differentiable Rendering

تقدم هذه الورقة طريقة رندرة قابلة للتفاضل وخالية من التدريب، تستعيد تضاريس قاع البحر ثلاثية الأبعاد من صورة واحدة لسونار أمامي في أقل من 30 ثانية عن طريق تحسين حقل ارتفاع صريح ليتطابق مع الصورة المستهدفة، مما يوفر قدرة فائقة على التكيف عبر البيئات المختلفة مقارنة بنهج التعلم الخاضع للإشراف.

Sevan Brodjian, Michael Hobley, Pietro Perona2026-05-26
💻 computer science

GIBLy: Improving 3D Semantic Segmentation through an Architecture-Agnostic Lightweight Geometric Inductive Bias Layer

تقدم الورقة البحثية GIBLy، وهي طبقة خفيفة الوزن ومستقلة عن البنية الهندسية، تدمج الأولويات الهندسية القابلة للتعلم في نماذج التجزئة ثلاثية الأبعاد لتحسين الأداء والقدرة على التعميم بشكل كبير مع حد أدنى من العبء الحسابي.

Diogo Lavado, Alessandra Micheletti, Clàudia Soares2026-05-26
💻 computer science

Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions

تقدم هذه الورقة معياراً شاملاً للكشف المستمر عن الشذوذ في ظل قيود الحافة الصناعية الواقعية، مما يكشف عن محدودية الأساليب الحالية ويقترح DINOSaur، وهو نهج خالٍ من التدريب يحقق انعدام النسيان، وأداءً فائقاً عبر جميع البروتوكولات، واستنتاجاً فورياً فعالاً على أجهزة الحافة.

Chad Weatherly, Sen Lin2026-05-26
💻 computer science

Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies

تقترح هذه الورقة بنية عابرة للأنماط قائمة على نموذج Mamba للتعرف على الأفعال من منظور الشخص الأول، والتي تدمج بيانات الفيديو (RGB) وهيكل اليد، مظهرةً أن استراتيجية خلط رمز CLS المتوسط يتفوق بشكل كبير على النماذج أحادية النمط على مجموعة بيانات H2O.

Juan Ignacio Bustos Gorostegui, Maria Elena Buemi2026-05-26