💻 computer science

VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models

تقدم هذه الورقة إطار عمل لمكافحة إعادة الحساب بدون تدريب لنماذج الرؤية واللغة للفيديو، والذي يعيد استخدام الحالات البصرية المخزنة ديناميكياً للمشاهد والاستعلامات المستقرة، مما يقلل بشكل كبير من زمن انتقال الاستدلال والهدر الحسابي مع الحفاظ على دقة عالية عبر التفاعلات الفيديوية متعددة الأدوار.

JF Bastien, Sam D'Amico2026-05-06
💻 computer science

Dynamic Distillation and Gradient Consistency for Robust Long-Tailed Incremental Learning

تقترح هذه الورقة إطار عمل قوي للتعلم التزايدي للفئات ذات التوزيع الطويل (Long-tailed Class Incremental Learning) يجمع بين تنظيم اتساق التدرج وأوزان فقدان التقطير المعدلة ديناميكيًا للتخفيف بفعالية من النسيان الكارثي وعدم توازن الفئات، محققًا تحسينات كبيرة في الدقة عبر معايير قياس متعددة دون عبء حسابي جوهري.

Taigo Sakai, Kazuhiro Hotta2026-05-06
💻 computer science

SoDa2: Single-Stage Open-Set Domain Adaptation via Decoupled Alignment for Cross-Scene Hyperspectral Image Classification

تقترح هذه الورقة SoDa2^2، وهو إطار عمل للتكيف مع النطاق مفتوح المجموعة أحادي المرحلة يستخدم محاذاة طيفية-مكانية مفككة وبنية ثنائية الفروع منخفضة التكلفة لمعالجة انزياحات النطاق والفئات غير المعروفة بفعالية في تصنيف الصور فائقة الطيف عبر المشاهد.

Yiwen Liu, Minghua Wang, Jing Yao, Xin Zhao, Gemine Vivone2026-05-06
🤖 machine learning

TsallisPGD: Adaptive Gradient Weighting for Adversarial Attacks on Semantic Segmentation

تقدم الورقة البحثية TsallisPGD، وهو هجوم عدائي تكيفي لتقسيم الصور الدلالي يستخدم معامل إنتروبيا تساليس المتقاطع (q) الديناميكي لإعادة تشكيل تضاريس التدرج بفعالية والتفوق على الأساليب الحالية في تقليل دقة النموذج ومعدل التقاطع على الاتحاد (mIoU) عبر مجموعات بيانات وبنيات متنوعة.

Alexander Matyasko, Xin Lou, Indriyati Atmosukarto, Wei Zhang2026-05-06
💻 computer science

MK-ResRecon: Multi-Kernel Residual Framework for Texture-Aware 3D MRI Refinement from Sparse 2D Slices

تقدم الورقة البحثية MK-ResRecon، وهو إطار عمل متبقٍ متعدد النوى مبتكر، يقوم بإعادة بناء أحجام تصوير بالرنين المغناطيسي ثلاثية الأبعاد عالية الدقة وخالية من الهلوسة من شرائح ثنائية الأبعاد شديدة الندرة (تتطلب 12.5% فقط من البيانات الأصلية) عن طريق التنبؤ بالشرائح البينية المفقودة وتنقيتها لتصبح بنية تشريحية سلسة، مما يتيح فحصاً أسرع وأكثر راحة للمريض.

Prajyot Pyati, Sapna Sachan, Amulya Kumar Mahto, Pranjal Phukan2026-05-06
🤖 machine learning

Learning Discriminative Signed Distance Functions from Multi-scale Level-of-detail Features for 3D Anomaly Detection

تقترح هذه الورقة طريقة للكشف عن الشذوذ ثلاثي الأبعاد القائم على الأسطح، والتي تتعلم دالة مسافة مُوقعة تمييزية من خلال دمج وحدة توليد النقاط المشوشة، ووحدة ميزات مستوى التفاصيل متعددة المقاييس، ووحدة تمييز السطح الضمني، محققةً أداءً هو الأفضل في فئته على مجموعات البيانات المرجعية.

Haibo Xiao, Hanzhe Liang, Jie Zhou, Jinbao Wang, Can Gao2026-05-06
💻 computer science

Mantis: Mamba-native Tuning is Efficient for 3D Point Cloud Foundation Models

تقترح الورقة البحثية Mantis، وهو أول إطار عمل لضبط المعلمات بكفاءة يعتمد على بنية Mamba لنماذج التأسيس الخاصة بسحب النقاط ثلاثية الأبعاد، والذي يستخدم محولاً مدركاً للحالة وتقطير اتساق التسلسل المزدوج لتحقيق أداء تنافسي باستخدام 5% فقط من المعلمات القابلة للتدريب مع التغلب على قيود طرق الضبط الدقيق القائمة على Transformer في بنيات Mamba.

Zihao Guo, Jihua Zhu, Jian Liu, Ajmal Saeed Mian2026-05-06
💻 computer science

First Shape, Then Meaning: Efficient Geometry and Semantics Learning for Indoor Reconstruction

تقدم الورقة البحثية إطار عمل FSTM، وهو إطار موحد يتكون من خطوتين يعمل أولاً على تحسين الهندسة باستخدام تلميحات RGB والتلميحات الهندسية قبل تقدير الدلالات، مما يحقق تدريباً أسرع، ومتانة محسنة، واستدعاءً أعلى في إعادة البناء ثلاثي الأبعاد للبيئات الداخلية مقارنة بطرق multi-SDF الحالية.

Remi Chierchia, Léo Lebrat, David Ahmedt-Aristizabal, Olivier Salvado, Clinton Fookes, Rodrigo Santa Cruz2026-05-06
💻 computer science

WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models

تقدم WorldJen معياراً مرجعياً متعدد الأبعاد وشاملاً لنماذج الفيديو التوليدية يستبدل تقييمات الأسئلة والأجوبة المرئية (VQA) الثنائية المعيبة بتقييمات نماذج اللغة البصرية (VLM) عالية الدقة القائمة على مقياس ليكرت، محققةً توافقاً تاماً مع ترتيبات التفضيل البشري من خلال مطالبات منسقة تنافسياً ونظام تقييم ثلاثي المستويات يتسم بالمتانة.

Karthik Inbasekar, Guy Rom, Omer Shlomovits2026-05-06
💻 computer science

MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models

تقدم هذه الورقة MHPR، وهو معيار شامل ومسار تعليق تلقائي مصمم لتقييم وتعزيز قدرات الإدراك البشري متعدد الأبعاد والاستدلال لنماذج الرؤية واللغة الكبيرة عبر أبعاد الفرد، وتعدد الأشخاص، والتفاعل بين الإنسان والأشياء.

Kangkang Wang, Qinting Jiang, Wanping Zhang, Bowen Ren, Shengzhao Wen2026-05-06