💻 computer science

MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

تقدم الورقة البحثية MERLIN، وهو إطار عمل تدريبي مبتكر مصحوب بمجموعة بيانات EM-100k ومعيار EM-Bench، للتغلب على ندرة البيانات، وفجوات التقييم، وهشاشة نسبة الإشارة إلى الضوضاء المنخفضة (low-SNR) في بناء نماذج لغوية كبيرة متعددة الوسائط قوية للإشارات الكهرومغناطيسية.

Junyu Shen, Zhendong She, Chenghanyu Zhang, Yuchuang Sun, Luqing Luo, Dingwei Tan, Zonghao Guo, Bo Guo, Zehua Han, Wupen (…)2026-03-10
💻 computer science

MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data

تقترح هذه الورقة البحثية إطار عمل MM-TS، وهو إطار عمل جديد للتعلم التبايني متعدد الوسائط يقوم بتعديل جداول درجة الحرارة والهامش ديناميكيًا بناءً على توزيع البيانات المحلي لمعالجة اختلالات التوزيع طويل الذيل، مما يوحد بين أهداف InfoNCE وأهداف الهامش الأقصى (max-margin) لتحقيق أداء رائد عبر مجموعات بيانات لغوية متعددة للصور والفيديو.

Siarhei Sheludzko, Dhimitrios Duka, Bernt Schiele, Hilde Kuehne, Anna Kukleva2026-03-10
💻 computer science

SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval

تقترح الورقة البحثية SAVE، وهي طريقة لتعلم تمثيل الفيديو المدرك للكلام، والتي تعزز استرجاع الفيديو والنص من خلال تقديم فرع مخصص للكلام وتقنية soft-ALBEF للمحاذاة المبكرة بين الرؤية والصوت، محققةً أداءً هو الأفضل في فئته عبر خمس معايير قياسية.

Ruixiang Zhao, Zhihao Xu, Bangxiang Lan, Zijie Xin, Jingyu Liu, Xirong Li2026-03-10
💻 computer science

SRNeRV: A Scale-wise Recursive Framework for Neural Video Representation

يُعد SRNeRV إطار عمل جديد لتمثيل الفيديو عصبياً يتسم بكفاءة المعلمات، حيث يستفيد من التشابه الذاتي للمقياس من خلال مخطط مشاركة تكراري هجين لتقليل حجم النموذج بشكل كبير مع تحقيق أداء متفوق في معدل التشويه مقارنة بالبنيات متعددة المقاييس المتراكمة التقليدية.

Jia Wang, Jun Zhu, Xinfeng Zhang2026-03-10
💻 computer science

GarmentPainter: Efficient 3D Garment Texture Synthesis with Character-Guided Diffusion Model

يُعد GarmentPainter إطار عمل فعال يقوم بتخليق أنسجة ملابس عالية الدقة ومتسقة ثلاثية الأبعاد في فضاء UV عبر الاستفادة من خرائط مواضع UV للتوجيه الهيكلي ووحدة اختيار النوع للتحكم القائم على الشخصية، وكل ذلك مدمج في نموذج انتشار قياسي دون تعديلات معمارية.

Jinbo Wu, Xiaobo Gao, Xing Liu, Chen Zhao, Jialun Liu2026-03-10
💻 computer science

SiMO: Single-Modality-Operable Multimodal Collaborative Perception

يقدم SiMO إطار عمل جديد للإدراك التعاوني يستخدم دمجاً متعدد الوسائط متكيفاً مع الطول (LAMMA) واستراتيجية تدريب "التحضير-المحاذاة-الدمج-التقليل من التشتت" (Pretrain-Align-Fuse-RD) للتغلب على أعطال المستشعرات وعدم التطابق الدلالي، مما يضمن أداءً قوياً عبر جميع الوسائط الفردية مع الحفاظ على التكامل الفعال متعدد الوسائط.

Jiageng Wen, Shengjie Zhao, Bing Li, Jiafeng Huang, Kenan Ye, Hao Deng2026-03-10
💻 computer science

DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving

تقدم هذه الورقة DynamicVGGT، وهو إطار عمل موحد للتغذية الأمامية يوسع الإدراك ثلاثي الأبعاد الساكن إلى إعادة بناء المشاهد رباعية الأبعاد الديناميكية للقيادة الذاتية من خلال التنبؤ المشترك بخرائط النقاط الحالية والمستقبلية، باستخدام وحدة انتباه زمني مدركة للحركة لضمان التماسك الزمني، وتوظيف رأس "Gaussian Splatting" ثلاثي الأبعاد ديناميكي لنمذجة حركة النقاط صراحةً وتحسين الهندسة.

Zhuolin He, Jing Li, Guanghao Li, Xiaolei Chen, Jiacheng Tang, Siyang Zhang, Zhounan Jin, Feipeng Cai, Bin Li, Jian Pu (…)2026-03-10
💻 computer science

OSCAR: Occupancy-based Shape Completion via Acoustic Neural Implicit Representations

تقترح الورقة البحثية OSCAR، وهي طريقة خالية من الملصقات تستخدم فضاءات كامنة مقترنة وتمثيلات ضمنية عصبية لإعادة بناء تشريح الفقرات ثلاثي الأبعاد بالكامل بدقة من صور الموجات فوق الصوتية الجزئية عبر النمذجة الضمنية للتظليل الصوتي ونقل الإشارة، محققةً تحسناً بنسبة 80% في مقياس HD95 مقارنة بالتقنيات الرائدة.

Magdalena Wysocki, Kadir Burak Buldu, Miruna-Alexandra Gafencu, Mohammad Farid Azampour, Nassir Navab2026-03-10
💻 computer science

Novel Semantic Prompting for Zero-Shot Action Recognition

تقدم الورقة البحثية SP-CLIP، وهو إطار عمل خفيف الوزن للتعرف على الأفعال بنمط (zero-shot)، والذي يحسن الأداء بشكل كبير في الأفعال دقيقة التفاصيل والتركيبية من خلال تعزيز النماذج الرؤيوية-اللغوية المجمدة بمطالبات دلالية مهيكلة ومتعددة المستويات دون الحاجة إلى أي تدريب إضافي للمعلمات أو تعديلات في المشفر البصري.

Salman Iqbal, Waheed Rehman2026-03-10
🤖 machine learning

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

تقدم هذه الورقة إطار عمل للضبط الدقيق الموجه بالمفاهيم، والذي يعزز متانة نماذج "Vision Transformer" ضد انزياحات التوزيع من خلال التوليد التلقائي للمفاهيم الدلالية دقيقة التفاصيل ومحاذاة انتباه النموذج معها بدلاً من الارتباطات الخلفية الزائفة.

Yehonatan Elisha, Oren Barkan, Noam Koenigstein2026-03-10