💻 computer science

MSSPlace: Multi-Sensor Place Recognition with Visual and Text Semantics

تُعد MSSPlace طريقة متطورة للتعرف على الأماكن متعددة الوسائط، وهي تعتمد نهج الدمج المتأخر لدمج صور الكاميرات المتعددة، وسحب نقاط ليدار (LiDAR)، وأقنعة التجزئة الدلالية، والتعليقات النصية، مما أظهر تحسينات كبيرة في الأداء مقارنة بنهج الوسائط المنفردة على مجموعتي بيانات Oxford RobotCar وNCLT.

Alexander Melekhin, Dmitry Yudin, Ilia Petryashin, Vitaly Bezuglyj2026-03-03
💻 computer science

XPoint: A Self-Supervised Visual-State-Space based Architecture for Multispectral Image Registration

يُعد XPoint إطار عمل جديداً ذاتي الإشراف ومجزأً، يستفيد من مشفر VMamba ورؤوس فك تشفير مشتركة لتحقيق تسجيل صور متعددة الأطياف قوي وقابل للتكيف عبر أنماط طيفية متنوعة دون الاعتماد على بيانات مصنفة باهظة التكلفة.

Ismail Can Yagmur, Hasan F. Ates, Bahadir K. Gunturk2026-03-03
⚡ electrical engineering

DAWN-FM: Data-Aware and Noise-Informed Flow Matching for Solving Inverse Problems

تقدم هذه الورقة DAWN-FM، وهو إطار عمل جديد لمطابقة التدفق (Flow Matching) يدمج تضمينات صريحة للبيانات والضجيج لحل المسائل العكسية غير محددة الحل بشكل قوي من خلال تعلم حقل سرعة يعتمد على الزمن لإعادة البناء الدقيق وتقدير عدم اليقين.

Shadab Ahamed, Eldad Haber2026-03-03
💬 NLP

Polynomial, trigonometric, and tropical activations

تقدم هذه الورقة عائلة من دوال التنشيط متعددة الحدود، والمثلثية، والتروبية المشتقة من قواعد متعامدة، والتي عند دمجها مع تهيئة الحفاظ على التباين، تُمكّن من التدريب الناجح لنماذج عميقة مثل GPT-2 وConvNeXt مع التخفيف من عدم استقرار التدرج، وتوفير قابلية تفسير متعددة الحدود، وتسهيل الضبط الدقيق من خلال استكمال هيرميت.

Ismail Khalfaoui-Hassani, Stefan Kesselheim2026-03-03
🤖 machine learning

CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally

توضح هذه الورقة أنه بينما يفشل المحاذاة عبر الوسائط في نموذج CLIP في الحفاظ على البنية التركيبية، مما يجعله يتصرف كنموذج "حقيبة الكلمات"، فإن معلومات ربط الصفة بالموصوف الضرورية مشفرة بالفعل ضمن تمثيلاته أحادية الوسائط ويمكن استردادها بفعالية من خلال تحويل خطي بسيط.

Darina Koishigarina, Arnas Uselis, Seong Joon Oh2026-03-03
🤖 AI

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

تقدم الورقة البحثية WorldSense، وهو أول معيار مصمم لتقييم الفهم الواقعي للنماذج اللغوية الكبيرة متعددة الوسائط من خلال دمج المدخلات الصوتية والبصرية والنصية المتزامنة عبر سيناريوهات متنوعة، كاشفةً أن النماذج الحالية المتطورة لا تزال تواجه تحديات كبيرة في تحقيق إدراك متماسك متعدد الوسائط.

Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie2026-03-03
💻 computer science

Precise Parameter Localization for Textual Generation in Diffusion Models

تُثبت هذه الورقة أن أقل من 1% من معاملات نموذج الانتشار، وتحديداً ضمن طبقات الانتباه، هي المسؤولة عن توليد المحتوى النصي، مما يتيح الضبط الدقيق الفعال، وتحرير النصوص، ومنع النصوص السامة عبر بنيات نماذج متنوعة من خلال التوطين المستهدف.

Łukasz Staniszewski, Bartosz Cywiński, Franziska Boenisch, Kamil Deja, Adam Dziedzic2026-03-03
💻 computer science

Thicker and Quicker: A Jumbo Token for Fast Plain Vision Transformers

تقدم هذه الورقة "Jumbo"، وهو نموذج "Vision Transformer" بسيط، سريع ودقيق، يعزز الكفاءة عبر استبدال رموز الرقع الضيقة (patch tokens) برمز عالمي واحد أعرض ومشترك المعلمات يتم معالجته بواسطة شبكة تغذية أمامية (FFN) تعتمد على الانتباه فقط، مما يحسن الأداء عبر مهام متنوعة مع الحفاظ على التوافق مع أساليب "ViT" الحالية.

Anthony Fuller, Yousef Yassin, Daniel G. Kyrollos, Evan Shelhamer, James R. Green2026-03-03
🤖 machine learning

Effective and Efficient Masked Image Generation Models

تقدم الورقة البحثية نموذج eMIGM، وهو نموذج موحد لتوليد الصور المقنعة يجمع بفعالية بين نماذج الصور المقنعة ونماذج الانتشار لتحقيق أداء رائد في توليد صور ImageNet بعدد أقل بكثير من عمليات تقييم الدوال والمعلمات مقارنة بالطرق الحالية.

Zebin You, Jingyang Ou, Xiaolu Zhang, Jun Hu, Jun Zhou, Chongxuan Li2026-03-03
🤖 machine learning

A Multi-Objective Evaluation Framework for Analyzing Utility-Fairness Trade-Offs in Machine Learning Systems

تقدم هذه الورقة إطار عمل للتقييم متعدد الأهداف ومستقل عن النموذج، يستخدم المخططات الرادارية ومقاييس شاملة لتحليل وتصور المفاضلات بين المنفعة والعدالة في أنظمة تعلم الآلة بشكل منهجي، مع تركيز خاص على التخفيف من التفاوتات في تطبيقات التصوير الطبي.

Gökhan Özbulak, Oscar Jimenez-del-Toro, Maíra Fatoretto, Lilian Berton, André Anjos2026-03-03