💬 NLP

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

تقدم هذه الورقة إطار عمل READ، وهو إطار عمل لتعلم النقل كفء في المعلمات يجمع بين مُكيِّف متكرر مبتكر للنمذجة الزمنية وهدف محاذاة جزئي بين الفيديو واللغة ليتفوق بشكل كبير على استراتيجيات الضبط الدقيق الحالية في مهام الفيديو واللغة ذات الموارد المنخفضة.

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan2026-05-13
💻 computer science

Interactive Mars Image Content-Based Search with Interpretable Machine Learning

تقدم هذه الورقة نظاماً للبحث عن الصور القائم على المحتوى، يعتمد على النماذج الأولية ويكون قابلاً للتفسير، وذلك لمجموعة بيانات مختبر علوم المريخ التابعة لنظام بيانات الكواكب التابع لناسا، صُمم لاستبدال النماذج غير القابلة للتفسير من خلال السماح للمستخدمين بفهم والتحقق من الأدلة الكامنة وراء التصنيفات مع ضمان تنوع وصحة الأدلة الأساسية.

Bhavan Vasu, Steven Lu, Emily Dunkel, Kiri L. Wagstaff, Kevin Grimes, Michael McAuley2026-05-13
💬 NLP

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

تقدم الورقة البحثية إطار العمل ICER، وهو إطار عمل "صندوق أسود" يستفيد من إعادة كتابة قائمة على النماذج اللغوية الكبيرة وإعادة تشغيل الخبرة في السياق لتوليد مطالبات هجومية سلسة ومحافظة على المعنى بكفاءة لاختبار الاختراق لنماذج تحويل النص إلى صورة، مما يظهر أداءً متفوقاً وقدرة عالية على الانتقال عبر مختلف آليات السلامة مقارنة بالنماذج المرجعية الحالية.

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz2026-05-13
💻 computer science

Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving

تقترح هذه الورقة وتُقيّم إطار عمل جديداً غير خاضع للإشراف يجمع بين نماذج الرؤية التأسيسية وتقنيات تقدير الكثافة للكشف بفعالية عن الانزياحات في التوزيع الدلالي والمغاير في القيادة الذاتية، متفوقةً بذلك على الأساليب الحالية في تحديد المدخلات ذات المخاطر العالية الخارجة عن التوزيع.

Mert Keser, Halil Ibrahim Orhan, Niki Amini-Naieni, Gesina Schwalbe, Alois Knoll, Matthias Rottmann2026-05-13
🤖 AI

DIPSER: A Dataset for In-Person Student Engagement Recognition in the Wild

تقدم هذه الورقة البحثية DIPSER، وهي مجموعة بيانات جديدة وشاملة في البيئات الواقعية للتعرف على تفاعل الطلاب حضورياً، والتي تجمع بشكل فريد بين بيانات كاميرا RGB متعددة الزوايا، ومقاييس مستشعرات الساعة الذكية، وتسميات متنوعة تم التحقق منها من قبل خبراء لتسهيل تحليل انتباه الطلاب وعواطفهم عبر مختلف السياقات التعليمية.

Luis Marquez-Carpintero, Sergio Suescun-Ferrandiz, Carolina Lorenzo Álvarez, Jorge Fernandez-Herrero, Diego Viejo, Rosab (…)2026-05-13
🔭 astrophysics

Applying Vision Transformers on Spectral Analysis of Astronomical Objects

تُثبت هذه الورقة أن الضبط الدقيق لنماذج "Vision Transformers" المدربة مسبقاً على بيانات طيفية فلكية حقيقية واسعة النطاق تم تحويلها إلى صور ثنائية الأبعاد يحقق دقة فائقة في تصنيف النجوم وتقديراً تنافسياً للإزاحة الحمراء مقارنة بطرق التعلم الآلي التقليدية ونماذج التعلم العميق الحالية، مما يمثل أول تطبيق من هذا النوع دون الاعتماد على مدخلات اصطناعية.

Luis Felipe Strano Moraes, Ignacio Becker, Pavlos Protopapas, Guillermo Cabrera-Vives2026-05-13
⚡ electrical engineering

DSA-NRP: No-Reflow Prediction from Angiographic Perfusion Dynamics in Stroke EVT

تقدم هذه الورقة DSA-NRP، وهو إطار عمل جديد للتعلم الآلي يستفيد من تسلسلات تصوير الأوعية بالطرح الرقمي (DSA) داخل الإجراء والمتغيرات السريرية للتنبؤ بدقة بمضاعفات عدم تدفق الدم (no-reflow) التي تلي عملية استئصال الخثرة عبر الأوعية الدموية للسكتة الدماغية الإقفارية الحادة، متفوقاً بذلك على المراجع السريرية والملغي للحاجة إلى التصوير المتأخر بعد الإجراء.

Shreeram Athreya, Carlos Olivares, Ameera Ismail, Kambiz Nael, William Speier, Corey Arnold2026-05-13
💻 computer science

B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding

تقدم هذه الورقة B4DL، وهو معيار شامل وبنية مبتكرة لنماذج اللغات الكبيرة متعددة الوسائط مصممة لربط بيانات ليدار (LiDAR) رباعية الأبعاد الخام بالفهم اللغوي، مما يتيح الاستدلال المكاني-الزماني المتقدم في البيئات الخارجية الديناميكية.

Changho Choi, Youngwoo Shin, Gyojin Han, Dong-Jae Lee, Junmo Kim2026-05-13
💻 computer science

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

تثبت هذه الورقة تجريبياً أنه بينما يرتبط الاستنتاج التركيبي وفهم التعليقات الطويلة في نماذج الرؤية واللغة التباينية بعلاقة ثنائية الاتجاه، فإن تعزيزهما المتبادل يعتمد بشكل حاسم على بيانات تدريب عالية الجودة وجيدة التأسيس وخيارات معمارية محددة، مما يقدم إرشادات قابلة للتنفيذ لتحسين تعميم النموذج.

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva2026-05-13
💻 computer science

Concepts in Motion: Temporal Concept Bottleneck Model for Interpretable Video Classification

تقدم هذه الورقة MoTIF، وهو إطار عمل قائم على المحولات (transformer) يعزز تصنيف الفيديو القابل للتفسير من خلال الاستفيادة من نموذج لغوي بصري (VLM) مشروط بالفئة لاكتشاف المفاهيم الزمنية تلقائيًا ونمذجة أنماطها الديناميكية عبر آلية الانتباه الذاتي لكل مفهوم، مما يقلص فجوة الأداء بين النماذج القابلة للتفسير والنماذج المرجعية للفيديو ذات الصندوق الأسود.

Patrick Knab, Sascha Marton, Philipp J. Schubert, Drago Guggiana, Christian Bartelt2026-05-13