💬 NLP

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

تقدم الورقة البحثية إطار العمل ICER، وهو إطار عمل "صندوق أسود" يستفيد من إعادة كتابة قائمة على النماذج اللغوية الكبيرة وإعادة تشغيل الخبرة في السياق لتوليد مطالبات هجومية سلسة ومحافظة على المعنى بكفاءة لاختبار الاختراق لنماذج تحويل النص إلى صورة، مما يظهر أداءً متفوقاً وقدرة عالية على الانتقال عبر مختلف آليات السلامة مقارنة بالنماذج المرجعية الحالية.

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz2026-05-13
💻 computer science

Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving

تقترح هذه الورقة وتُقيّم إطار عمل جديداً غير خاضع للإشراف يجمع بين نماذج الرؤية التأسيسية وتقنيات تقدير الكثافة للكشف بفعالية عن الانزياحات في التوزيع الدلالي والمغاير في القيادة الذاتية، متفوقةً بذلك على الأساليب الحالية في تحديد المدخلات ذات المخاطر العالية الخارجة عن التوزيع.

Mert Keser, Halil Ibrahim Orhan, Niki Amini-Naieni, Gesina Schwalbe, Alois Knoll, Matthias Rottmann2026-05-13
🤖 AI

DIPSER: A Dataset for In-Person Student Engagement Recognition in the Wild

تقدم هذه الورقة البحثية DIPSER، وهي مجموعة بيانات جديدة وشاملة في البيئات الواقعية للتعرف على تفاعل الطلاب حضورياً، والتي تجمع بشكل فريد بين بيانات كاميرا RGB متعددة الزوايا، ومقاييس مستشعرات الساعة الذكية، وتسميات متنوعة تم التحقق منها من قبل خبراء لتسهيل تحليل انتباه الطلاب وعواطفهم عبر مختلف السياقات التعليمية.

Luis Marquez-Carpintero, Sergio Suescun-Ferrandiz, Carolina Lorenzo Álvarez, Jorge Fernandez-Herrero, Diego Viejo, Rosab (…)2026-05-13
🔭 astrophysics

Applying Vision Transformers on Spectral Analysis of Astronomical Objects

تُثبت هذه الورقة أن الضبط الدقيق لنماذج "Vision Transformers" المدربة مسبقاً على بيانات طيفية فلكية حقيقية واسعة النطاق تم تحويلها إلى صور ثنائية الأبعاد يحقق دقة فائقة في تصنيف النجوم وتقديراً تنافسياً للإزاحة الحمراء مقارنة بطرق التعلم الآلي التقليدية ونماذج التعلم العميق الحالية، مما يمثل أول تطبيق من هذا النوع دون الاعتماد على مدخلات اصطناعية.

Luis Felipe Strano Moraes, Ignacio Becker, Pavlos Protopapas, Guillermo Cabrera-Vives2026-05-13
⚡ electrical engineering

DSA-NRP: No-Reflow Prediction from Angiographic Perfusion Dynamics in Stroke EVT

تقدم هذه الورقة DSA-NRP، وهو إطار عمل جديد للتعلم الآلي يستفيد من تسلسلات تصوير الأوعية بالطرح الرقمي (DSA) داخل الإجراء والمتغيرات السريرية للتنبؤ بدقة بمضاعفات عدم تدفق الدم (no-reflow) التي تلي عملية استئصال الخثرة عبر الأوعية الدموية للسكتة الدماغية الإقفارية الحادة، متفوقاً بذلك على المراجع السريرية والملغي للحاجة إلى التصوير المتأخر بعد الإجراء.

Shreeram Athreya, Carlos Olivares, Ameera Ismail, Kambiz Nael, William Speier, Corey Arnold2026-05-13
💻 computer science

B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding

تقدم هذه الورقة B4DL، وهو معيار شامل وبنية مبتكرة لنماذج اللغات الكبيرة متعددة الوسائط مصممة لربط بيانات ليدار (LiDAR) رباعية الأبعاد الخام بالفهم اللغوي، مما يتيح الاستدلال المكاني-الزماني المتقدم في البيئات الخارجية الديناميكية.

Changho Choi, Youngwoo Shin, Gyojin Han, Dong-Jae Lee, Junmo Kim2026-05-13
💻 computer science

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

تثبت هذه الورقة تجريبياً أنه بينما يرتبط الاستنتاج التركيبي وفهم التعليقات الطويلة في نماذج الرؤية واللغة التباينية بعلاقة ثنائية الاتجاه، فإن تعزيزهما المتبادل يعتمد بشكل حاسم على بيانات تدريب عالية الجودة وجيدة التأسيس وخيارات معمارية محددة، مما يقدم إرشادات قابلة للتنفيذ لتحسين تعميم النموذج.

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva2026-05-13
💻 computer science

Concepts in Motion: Temporal Concept Bottleneck Model for Interpretable Video Classification

تقدم هذه الورقة MoTIF، وهو إطار عمل قائم على المحولات (transformer) يعزز تصنيف الفيديو القابل للتفسير من خلال الاستفيادة من نموذج لغوي بصري (VLM) مشروط بالفئة لاكتشاف المفاهيم الزمنية تلقائيًا ونمذجة أنماطها الديناميكية عبر آلية الانتباه الذاتي لكل مفهوم، مما يقلص فجوة الأداء بين النماذج القابلة للتفسير والنماذج المرجعية للفيديو ذات الصندوق الأسود.

Patrick Knab, Sascha Marton, Philipp J. Schubert, Drago Guggiana, Christian Bartelt2026-05-13
🤖 machine learning

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

تقدم هذه الورقة InPose، وهو أسلوب لتقدير وضعية جسم الإنسان بنمط (zero-shot)، يصيغ المهمة كمسألة عكسية عبر الاستفادة من نموذج انتشار مُدرب مسبقاً مشروط بالقياسات الدورانية وموجه بحد احتمالية مستمد من بيانات موقع متفرقة لتحقيق تعميم قوي عبر المستخدمين ذوي أحجام الأجسام المتفاوتة.

Sahil Bhandary Karnoor, Romit Roy Choudhury2026-05-13
🤖 AI

See the past: Time-Reversed Scene Reconstruction from Thermal Traces Using Visual Language Models

تقترح هذه الورقة إطار عمل مبتكر يجمع بين النماذج اللغوية البصرية وعملية انتشار مقيدة لإعادة بناء حالات المشهد الماضية المعقولة من الآثار الحرارية المتلاشية التي تتركها التفاعلات البشرية، مما يتيح التصوير العكسي للزمن لفترة تصل إلى 120 ثانية سابقة.

Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura, Jorge Bacca2026-05-13