💻 computer science

From Codebooks to VLMs: Evaluating Automated Visual Discourse Analysis for Climate Change on Social Media

تقيم هذه الورقة مدى فعالية نماذج الرؤية واللغة المختلفة للتحليل الخطابي البصري الآلي لتغير المناخ على وسائل التواصل الاجتماعي، مظهرةً أنه بينما يحقق نموذج Gemini-3.1-flash-lite أعلى دقة على مستوى الحالة، فإن النماذج متوسطة الأداء يمكنها أيضاً استعادة الاتجاهات على مستوى السكان بشكل موثوق، مما يوفر بديلاً قابلاً للتوسع للترميز اليدوي للأبحاث واسعة النطاق.

Katharina Prasse, Steffen Jung, Isaac Bravo, Stefanie Walter, Patrick Knab, Christian Bartelt, Margret Keuper2026-04-24
💻 computer science

TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval

تعالج هذه الورقة البحثية أوجه القصور المتمثلة في عدم كفاية تغطية الكيانات وعدم توافق الجمل مع الكيانات في استرجاع الصور المركبة من خلال تقديم مجموعتي بيانات جديدتين غنيتين بالتعليمات ومتعددتي التعديلات (M-FashionIQ وM-CIRR)، واقتراح إطار عمل TEMA، وهو إطار عمل مبتكر يتعامل بفعالية مع استعلامات التعديل المتعدد البسيطة والمعقدة مع تحقيق التوازن بين الدقة والكفاءة.

Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Yongqi Li, Liqiang Nie2026-04-24
💻 computer science

Multiscale Super Resolution without Image Priors

تُثبت هذه الورقة أنه يمكن تحقيق الدقة الفائقة دون الحاجة إلى مسبقات صور عبر الجمع بين صور منخفضة الدقة تم التقاطها بمقاييس مختلفة باستخدام أحجام بكسل أولية فيما بينها، مما يؤدي إلى إنشاء مسألة جيدة التحديد ذات معكوس مستقر يتيح إعادة بناء فعالة وفهماً واضحاً للمقايضة بين الضجيج والدقة.

Daniel Fu, Gabby Litterio, Pedro Felzenszwalb, Rashid Zia2026-04-24
🧬 biology

Directional Confusions Reveal Divergent Inductive Biases Through Rate-Distortion Geometry in Human and Machine Vision

تُظهر هذه الورقة أن الارتباكات الاتجاهية في الرؤية البشرية والآلية، والتي تم تحليلها من خلال إطار هندسي لمعدل التشوه، تكشف عن انحيازات استقرائية وهندسات تعميم متميزة تظل غير مرئية لمقاييس الدقة القياسية.

Leyla Roksan Caglar, Pedro A. M. Mediano, Baihan Lin2026-04-24
💬 NLP

When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs

تقدم هذه الورقة البحثية HalluScope، وهو معيار يكشف أن الهلوسة في النماذج اللغوية البصرية الكبيرة مدفوعة بشكل أساسي بالانحيازات المسبقة للتعليمات النصية، وتقترح HalluVL-DPO، وهو إطار عمل لتحسين التفضيل يعمل بفعالية على تخفيف هذه الهلوسات الناجمة عن الأوامر مع الحفاظ على القدرات البصرية.

Pegah Khayatan, Jayneel Parekh, Arnaud Dapogny, Mustafa Shukor, Alasdair Newson, Matthieu Cord2026-04-24
💻 computer science

Vista4D: Video Reshooting with 4D Point Clouds

يُعد Vista4D إطار عمل قوي لإعادة تصوير الفيديو يستفيد من تمثيل السحابة النقطية رباعية الأبعاد مع تقسيم البكسل الثابت والتدريب متعدد المشاهد لتخليق مشاهد ديناميكية من مسارات كاميرا جديدة مع الحفاظ على مظهر المحتوى وضمان التحكم الدقيق في الكاميرا.

Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca, Yash Kant, Ryan Burgert, Yuancheng Xu, Koichi Namekata, Yiwei Zhao, Bolei (…)2026-04-24
💻 computer science

Seeing Without Eyes: 4D Human-Scene Understanding from Wearable IMUs

تقدم هذه الورقة البحثية IMU-to-4D، وهو إطار عمل مبتكر يسخر النماذج اللغوية الكبيرة لإعادة بناء حركة بشرية رباعية الأبعاد وتخطيطات مشاهد ثلاثية الأبعاد بدقة من خلال مستشعرات قصور ذاتي قابلة للارتداء فقط، مما يوفر بديلاً يحافظ على الخصوصية وفعالاً في استهلاك الطاقة مقارنة بالإدراك القائم على الرؤية.

Hao-Yu Hsu, Tianhang Cheng, Jing Wen, Alexander G. Schwing, Shenlong Wang2026-04-24
💻 computer science

Seeing Fast and Slow: Learning the Flow of Time in Videos

تقدم هذه الورقة نماذج ذاتية الإشراف تتعلم كيفية اكتشاف والتحكم في سرعة تشغيل الفيديو، مستفيدة من هذه القدرات لإنشاء مجموعة بيانات ضخمة للحركة البطيئة وتمكين تطبيقات متقدمة مثل توليد الفيديو المشروط بالسرعة والدقة الزمنية الفائقة.

Yen-Siang Wu, Rundong Luo, Jingsen Zhu, Tao Tu, Ali Farhadi, Matthew Wallingford, Yu-Chiang Frank Wang, Steve Marschner (…)2026-04-24
💻 computer science

i-WiViG: Interpretable Window Vision GNN

تقدم الورقة البحثية i-WiViG، وهي شبكة عصبية رسومية للرؤية قابلة للتفسير تقيد المجالات الاستقبالية للعقد بنوافذ محلية منفصلة وتستخدم عنق زجاجة انتباه متناثر قابل للتعلم لتحديد التفاعلات المكانية ذات الصلة، مما يوفر تفسيرات دقيقة مع تحقيق أداء تنافسي في مهام التعرف على الصور.

Ivica Obadic, Dmitry Kangin, Adrian Höhl, Dario Oliveira, Plamen P Angelov, Xiao Xiang Zhu2026-04-23
⚡ electrical engineering

Towards a General-Purpose Zero-Shot Synthetic Low-Light Image and Video Pipeline

تقدم هذه الورقة شبكة تقدير التدهور (DEN) القائمة على التعلم الصفري، والتي تولد صورًا وفيديوهات اصطناعية واقعية ومستندة إلى الفيزياء في ظروف الإضاءة المنخفضة دون الحاجة إلى بيانات وصفية للكاميرا، مما يحسن الأداء بشكل كبير في مهام مثل محاكاة الضوضاء، وتحسين الفيديو، وكشف الأشياء.

Joanne Lin, Crispian Morris, Ruirui Lin, Fan Zhang, David Bull, Nantheera Anantrasirichai2026-04-23