💻 computer science

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

تتناول هذه الورقة التهديد الناشئ المتمثل في السرديات البصرية الكريهة القابلة للتوسع والتي يتم إنشاؤها بواسطة أنظمة تحويل النص إلى صورة متعددة الأدوار، وذلك من خلال تقديم مجموعة بيانات مرجعية جديدة، وإثبات فشل عمليات الإشراف الحالية على مستوى الصورة في اكتشاف الكراهية على مستوى المجموعات، واقتراح دفاعات استباقية ودفاعات ما بعد الإنشاء فعالة تقوم بتحليل حالات التفاعل والعلاقات بين الصور.

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang2026-08-07
💻 computer science

A Survey of Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization

تستعرض هذه الورقة هجمات تدهور الكفاءة العدائية على نماذج "ترانسفورمر الرؤية" (Vision Transformers) التي تستغل آليات التكيف مع المدخلات مثل تقليم الرموز (token pruning) والتوقف المبكر (early halting) لزيادة التكاليف الحسابية دون الإضرار بالدقة بشكل كبير، مع تحليل طرق هجوم محددة، وأطر عمل معرضة للاختراق، ودفاعات خفيفة الوزن محتملة.

Anadi Goyal, Nandish Chattopadhyay, Anupam Chattopadhyay, Chandan Karfa2026-08-07
💻 computer science

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

تقدم هذه الورقة البحثية "الإرغام داخل السياق" (In-Context Forcing)، وهو نموذج تلقائي الترتيب تدريجي لانتشار الفيديو يستخدم سياقات بمستويات ضجيج متناقصة لتحقيق التوازن بين الاتساق الزمني والديناميكيات بين الإطارات، مع تمكين إزالة الضجيج المتوازي عبر الإطارات لتسريع الاستدلال بشكل كبير.

Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi2026-08-07
💻 computer science

Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

تقدم هذه الورقة تصنيفاً ومنهجية تدقيق لـ 175 دراسة لكشف الغموض المنهجي واسع النطاق والافتقار إلى تفاصيل التنفيذ الصارمة في تكييف تقنية Grad-CAM لتناسب نماذج المحولات الرؤيوية (Vision Transformers)، محاجةً بأن التعامل معها كأنها امتداد بديهي لنظيرتها في الشبكات العصبية الالتفافية (CNN) يحجب الخيارات الجوهرية التي تؤثر على قابلية التكرار والتفسير.

Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh2026-08-07
🤖 machine learning

Evaluating Machine Learning Models for Post-Wildfire Debris-Flow Prediction

تقدم هذه الورقة إطاراً شاملاً لتحسين التنبؤ بتدفقات الحطام الناتجة عن حرائق الغابات من خلال التقييم المنهجي لـ 15 نموذجاً من نماذج تعلم الآلة، وتحديد شدة هطول الأمطار قصيرة المدة كأهم متغير تنبؤي، وإثبات أن تعزيز البيانات الاصطناعية يحسن أداء النماذج بشكل كبير، لا سيما بالنسبة لنهج التعلم العميق.

Quinn Ledingham, Zhengsen Xu, Yimin Zhu, Zack Dewis, Mabel Heffring, Saeid Taleghanidoozdoozan, Motasem Alkayid, Megan G (…)2026-08-07
💻 computer science

Context Matters: Support Set Selection and Failure Detection for In-Context Medical Image Segmentation

تُثبت هذه الورقة أن موثوقية تقسيم الصور الطبية في سياق التعلم (in-context) يمكن تعزيزها واستباقها من خلال توظيف اختيار مجموعة دعم قائمة على التشابه وتدريب مصنف للتنبؤ بإخفاقات التقسيم قبل النشر.

Youssef Gehad, Emmanuel Zerefa, Krish Kabra, Guha Balakrishnan2026-08-07
💻 computer science

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection

تقترح هذه الورقة LoDA، وهو مسار للكشف عن التغيير ثلاثي الأبعاد مدرك لمستوى الكشف يدمج التسجيل المدرك لعدم اليقين والتقسيم المدفوع بالهندسة لتحقيق وسم التغيير على مستوى الكائنات بدقة عالية، إلى جانب تقديم معيار متعدد الوسائط جديد للبيئات الحضرية.

Haitian Wang, Xinyu Wang, Sheldon Fung, Xian Zhang, Zichen Geng2026-08-07
💻 computer science

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

تقدم هذه الورقة إطار عمل لنموذج تأسيسي للرؤية واللغة ثلاثي الأبعاد خفيف الوزن يستخدم مطالبات "أوراكل" القائمة على النصوص لتنقيح عمليات تقسيم المناطق الفرعية لورم الدباق الأولية بفعالية، مما يظهر تحسينات ملحوظة في درجات تشابه "دايس" مقارنة بالنماذج المرجعية والتعليمات المتناقضة مع دعم التحرير من قبل الطبيب في الحلقة.

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang2026-08-07
💻 computer science

MOSAIK: Multi-Patch Content-Aware Spatial Allocation of Image Tokens for Efficient Generation

يُعد MOSAIK إطار عمل موجهاً بالضرر لنماذج الانتشار في فضاء البكسل، حيث يقوم بتخصيص أحجام رقع غير متجانسة ديناميكياً عبر مناطق الصورة بناءً على فقدان الدقة المقدر، محققاً كفاءة حسابية كبيرة (خفض بنسبة 70% في عمليات الفاصلة العائمة) مع الحفاظ على جودة توليد تنافسية مقارنة بالنماذج المرجعية ذات الحوسبة الكاملة.

Mohammadreza Hami, Mohammadreza Samadi, Chao Gao, Negar Hassanpour2026-08-07
💻 computer science

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

تقدم الورقة البحثية VideoArgus، وهو إطار عمل موحد ومستند إلى معايير تقييمية، يقوم بتوليد معايير تقييم خاصة بكل عينة وغير منحازة للمخرجات لإنتاج درجات وتقارير تشخيصية قائمة على الأدلة لمختلف مهام توليد وتحرير الفيديو، محققاً توافقاً فائقاً مع الأحكام البشرية مقارنة بالمعايير المرجعية الحالية.

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo2026-08-07