💬 NLP

Sign Language Recognition in the Age of LLMs

تستقصي هذه الورقة قدرة نماذج الرؤية واللغة (VLMs) على التعرف من الصفر (zero-shot) في مجال التعرف المنفصل على لغة الإشارة، كاشفةً أنه بينما تعاني النماذج مفتوحة المصدر الحالية من ضعف كبير مقارنة بالمصنفات المتخصصة، تُظهر النماذج المملوكة الأكبر حجماً توافقاً بصرياً-دلالياً واعداً يتحسن مع زيادة الحجم وتنوع البيانات.

Vaclav Javorek, Jakub Honzik, Ivan Gruber, Tomas Zelezny, Marek Hruz2026-04-14
💬 NLP

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

تقدم هذه الورقة مفهوم "خطر تقطيع السلامي" وإطار عمل "هجوم تقطيع السلامي" المقابل له، والذي يتجاوز أمن النماذج اللغوية الكبيرة عبر تسلسل العديد من المدخلات منخفضة المخاطر لتفعيل سلوكيات ضارة تراكمياً، محققاً معدلات نجاح تتجاوز 90% عبر نماذج متنوعة، مع اقتراح استراتيجية دفاع فعالة أيضاً.

Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun2026-04-14
🤖 AI

From Redaction to Restoration: Deep Learning for Medical Image Anonymization and Reconstruction

تقدم هذه الورقة إطار عمل للتعلم العميق من طرف إلى طرف يجمع بين عملية التعتيم القائمة على شبكات CRNN ونماذج Inpainting لـ Stable Diffusion 2 لإزالة معلومات صحية محمية من الصور الطبية تلقائياً مع إعادة بناء محتوى معقول تشريحياً، مما يتيح مشاركة البيانات بشكل آمن دون المساس بجدوى تحليل الذكاء الاصطناًعي اللاحق.

Adrienne Kline, Abhijit Gaonkar, Daniel Pittman, Chris Kuehn, Nils Forkert2026-04-14
💬 NLP

Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging

تقدم الورقة البحثية MERIT، وهو إطار عمل لدمج النماذج يعتمد على اختيار الطبقات ولا يتطلب تدريباً، والذي يعمل بفعالية على استعادة قدرات الاستدلال الزمني في نماذج اللغة والفيديو من خلال الجمع الاستراتيجي لطبقات محددة من نموذج الفيديو وهيكله الأساسي المقتصر على النصوص، مما يتغلب على تدهور الاستدلال الناتج عادةً عن المحاذاة البصرية دون الحاجة إلى إعادة التدريب.

Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu2026-04-14
💬 NLP

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

تجادل هذه الورقة بأن الأداء التركيبي الضعيف لنماذج الرؤية واللغة ذات المشفر المزدوج ينبع من اعتمادها على تشابه جيب التمام العالمي أثناء الاستدلال، وتوضح أن إدخال آليات محاذاة دقيقة ومنطقة-قطاع خفيفة الوزن فوق التمثيلات المجمدة يعزز بشكل كبير التعميم التركيبي والمتانة تجاه تحولات التوزيع مقارنة بالضبط الدقيق الكامل.

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune2026-04-14
🤖 machine learning

Continuous Adversarial Flow Models

تقدم هذه الورقة نماذج التدفق التنافسي المستمر (Continuous Adversarial Flow Models)، وهي طريقة توظف مميزًا متعلمًا لتنقيح نماذج مطابقة التدفق الحالية من خلال هدف تنافسي، مما يحسن بشكل كبير جودة العينات والاتساق مع التوزيعات المستهدفة في اختبارات قياسية مثل ImageNet ومهام توليد النصوص إلى صور.

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan2026-04-14
🤖 AI

SVD-Prune: Training-Free Token Pruning For Efficient Vision-Language Models

تُعد SVD-Prune طريقة لتقليم الرموز (tokens) لا تتطلب تدريباً وتعمل بأسلوب "التوصيل والتشغيل"، حيث تستخدم تحليل القيم المفردة (Singular Value Decomposition) ودرجات الرافعة الإحصائية (statistical leverage scores) لاختيار الرموز البصرية الأكثر إفادة، مما يتغلب بفعالية على قيود النهج القائمة على الاستدلال للحفاظ على أداء عالٍ في نماذج الرؤية واللغة حتى في ظل قيود ميزانية الرموز القصوى.

Yvon Apedo, Martyna Poreba, Michal Szczepanski, Samia Bouchafa2026-04-14
🤖 machine learning

Ambivalence/Hesitancy Recognition in Videos for Personalized Digital Health Interventions

تستقصي هذه الورقة تطبيق نماذج التعلم العميق، بما في ذلك التعلم الخاضع للإشراف، وتكييف النطاق غير الخاضع للإشراف، والاستدلال من نوع "الصفر محاولة" عبر النماذج اللغوية الكبيرة، للتعرف على التردد والارتباك في مقاطع الفيديو لتمكين التدخلات الصحية الرقمية المخصصة، لكنها تجد أن الأساليب الحالية تحقق أداءً محدوداً على مجموعة بيانات BAH، مما يسلط الض الضوء على الحاجة إلى تقنيات دمج أكثر تقدماً للزمان والمكان والوسائط المتعددة.

Manuela González-González, Soufiane Belharbi, Muhammad Osama Zeeshan, Masoumeh Sharafi, Muhammad Haseeb Aslam, Lorenzo S (…)2026-04-14
🤖 AI

StarVLA-α\alpha: Reducing Complexity in Vision-Language-Action Systems

يقدم StarVLA-α\alpha نموذجاً مرجعياً بسيطاً ولكنه تنافسي للغاية لنماذج الرؤية واللغة والعمل (Vision-Language-Action)، يثبت أن التعقيد المعماري الأدنى المقترن بدعامة قوية لنموذج الرؤية واللغة (VLM) كافٍ لتحقيق أداء رائد عبر معايير متنوعة، متفوقاً بذلك على الأنظمة المعقدة مثل π0.5\pi_{0.5} في المهام الواقعية.

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya J (…)2026-04-14
🤖 AI

Efficient KernelSHAP Explanations for Patch-based 3D Medical Image Segmentation

تقدم هذه الورقة إطار عمل "KernelSHAP" فعالاً لتجزئة الصور الطبية ثلاثية الأبعاد القائمة على الرقع، والذي يعمل على تسريع الاستنتاج من خلال تخزين "اللوجيت" (logit) مؤقتاً وحصر الحسابات في مناطق الاهتمام، مبرهنةً على أنه بينما تعمل "السوبر فوكسل" (supervoxels) العادية على تعظيم مقاييس الاضطراب، فإن "السوبر فوكسل" المدركة للأعضاء توفر تفسيراً سريرياً فائقاً وفعالية أكبر في تحديد محركات الإيجابية الكاذبة.

Ricardo Coimbra Brioso, Giulio Sichili, Damiano Dei, Nicola Lambri, Pietro Mancosu, Marta Scorsetti, Daniele Loiacono2026-04-14