💬 NLP

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

تقدم هذه الورقة BEAT، وهو إطار عمل مبتكر يقوم بحقن أبواب خلفية بصرية في الوكلاء المجسدين القائمين على نماذج اللغة والرؤية (VLM) من خلال الاستفراد من محفزات الأشياء ومخطط تدريب ثنائي المرحلة يتميز بتعلم المحفز التبايني لتحقيق معدلات نجاح هجوم عالية مع الحفاظ على أداء المهام الحميدة.

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel K (…)2026-02-24
🤖 machine learning

Countering Multi-modal Representation Collapse through Rank-targeted Fusion

تقترح هذه الورقة البحثية "Rank-enhancing Token Fuser"، وهو إطار عمل مؤصل نظرياً يستخدم الرتبة الفعالة لمواجهة كل من انهيار الميزات وانهيار الأنماط في دمج الوسائط المتعددة في آن واحد، مما يحسن بشكل كبير من أداء توقع الأفعال البشرية من خلال المزج الانتقائي للميزات المتكاملة عبر الوسائط.

Seulgi Kim, Kiran Kokilepersaud, Mohit Prabhushankar, Ghassan AlRegib2026-02-24
🤖 machine learning

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

تُعد StreamDiffusionV2 خط تدفق (pipeline) قابل للتوسع ولا يتطلب تدريباً، يتيح بثاً فيديو تفاعلياً في الوقت الفعلي باستخدام نماذج الانتشار بالفيديو عبر دمج الجدولة الواعية بـ SLO، والتحكم الواعي بالحركة، والتنسيق المتوازي لتحقيق زمن انتقال فائق الانخفاض وإنتاجية عالية على مجموعات وحدات معالجة الرسومات غير المتجانسة.

Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Manee (…)2026-02-24
🤖 AI

PRISM: Diversifying Dataset Distillation by Decoupling Architectural Priors

يُعد PRISM إطار عمل لتقطير البيانات يعمل على تعزيز التنوع داخل الفئة والقدرة على التعميم من خلال فصل أهداف مطابقة اللوجيت (logit-matching) والانتظام (regularization) للاستفادة من الأولويات المعمارية من نماذج معلمة متنوعة، متفوقاً باستمرار على الأساليب الحالية ذات المعلم الواحد أو المعلمات المتعددة في مجموعة بيانات ImageNet-1K.

Brian B. Moser, Shalini Sarode, Federico Raue, Stanislav Frolov, Krzysztof Adamkiewicz, Arundhati Shanbhag, Joachim Folz (…)2026-02-24
💬 NLP

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

تقدم هذه الورقة البحثية إطار عمل MoDES، وهو إطار عمل لا يتطلب تدريباً يعمل على تسريع نماذج اللغات الكبيرة متعددة الوسائط ذات خليط الخبراء (Mixture-of-Experts) عبر توظيف آلية بوابة محلية معدلة عالمياً وعتبات ثنائية الوسائط لتخطي الخبراء الزائدين عن الحاجة بشكل تكيفي، مما يؤدي إلى تحسين كل من سرعة الاستدلال والدقة بشكل كبير مقارنة بالطرق الحالية.

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang2026-02-24
💻 computer science

LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

يقدم LocateAnything3D إطار عمل أصيلاً لنماذج الرؤية واللغة يعيد صياغة الكشف ثلاثي الأبعاد كمسألة تنبؤ بالرمز التالي باستخدام استراتيجية استدلال "سلسلة الرؤية" (Chain-of-Sight) لتحقيق أداء رائد في مجاله وقدرة على التعميم الصفري على معيار Omni3D.

Yunze Man, Shihao Wang, Guowen Zhang, Johan Bjorck, Zhiqi Li, Liang-Yan Gui, Jim Fan, Jan Kautz, Yu-Xiong Wang, Zhiding (…)2026-02-24
🤖 AI

SelfAI: A self-directed framework for long-horizon scientific discovery

تُعد SelfAI إطار عمل ذاتي التوجيه ومتعدد الوكلاء يعمل على أتمتة الاكتشاف العلمي طويل الأمد عبر ترجمة النوايا البحثية إلى تجارب قابلة للتنفيذ، والموازنة استراتيجياً بين مقايضات الكفاءة والتنوع لتحقيق حلول عالية الجودة بعدد أقل من التجارب المكررة مقارنة بالأساليب الحالية.

Xiao Wu, Ting-Zhu Huang, Liang-Jian Deng, Xiaobing Yu, Yu Zhong, Shangqi Deng, Ufaq Khan, Jianghao Wu, Xiaofeng Liu, Imr (…)2026-02-24
💻 computer science

CheXmask-U: Quantifying uncertainty in landmark-based anatomical segmentation for X-ray images

تقدم هذه الورقة البحثية CheXmask-U، وهو إطار عمل يستفيد من البنى العصبية الهجينة لتقدير عدم اليقين الكامن والتنبؤي في تقسيم معالم الأشعة السينية للصدر، والذي تم التحقق من صحته من خلال تجارب الاضطراب وإصداره كمجموعة بيانات واسعة النطاق لتعزيز متانة وسلامة نماذج التقسيم التشريحي.

Matias Cosarinsky, Nicolas Gaggion, Rodrigo Echeveste, Enzo Ferrante2026-02-24
💻 computer science

Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection

تقترح الورقة البحثية إطار عمل FALCON-SFOD، وهو إطار عمل للكشف عن الأشياء بدون الوصول إلى المصدر، يستفيد من مسبقات النماذج التأسيسية عبر تقنية SPAR لفرض تمثيلات سمات مركزة على الأشياء، ويستخدم تقنية IRPL لتوليد تسميات مستعارة قوية، مما يتغلب على مشكلات انزياح النطاق وفوضى الخلفية المتأصلة في مناهج "المعلم المتوسط" الحالية.

Sairam VCR, Rishabh Lalla, Aveen Dayal, Tejal Kulkarni, Anuj Lalla, Vineeth N Balasubramanian, Muhammad Haris Khan2026-02-24
💻 computer science

Object-WIPER : Training-Free Object and Associated Effect Removal in Videos

تقدم الورقة البحثية Object-WIPER، وهو إطار عمل لا يتطلب تدريباً يستفيد من نماذج المحولات لانتشار النصوص إلى الفيديو (text-to-video diffusion transformers) المُدربة مسبقاً لإزالة الأجسام الديناميكية والتأثيرات البصرية المرتبطة بها من مقاطع الفيديو مع ضمان ملء الفراغات بشكل متسق دلالياً ومتماسك زمنياً.

Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni2026-02-24