💻 computer science

AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

يقدم AlignTok استراتيجية محاذاة ثلاثية المراحل تعمل على تكييف المشفرات البصرية التأسيسية سابقة التدريب لتصبح أجهزة ترميز غنية دلالياً، مما يسرع بشكل كبير من تقارب نماذج الانتشار ويحسن جودة توليد الصور مقارنة بمشفرات VAE التقليدية.

Bowei Chen, Sai Bi, Hao Tan, He Zhang, Tianyuan Zhang, Zhengqi Li, Yuanjun Xiong, Jianming Zhang, Kai Zhang2026-02-24
🤖 machine learning

Flower: A Flow-Matching Solver for Inverse Problems

تقدم الورقة البحثية Flower، وهو حل تكراري للمسائل العكسية الخطية يستفيد من نماذج التدفق مسبقة التدريب لتقريب أخذ عينات التوزيع البعدي البايزي من خلال عملية ثلاثية الخطوات تتمثل في تقدير الوجهة، وإسقاط الجدوى، وتقدم الوقت، محققاً جودة إعادة بناء هي الأفضل في فئتها مع ثبات المعلمات الفائقة عبر مهام متنوعة.

Mehrsa Pourya, Bassam El Rawas, Michael Unser2026-02-24
🤖 AI

VIRTUE: Visual-Interactive Text-Image Universal Embedder

تقدم هذه الورقة البحثية VIRTUE، وهو نموذج تضمين بصري-تفاعلي عالمي للنصوص والصور يدمج قدرات التجزئة للسماح بمطالبات المستخدم المحددة لمنطقة معينة، محققاً أداءً هو الأفضل في فئته على كل من المعايير القياسية متعددة الوسائط ومهمة استرجاع بصري-تفاعلي جديدة واسعة النطاق.

Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji2026-02-24
🤖 AI

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

تقدم هذه الورقة البحثية RewardMap، وهو إطار عمل للتعلم التعزيزي متعدد المراحل يستفيد من مجموعة بيانات ذات مكافأة كثيفة (ReasonMap-Plus) وإشارات مكافأة مدركة للصعوبة للتغلب على تحديات المكافأة المتفرقة، مما يعزز بشكل كبير قدرات الاستدلال البصري دقيق التفاصيل والفهم المكاني للنماذج اللغوية الكبيرة متعددة الوسائط.

Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong, Jianke Zhu, Huan Wang2026-02-24
💻 computer science

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

يُعد LinVideo إطار عمل للتدريب اللاحق لا يعتمد على البيانات، يحقق تعقيد انتباه بمقدار O(n) في توليد الفيديو من خلال الاختيار التلقائي للطبقات لتحويل الانتباه الخطي عبر نهج التصنيف الثنائي وتوظيف هدف مطابقة التوزيع في أي وقت، مما يؤدي إلى تسريع كبير مع الحفاظ على جودة التوليد.

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang2026-02-24
💻 computer science

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

يقترح MergeMix نموذج تعزيز موحداً يجسّر الفجوة بين الضبط الدقيق الخاضع للإشراف والتعلم المعزز من خلال الاستفيد من تقنية Mixup القائمة على الرموز (token-based Mixup) لتوليد صور متوافقة سياقياً وتحسين هوامش التفضيل، مما يعزز قابلية التوسع والكفاءة والتعميم للنماذج اللغوية الكبيرة متعددة الوسائط.

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang2026-02-24
💬 NLP

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

تقدم هذه الورقة BEAT، وهو إطار عمل مبتكر يقوم بحقن أبواب خلفية بصرية في الوكلاء المجسدين القائمين على نماذج اللغة والرؤية (VLM) من خلال الاستفراد من محفزات الأشياء ومخطط تدريب ثنائي المرحلة يتميز بتعلم المحفز التبايني لتحقيق معدلات نجاح هجوم عالية مع الحفاظ على أداء المهام الحميدة.

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel K (…)2026-02-24
🤖 machine learning

Countering Multi-modal Representation Collapse through Rank-targeted Fusion

تقترح هذه الورقة البحثية "Rank-enhancing Token Fuser"، وهو إطار عمل مؤصل نظرياً يستخدم الرتبة الفعالة لمواجهة كل من انهيار الميزات وانهيار الأنماط في دمج الوسائط المتعددة في آن واحد، مما يحسن بشكل كبير من أداء توقع الأفعال البشرية من خلال المزج الانتقائي للميزات المتكاملة عبر الوسائط.

Seulgi Kim, Kiran Kokilepersaud, Mohit Prabhushankar, Ghassan AlRegib2026-02-24
🤖 machine learning

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

تُعد StreamDiffusionV2 خط تدفق (pipeline) قابل للتوسع ولا يتطلب تدريباً، يتيح بثاً فيديو تفاعلياً في الوقت الفعلي باستخدام نماذج الانتشار بالفيديو عبر دمج الجدولة الواعية بـ SLO، والتحكم الواعي بالحركة، والتنسيق المتوازي لتحقيق زمن انتقال فائق الانخفاض وإنتاجية عالية على مجموعات وحدات معالجة الرسومات غير المتجانسة.

Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Manee (…)2026-02-24
🤖 AI

PRISM: Diversifying Dataset Distillation by Decoupling Architectural Priors

يُعد PRISM إطار عمل لتقطير البيانات يعمل على تعزيز التنوع داخل الفئة والقدرة على التعميم من خلال فصل أهداف مطابقة اللوجيت (logit-matching) والانتظام (regularization) للاستفادة من الأولويات المعمارية من نماذج معلمة متنوعة، متفوقاً باستمرار على الأساليب الحالية ذات المعلم الواحد أو المعلمات المتعددة في مجموعة بيانات ImageNet-1K.

Brian B. Moser, Shalini Sarode, Federico Raue, Stanislav Frolov, Krzysztof Adamkiewicz, Arundhati Shanbhag, Joachim Folz (…)2026-02-24