💻 computer science

Veda: Scalable Video Diffusion via Distilled Sparse Attention

تُعد Veda إطار عمل للانتباه المتناثر المقطر الذي يسرع عمليات انتشار الفيديو القابلة للتوسع من خلال مواءمة اختيار البلاطات مع هندسة الانتباه الكامل عبر التقييم المدرك للإحصائيات والتقسيم المدرك للرؤوس، محققةً بذلك تسريعاً كبيراً دون المساس بجودة التوليد.

Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi2026-05-29
💻 computer science

Supercharging Thermal Gaussian Splatting with Depth Estimation

تقترح الورقة البحثية تقنية "Thermal-to-Depth Gaussian Splatting" (TDg)، وهي طريقة أحادية النمط تستفيد من الصور الحرارية وتقدير العمق للتفوق على النماذج المرجعية متعددة الأنماط في جودة التصوير مع تقليل وقت التدريب بشكل كبير، مما يتيح إعادة بناء المشاهد ثلاثية الأبعاد بكفاءة لتطبيقات مثل المراقبة والفحص الصناعي دون الاعتماد على الضوء المرئي.

Manoj Biswanath, Chenxin Cai, Hannah Schieber, Daniel Roth, Benjamin Busam2026-05-29
💻 computer science

Colored Noise Diffusion Sampling

تقدم هذه الورقة البحثية "أخذ عينات الضوضاء الملونة" (CNS)، وهو حل للوقت الاستدلالي، خالي من التدريب، وقابل للتوصيل والتشغيل، يعمل على تحسين توليد الصور في نماذج الانتشار عبر استبدال الضوضاء البيضاء المنتظمة بجدول ضوضاء ديناميكي يعتمد على التردد، والذي يتوافق بشكل أفضل مع الانحياز الطيفي المتأصل للنموذج لتحقيق درجات FID أقل بكثير عبر مختلف البنى الهيكلية.

Hadar Davidson, Noam Issachar, Sagie Benaim2026-05-29
⚡ electrical engineering

Benchmarking Single-Factor Physical Video-to-Audio Generation

تقدم هذه الورقة FlatSounds، وهو معيار لتقييم نماذج توليد الصوت من الفيديو بناءً على قدراتها في الاستدلال الفيزيائي من خلال اختبارات واقعية مضادة محكومة، كاشفةً أنه بينما تعمل التسميات التوضيحية النصية على تحسين الدقة الدلالية، إلا أنها غالباً ما تؤدي إلى تدهور المحاذاة الزمنية، وأن النماذج الحالية تعتمد بشكل مفرط على النصوص بدلاً من تعلم العمليات الفيزيائية مباشرة من البيانات المرئية.

Tingle Li, Siddharth Gururani, Kevin J. Shih, Gantavya Bhatt, Sang-gil Lee, Zhifeng Kong, Arushi Goel, Gopala Anumanchip (…)2026-05-29
💻 computer science

YoCausal: How Far is Video Generation from World Model? A Causality Perspective

تقدم هذه الورقة YoCausal، وهو معيار مرجعي مبتكر يستفيد من فيديوهات واقعية معكوسة زمنياً لتقييم نماذج انتشار الفيديو، كاشفاً أنه بينما يمكن لهذه النماذج إدراك سهم الزمن، إلا أنها لا تزال تفتقر إلى قدرات الاستنتاج السببي الحقيقي مقارنة بالإدراك البشري.

You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang2026-05-29
💻 computer science

AdaState: Self-Evolving Anchors for Streaming Video Generation

تقدم AdaState مرساة كامنة تكيفية ذاتية التطور تحل محل المرجع الساكن للإطار الأول في نماذج انتشار الفيديو ذات التوليد الذاتي، مما يتيح تقدماً طبيعياً للمشهد وحركة أغنى من خلال معاملة الزمن كعنصر نسبي ودمج التكرار في عملية التوليد.

Yusuf Dalva, Pinar Yanardag2026-05-29
🤖 AI

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

تقدم هذه الورقة البحثية VideoMLA، وهي بنية مبتكرة تطبق آلية الانتباه الكامن متعدد الرؤوس (Multi-Head Latent Attention) على نماذج الانتشار الفيديوية ذاتية الانحدار لمدة دقيقة واحدة، محققةً خفضاً بنسبة 92.7% في ذاكرة التخزين المؤقت لـ KV وتحسيناً في معدل الإنتاجية بمقدار 1.23 ضعفاً مع الحفاظ على جودة النموذج الأساسي أو تجاوزها، على الرغم من نجاح هذه الطريقة رغم أن آلية الانتباه مسبقة التدريب ليست منخفضة الرتبة بطبيعتها.

Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag2026-05-29
💻 computer science

GMOS: Grounding Moving Object Segmentation in 3D Space and Time

تقدم هذه الورقة البحثية إطار عمل GMOS، وهو إطار مبتكر يعمل على تأصيل تقسيم الأجسام المتحركة (Moving Object Segmentation) في الفضاء والزمن ثلاثي الأبعاد للتغلب على قيود النهج المعتمدة على البعدين (2D) والنهج القائمة على التسلسل، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات GMOS-2K المُعدة حديثاً وبروتوكول تقييم دقيق زمنياً مع تمكين الاستدلال السريع واللحظي.

Junyu Xie, Tengda Han, Weidi Xie, Andrew Zisserman2026-05-29
💻 computer science

Take Only What You Need: Rank Minimization as an Implicit Forgetting Regularizer in Continual Learning

تقترح هذه الورقة البحثية CoDyRA، وهي طريقة للتعلم المستمر توظف تقليل الرتبة كمنظم ضمني للنسيان داخل تحديثات LoRA لموازنة المرونة والاستقرار ديناميكيًا، مما يؤدي إلى تفوقها على الأساليب الحالية عبر معايير قياس متعددة.

Haodong Lu, Chongyang Zhao, Jason Xue, Lina Yao, Kristen Moore, Dong Gong2026-05-28
💻 computer science

Chirpy3D: Part-Aware Multi-View Diffusion for Creative Fine-Grained Object Generation

يُعد Chirpy3D إطار عمل جديد للانتشار متعدد الرؤى ومعتمد على الأجزاء، يتعلم فضاءً كامناً هرمياً للأجزاء من صور ثنائية الأبعاد غير محددة الوضعية دون الحاجة إلى بيانات ثلاثية الأبعاد أو تعليقات توضيحية يدوية، مما يتيح التحكم الحدسي على مستوى الأجزاء وتوليد كائنات ثلاثية الأبعاد متماسكة من خلال اتساق الميزات ذاتي التوجيه.

Kam Woh Ng, Jing Yang, Jia Wei Sii, Chee Seng Chan, Jiankang Deng, Yi-Zhe Song, Tao Xiang, Xiatian Zhu2026-05-28