💻 computer science

EarlyTom: Early Token Compression Completes Fast Video Understanding

تقترح الورقة البحثية EarlyTom، وهو إطار عمل لا يتطلب تدريباً يقوم بضغط الرموز البصرية في مرحلة مبكرة داخل المشفر الرؤي لتقليل زمن الوصول إلى أول رمز والتكاليف الحسابية بشكل كبير مع الحفاظ على دقة مماثلة للنماذج المرجعية ذات الرموز الكاملة.

Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang2026-05-29
💻 computer science

GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

يُعد GenEraser إطار عمل مبتكر يحقق إزالة عامة وعالية الدقة للأجسام والتأثيرات في مقاطع الفيديو في سيناريوهات العالم المفتوح عبر الاستفيد من خليط خبراء متعدد الشروط مع توجيه نصي ثنائي الأجزاء، وآلية دمج (CFG) عميقة قابلة للتعلم لموازنة الشروط التكيفية، وبنية منفصلة بين المحدد والمحافظ على التفاصيل لحل المقايضة بين التعميم الدلالي والحفاظ على مستوى البكسل.

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian2026-05-29
💻 computer science

Native Audio-Visual Alignment for Generation

تُعد NAVA إطار عمل مبتكر لتوليد الصوت والفيديو معاً، حيث توظف استراتيجية محاذاة صوتية-بصرية أصلية ضمن بنية MMDiT تعتمد على مبدأ "المحاذاة ثم الدمج" لتحقيق تزامن فائق، وجودة فيديو عالية، وتحكم في طابع الصوت الكلامي، وذلك باستخدام 6.3 مليار معلمة فقط.

Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He2026-05-29
💻 computer science

Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation

تقدم هذه الورقة البحثية "Future Forcing"، وهي سياسة لتخزين الـ KV cache لا تتطلب تدريباً لإنتاج الفيديو بالتسلسل التلقائي، تستفيد من استقرار توزيعات الاستعلام (query) قبل تطبيق الـ RoPE لتقدير إحصائيات الاستعلام المستقبلية، مما يتيح اختيار ودمج رموز التخزين المؤقت بناءً على أهميتها المستقبلية لتحسين الاتساق طويل المدى بشكل كبير.

Jiayi Luo, Qiyan Liu, Tengyang Wang, JunHao Liu, Jiayu Chen, Cong Wang, Hanxin Zhu, Chen Gao, Xiaobin Hu, Qingyun Sun, Z (…)2026-05-29
💻 computer science

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

يقدم DirectorBench معياراً تشخيصياً متعدد الوكلاء مخصصاً يقيم توليد الفيديو طويل المدى عبر خمسة أبعاد وعدة ملفات تعريف للمستخدمين لتحديد إخفاقات سير العمل بدقة والمواءمة بشكل وثيق مع التقدير البشري مقارنة بطرق التقييم الإجمالية التقليدية.

Jiamin Chen, Qianben Chen, Jiawen Zhang, Yidi Wu, Yuchen Li, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma2026-05-29
💻 computer science

Geometry Matters: 3D Foundation Priors for Learning Semantic Correspondence

تقدم هذه الورقة إطار عمل للتدريب اللاحق يراعي الأبعاد الثلاثية، يستفيد من SAM3D لتقدير الهندسة الخاصة بكل مثيل ومن واصفات PartField لتحسين سمات النماذج التأسيسية، مما يؤدي إلى تحسين دقة التوافق الدلالي مع تقليل الحاجة إلى الإشراف الهندسي اليدوي.

Artur Jesslen, Olaf Dünkel, Adam Kortylewski2026-05-29
💻 computer science

Evaluation of Conversational Agents: Understanding Culture, Context and Environment in Emotion Detection

تعالج هذه الورقة نقص الاعتبار الثقافي والسياقي في أنظمة اكتشاف العواطف الحالية من خلال اقتراح نموذج هجين يجمع بين الكلام والصورة مع خوارزمية "متوسط التعبير للإطار الصوتي" (Audio-Frame Mean Expression) التي تحقق دقة تتراوح بين 85-96% في تحديد العواطف الأساسية والتهكم داخل المجتمعات الأفريقية السوداء.

Martha Teiko Teye, Yaw Marfo Missah, Emmanuel Ahene, Twum Frimpong, Auxane Boch2026-05-29
💻 computer science

CCS: Clinical Consensus Selection for Radiology Report Generation

تقترح هذه الورقة البحثية "اختيار الإجماع السريري" (CCS)، وهو إطار عمل للاستدلال في وقت التشغيل غير مرتبط بفك التشفيد، يعمل على تحسين توليد تقارير الأشعة من خلال أخذ عينات لعدة مرشحين واختيار المرشح الذي يحقق أعلى إجماع سريري، مستفيداً من مقياس فائدة جديد مرتبط بالصورة ليتفوق على فك التشفيد القياسي أحادي المسار ونماذج "الأفضل من N" العامة.

Xi Zhang, Yingshu Li, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho2026-05-29
💻 computer science

LiveSVG: Zero-Shot SVG Animation via Video Generation

يُعد LiveSVG إطار عمل يعتمد على تقنية التعلم الصفري (zero-shot) لإنشاء رسوم متحركة بصيغة SVG قابلة للتعديل عبر ملاءمة الهندسة المتجهة للفيديوهات المستهدفة الناتجة عن نماذج الانتشار من صورة إلى فيديو، وذلك باستخدام تمثيل حركة ثنائي المستوى واستراتيجية إعادة تلوين مبتكرة لتحقيق تشوهات معقدة ومتوافقة مع الأوامر النصية دون الحاجة إلى هياكل عظمية أو مسبقات معرفية خاصة بالفئات.

Matan Levy, Ran Margolin, Bar Cavia, Dvir Samuel, Yael Pritch, Shmuel Peleg, Alex Rav Acha, Ariel Shamir, Dani Lischinsk (…)2026-05-29
💻 computer science

Cycle Consistency in Video Object-Centric Learning

تقترح هذه الورقة البحثية "اتساق الدورة الضمني" (Implicit Cycle Consistency - ICC)، وهو نهج مبتكر ينقل قيود اتساق الدورة من فضاء الفتحات الكامن الغامض إلى متشعب إعادة البناء المستمر لمنع انهيار الميزات وتمكين التعلم الذاتي القوي للأجسام في الفيديو المتمحور حول الأشياء.

Rongzhen Zhao, Zhiyuan Li, Ruonan Wei, Juho Kannala, Joni Pajarinen2026-05-29