💻 computer science

Context Forcing: Consistent Autoregressive Video Generation with Long Context

تقترح الورقة البحثية "Context Forcing" (فرض السياق)، وهو إطار عمل مبتكر يعالج عدم التوافق بين الطالب والمعلم في توليد الفيديو الطويل من خلال توظيف معلم ذي سياق طويل وبنية ذاكرة "Slow-Fast" لتمكين توليد فيديو متسق وفي الوقت الفعلي بسياقات تتجاوز 20 ثانية.

Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen2026-02-06
🤖 AI

Shared LoRA Subspaces for almost Strict Continual Learning

تقترح الورقة البحثية "Share"، وهي طريقة جديدة للتعلم المستمر ذات كفاءة في المعلمات، تعمل على تحديث فضاء فرعي مشترك منخفض الرتبة ديناميكيًا لدمج المعرفة من مهام وأنماط متنوعة دون إعادة تشغيل البيانات أو استخدام محولات متعددة، مما يحقق تخفيضات كبيرة في الذاكرة والمعلمات مع منع النسيان الكارثي.

Prakhar Kaushik, Ankit Vaidya, Shravan Chaudhari, Rama Chellappa, Alan Yuille2026-02-06
🤖 AI

Deep Multimodal Learning with Missing Modality: A Survey

تقدم هذه الدراسة المراجعة الشاملة الأولى لطرق التعلم العميق للتعلم متعدد الوسائط مع فقدان أحد الأنماط (MLMM)، حيث تفصل دوافعه، واختلافاته عن الإعدادات القياسية، والتقنيات الحالية، والتطبيقات، ومجموعات البيانات، والتحديات المستقبلية.

Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro2026-02-05
🤖 machine learning

Sparse-to-Sparse Training of Diffusion Models

تقدم هذه الورقة البحثية النموذج الجديد للتدريب من "المتفرق إلى المتفرق" (sparse-to-sparse) لنماذج الانتشار، مبرهنةً أن تدريب النسخ المتفرقة من الصفر يمكن أن يضاهي أو يتجاوز أداء النظراء الكثاف مع تقليل التكاليف الحسابية بشكل كبير في كل من التدريب والاستدلال.

Inês Cardoso Oliveira, Decebal Constantin Mocanu, Luis A. Leiva2026-02-05
💻 computer science

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

تقدم هذه الورقة البحثية LoVR، وهو معيار مرجعي واسع النطاق لاسترجاع الفيديو والنص الطويل يتميز بأكثر من 40,000 مقطع دقيق وتسميات توضيحية عالية الجودة تم إنشاؤها عبر مسار تحسين مبتكر قائم على نماذج الرؤية واللغة الكبيرة (VLM)، والمصمم للتغلب على قيود مجموعات البيانات الحالية وتقييم نماذج الاسترجاع متعددة الوسائط المتقدمة بدقة.

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang2026-02-05
💻 computer science

Benchmarking Foundation Models for Mitotic Figure Classification

تُثبت هذه الورقة أن تكييف النماذج التأسيسية عبر التكيف منخفض الرتبة (LoRA) يتفوق بشكل كبير على الاختبار الخطي القياسي ويقترب من النماذج المرجعية للبيانات الكاملة في تصنيف الأشكال الانقسامية، مما يوفر أداءً فائقاً مع البيانات المحدودة وقوة تعزيزية عبر نطاقات الأورام غير المرئية.

Jonas Ammeling, Jonathan Ganz, Emely Rosbach, Ludwig Lausser, Christof A. Bertram, Katharina Breininger, Marc Aubreville2026-02-05
💻 computer science

Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery

تقدم هذه الورقة FacadeTrack، وهو إطار عمل موجّه لغوياً يستفيد من صور عرض الشارع لتقييم إشغال المباني بعد الكوارث بدقة عالية وقابلية للتفسير، متفوقاً على الطرق المرجعية من خلال الفصل بين الإدراك والاستنتاج التحفظي لدعم التخصيص العادل لموارد الطوارئ.

Yiming Xiao, Archit Gupta, Miguel Esparza, Yu-Hsuan Ho, Antonia Sebastian, Hannah Weas, Rose Houck, Ali Mostafavi2026-02-05
💬 NLP

Scaling Agents for Computer Use

تقدم الورقة البحثية "Behavior Judge" (BJudge)، وهو إطار عمل يعمل على تحسين موثوقية وكلاء استخدام الكمبيوتر من خلال تقييم واختيار أفضل النتائج من بين عدة عمليات تنفيذ باستخدام السرد السلوكي، محققاً أداءً هو الأفضل في فئته على منصة OSWorld بما يتجاوز القدرات البشرية.

Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang2026-02-05
🤖 AI

HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion

يُعد HAVIR نموذجاً مبتكراً لإعادة بناء الصور من نشاط الدماغ، حيث يستفيد من نظرية القشرة البصرية الهرمية لاستخراج الميزات الهيكلية والدلالية بشكل منفصل من النشاط العصبي، ودمجهما عبر نموذج الانتشار متعدد القدرات الموجه بـ CLIP لتحقيق استرداد فائق للصور في المشاهد المعقدة مقارنة بالأساليب الحالية.

Shiyi Zhang, Dong Liang, Hairong Zheng, Yihang Zhou2026-02-05
💻 computer science

Adaptive Knowledge Transferring with Switching Dual-Student Framework for Semi-Supervised Medical Image Segmentation

تقترح هذه الورقة إطار عمل لنقل المعرفة التكيفي يتميز ببنية "الطالب المزدوج التبدلي" واستراتيجية "المتوسط المتحرك الأسي المدرك للخسارة"، للتغلب على تعزيز الخطأ ونقل المعرفة غير الموثوق، مما يحقق أداءً هو الأفضل في حالته في تقسيم الصور الطبية ثلاثية الأبعاد شبه الموجهة.

Hoang-Thien Nguyen, Thanh-Huy Nguyen, Ba-Thinh Lam, Vi Vu, Bach X. Nguyen, Jianhua Xing, Tianyang Wang, Xingjian Li, Min (…)2026-02-05