💻 computer science

VIRTUE: Versatile Video Retrieval Through Unified Embeddings

تُعد VIRTUE إطار عمل متعدد الاستخدامات لاسترجاع الفيديو، حيث تستفيد من نموذج لغوي كبير موحد متعدد الوسائط مع محاذاة تباينية وتدريب باستخدام تقنية LoRA لتحقيق أداء رائد في استرجاع البيانات الصفرية (zero-shot) عبر استرجاع المجموعات، وتحديد اللحظات، والاستعلامات متعددة الوسائط المركبة، مما يضاهي الأنظمة المتخصصة التي تتدرب على مجموعات بيانات أكبر بكثير.

Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag2026-03-24
🤖 machine learning

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

تقدم الورقة البحثية Memory-V2V، وهو إطار عمل لانتشار الفيديو-إلى-فيديو معزز بالذاكرة يحافظ على الاتساق عبر الدورات المتكررة في سير عمل التحرير التكراري من خلال تخزين واسترجاع التعديلات السابقة كقيود مهيكلة، مما يمنع الانحراف البصري مع الحفاظ على الجودة بتكاليف حوسبة متواضعة.

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong2026-03-24
💻 computer science

Causal World Modeling for Robot Control

تقدم هذه الورقة البحثية LingBot-VA، وهو إطار عمل انتشار ذاتي الانحدار يوحد بين نمذجة عالم الفيديو والتدريب المسبق للرؤية واللغة عبر فضاء كامن مشترك، وتدفق مغلق الحلقة، واستدلال غير متزامن لتحقيق تحكم روبوتي طويل الأمد يتسم بالكفاءة، والقدرة على التعميم، وكفاءة البيانات.

Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen (…)2026-03-24
💻 computer science

Evaluating OCR Performance for Assistive Technology: Effects of Walking Speed, Camera Placement, and Camera Type

تقيم هذه الدراسة بشكل منهجي أداء التعرف الضوئي على الحروف (OCR) لتقنيات المساعدة في الظروف الثابتة والديناميكية، حيث كشفت أن الدقة تنخفض مع زيادة سرعة المشي وزوايا الرؤية الأوسع، مع تحديد "Google Vision" وكاميرا الهاتف الرئيسية كأفضل محرك وجهاز على التوالي، بينما حقق الوضع المثبت على الكتف أعلى متوسط بين وضعيات الجسم.

Junchi Feng, Nikhil Ballem, Mahya Beheshti, Giles Hamilton-Fletcher, Todd Hudson, Maurizio Porfiri, William H. Seiple, J (…)2026-03-24
💻 computer science

BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection

تقدم الورقة البحثية BAAF، وهو إطار عمل مبتكر يحول أي مصنفات الفئة الواحدة إلى كواشف حالات شاذة للصور غير خاضعة للإشراف ذات أداء عالٍ، وذلك من خلال الاستفادة من تجميع البوتستراب لتصفية بيانات التدريب بحثاً عن الحالات الشاذة، مما يحقق أداءً فائقاً على مجموعات البيانات المرجعية دون الحاجة إلى إجراء تعديلات على الكواشف الأساسية.

Declan McIntosh, Alexandra Branzan Albu2026-03-24
💻 computer science

Tri-path DINO: Feature Complementary Learning for Remote Sensing Multi-Class Change Detection

تقترح الورقة البحثية Tri-path DINO، وهي بنية مبتكرة تستفيد من استراتيجية تعلم ميزات تكميلية ثلاثية المسارات مع عمود فقري من نوع DINOv3، ومسار سيامي مساعد، وآلية انتباه متعددة المقاييس لتحقيق كشف تغيير متعدد الفئات قوي وقابل للتفسير في صور الاستشعار عن بعد.

Kai Zheng, Hang-Cheng Dong, Shoulei Liu, Zhenkai Wu, Fupeng Wei, Lei Ding, Wei Zhang2026-03-24
💻 computer science

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

يقدم MagicSeg خط معالجة جديداً يعتمد على الانتشار يقوم تلقائياً بتوليد صور عالية الدقة مع أقنعة زيفة دقيقة وعينات سلبية مضادة مقترنة لتدريب نماذج التجزئة الدلالية ذات العالم المفتوح مسبقاً، محققاً أداءً هو الأفضل في فئته على مجموعات البيانات المرجعية دون الاعتماد على البيانات المكلفة التي يدوّنها البشر.

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang2026-03-24
💻 computer science

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

تقدم هذه الورقة مفهوم "الحصرية البصرية" (Visual Exclusivity)، وهو تهديد مرن قائم على الصور ينشأ فيه الضرر من التفكير في المحتوى البصري، وتقترح إطار العمل الوكيل "MM-Plan"، الذي يحقق معدلات نجاح هجوم أعلى بكثير ضد النماذج متعددة الوسائط الرائدة من خلال تركيب استراتيجيات عالمية متعددة الجولات بدلاً من الاعتماد على الهجمات الهشة القائمة على الحمولة.

Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy2026-03-24
💻 computer science

Your Robot Will Feel You Now: Empathy in Robots and Embodied Agents

تستعرض هذه الورقة الأبحاث الحالية حول تطبيق التعاطف في الروبوتات والوكلاء الحواريين المتجسدين من خلال الذكاء الاجتماعي والعاطفي متعدد الوسائط، بهدف تطبيق هذه الرؤى على الوكلاء اللغويين المعاصرين مثل ChatGPT.

Angelica Lim, Ö. Nilay Yalçin2026-03-24
⚡ electrical engineering

MiSiSUn: Minimum Simplex Semisupervised Unmixing

تقدم هذه الورقة البحثية MiSiSUn، وهو أسلوب هندسي جديد لفك الخلط شبه المُشرف يدمج هندسة البيانات عبر عقوبة حجم السيمبلكس (simplex-volume penalty) ليتفوق بشكل كبير على التقنيات الرائدة في أحدث ما توصل إليه العلم على كل من مجموعات البيانات المحاكات والواقعية، مع إتاحة تنفيذه وأدواته ذات الصلة كحزم برمجية مفتوحة المصدر بلغة بايثون.

Behnood Rasti, Bikram Koirala, Paul Scheunders2026-03-24