💻 computer science

Target-Aware Video Diffusion Models

تقدم هذه الورقة نموذج انتشار فيديو مدرك للهدف يقوم بتوليد فيديوهات لممثلين يتفاعلون مع أشياء محددة عبر أقنعة التجزئة والمطالبات النصية، وذلك باستخدام رمز متخصص وآلية انتباه تقاطعي مضبوطة بدقة لتمكين التخطيط الدقيق للتفاعل بين الإنسان والشيء لتطبيقات مثل تخليق الحركة ثلاثية الأبعاد وإنشاء الفيديو طويل الأمد.

Taeksoo Kim, Hanbyul Joo2026-03-03
🤖 AI

AdaRank: Adaptive Rank Pruning for Enhanced Model Merging

يُعد AdaRank إطار عمل مبتكر لدمج النماذج يقوم بتقليم المكونات المفردة الضارة لمتجهات المهام بشكل تكيفي أثناء وقت الاختبار عبر تقليل الإنتروبيا للتخفيف من التداخل بين المهام وتحقيق أداء رائد عبر مختلف الهياكل الأساسية وتكوينات المهام.

Chanhyuk Lee, Jiho Choi, Chanryeol Lee, Donggyun Kim, Seunghoon Hong2026-03-03
💻 computer science

VR-FuseNet: A Fusion of Heterogeneous Fundus Data and Explainable Deep Network for Diabetic Retinopathy Classification

تقدم هذه الورقة البحثية VR-FuseNet، وهو نموذج تعلم عميق هجين يدمج بنيتي VGG19 وResNet50V2 مع مجموعة بيانات متعددة المصادر متوازنة ومعالجة مسبقاً وتقنيات الذكاء الاصطناعي القابل للتفسير لتحقيق دقة تبلغ 91.824% وكشف قابل للتفسير سريرياً لمرض اعتلال الشبكية السكري.

Shamim Rahim Refat, Ziyan Shirin Raha, Shuvashis Sarker, Faika Fairuj Preotee, MD. Musfikur Rahman, Tashreef Muhammad, M (…)2026-03-03
💻 computer science

Towards Application-Specific Evaluation of Vision Models: Case Studies in Ecology and Biology

تجادل هذه الورقة بأن نماذج الرؤية الحاسوبية المستخدمة في علوم البيئة والأحياء يجب أن تُقيّم باستخدام مقاييس خاصة بالتطبيقات بدلاً من معايير تعلم الآلة القياسية، وتثبت من خلال دراسات حالة حول وفرة الشمبانزي وتقدير نظرات الحمام أن الأداء التقني العالي لا يضمن الدقة في التحليلات العلمية اللاحقة.

Alex Hoi Hang Chan, Otto Brookes, Urs Waldmann, Hemal Naik, Iain D. Couzin, Majid Mirmehdi, Noël Adiko Houa, Emmanuelle (…)2026-03-03
💻 computer science

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

تُعد DeepEyes نموذجاً لغوياً بصرياً ضخماً يستفيد من التعلم المعزز لتعلم "التفكير بالصور" بشكل أصيل من خلال الإدراك النشط، مما يمكنه من ربط الاستدلال بالمعلومات البصرية استراتيجياً دون الحاجة إلى بيانات استدلال مجمعة مسبقاً، ويحقق تحسينات كبيرة في مهام الإدراك والاستدلال والربط.

Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, Xing Yu2026-03-03
💬 NLP

Dynamic Token Reweighting for Robust Vision-Language Models

تقدم هذه الورقة البحثية DTR، وهو دفاع مبتكر أثناء وقت الاستدلال يعمل على إعادة وزن الرموز البصرية ديناميكيًا من خلال تحسين مخازن المفتاح-القيمة (key-value caches) للتخفيف بفعالية من هجمات الاختراق متعددة الوسائط في النماذج اللغوية البصرية مع الحفاظ على القدرات العامة والكفاءة.

Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang2026-03-03
🤖 AI

Probabilistic Kernel Function for Fast Angle Testing

تقدم هذه الورقة دوال نواة احتمالية حتمية قائمة على الإسقاط لاختبار الزوايا السريع في الفضاءات عالية الأبعاد، والتي تلغي الافتراضات التقاربية وتحقق إنتاجية استعلام أعلى بمقدار 2.5 إلى 3 أضعاف من خوارزمية HNSW في البحث عن أقرب جار تقريبي.

Kejing Lu, Chuan Xiao, Yoshiharu Ishikawa2026-03-03
💻 computer science

Point-MoE: Large-Scale Multi-Dataset Training with Mixture-of-Experts for 3D Semantic Segmentation

تقدم الورقة البحثية Point-MoE، وهو إطار عمل "خليط من الخبراء" (Mixture-of-Experts) يتيح تدريباً مشتركاً فعالاً واسع النطاق لنماذج التجزئة الدلالية ثلاثية الأبعاد عبر مجموعات بيانات متنوعة وغير مصنفة، وذلك باستخدام موجه خفيف الوزن لتعيين الرموز (tokens) ديناميكياً لخبراء متخصصين، مما يتغلب على تدهور الأداء الناتج عن الخلط الساذج للبيانات ويحقق نتائج رائدة دون الحاجة إلى تسميات خاصة بكل مجموعة بيانات.

Xuweiyi Chen, Wentao Zhou, Aruni RoyChowdhury, Zezhou Cheng2026-03-03
💬 NLP

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

تقدم هذه الورقة OmniSpatial، وهو معيار مرجعي شامل قائم على علم النفس المعرفي يضم أكثر من 8.4 ألف عينة مشروحة عبر أربع فئات رئيسية، والذي يكشف عن قصور كبير في قدرات الاستدلال المكاني لنماذج الرؤية واللغة الحالية ويستكشف استراتيجيات مثل PointGraph وSpatialCoT لمعالجتها.

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi2026-03-03
🤖 AI

Improving Wildlife Out-of-Distribution Detection: Africas Big Five

تتناول هذه الدراسة تحدي التنبؤات المفرطة في الثقة في تصنيف الحيوانات ضمن العالم المغلق من خلال إثبات أن طرق اكتشاف التوزيع الخارج عن النطاق القائمة على الميزات، ولا سيما طريقة "متوسط أقرب فئة" (Nearest Class Mean) باستخدام ميزات مدربة مسبقًا على مجموعة بيانات "إيميج نت" (ImageNet)، تتفوق بشكل كبير على التقنيات الحالية في تحديد أنواع الحياة البرية غير المعروفة في سياق "الخمسة الكبار" في أفريقيا.

Mufhumudzi Muthivhi, Jiahao Huo, Fredrik Gustafsson, Terence L. van Zyl2026-03-03