🤖 AI

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

يقدم هذا التقرير التقني تحدي EgoCross، وهو معيار لتقييم الإجابة على الأسئلة في فيديوهات منظور الشخص الأول عبر المجالات المختلفة، والذي استضافته مؤتمر EgoVis 2026 لتقييم نماذج اللغات الكبيرة متعددة الوسائط في أربعة مجالات متخصصة من خلال مسارين متميزين، مما أسفر عن أكثر من 1,500 مشاركة وإطلاق موارد عامة للنهوض بهذا المجال.

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang (…)2026-08-06
💻 computer science

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

يقدم DAC-Pose إطار عمل تعاوني مبتكر يعتمد على وكيل مزدوج يجمع بين وكيل الاستدلال الدلالي المسبق لاستنتاج المناطق غير المرئية، ووكيل الترميز البصري المدرك للتباين لنمذجة التشوهات المكانية، مما يحقق توليدًا بشريًا عالي الدقة ومتسق الهوية تحت تحولات زوايا الرؤية الجذرية.

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun2026-08-06
💻 computer science

YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI

تقترح الورقة البحثية YOLO-PVC، وهو إطار عمل خفيف الوزن ومستقل عن النموذج، يعمل على دمج عمليات الكشف المجزأة لكل شريحة ثنائية الأبعاد في تحديدات حجمية ثلاثية الأبعاد مستقرة لأورام الكبد في التصوير بالرنين المغناطيسي من خلال فرض الاستمرارية في العمق وتحسين الامتداد المحوري عبر الإحصاءات القوية ووحدة المعايرة، محققاً أداءً فائقاً على النماذج المرجعية للتجميع الحالية.

Talha Waqas, Mounir Lahlouh, Kawther Taibouni, Mahnoor Waqas, Salar Ahmed, Sébastien Mulé, Yasmina Leroul-Chenoune2026-08-06
🤖 AI

DisMix: Order-Aware Mixup for Medical Imaging via Disentangling Ordinal and Non-Ordinal Features

تُعد DisMix إطار عمل لتقنية الـ mixup مدرك للترتيب في التصوير الطبي، حيث توظف ترميزاً كمياً (VQ-VAE) ثنائي الكود لكشف الفصل بين الميزات الرتبية وغير الرتبية، مما يتيح خلطاً مستقلاً يحافظ على تدرج شدة المرض مع تعزيز تنوع المظهر لتحسين أداء التصنيف الرتبي.

Dileepa Pitawela, Gustavo Carneiro, Hsiang-Ting Chen2026-08-06
🤖 AI

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

تقدم الورقة البحثية CSGen، وهو نموذج انتشار متعدد الوسائط هرمي يستفيد من مجموعة بيانات واسعة النطاق متعددة المجالات، واستراتيجية تحكم تدريجية، وآلية فقدان مدركة للتناثر لتحقيق توليد عالي الدقة وقابل للتحكم للصور ذات الهياكل المنحنية الدقيقة عبر مختلف تطبيقات الوسائط المتعددة.

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie2026-08-06
💻 computer science

MOAT: Model-Agnostic Randomized Transformations for preventing Efficiency Degradation Attacks on ViTs

تقترح هذه الورقة MOAT، وهو دفاع للمعالجة المسبقة غير مرتبط بنموذج محدد يستخدم تحويلات مدخلات عشوائية لحماية نماذج المحولات الرؤية (Vision Transformers) من الهجمات العدائية التي تستهدف تقليم الرموز (token pruning)، مما ينجح في حصر تدهور الكفاءة الحسابية ضمن نطاق 3.4% دون الحاجة إلى تغييرات في بنية النموذج.

Anadi Goyal, Nandish Chattopadhyay, Chandan Karfa, Anupam Chattopadhyay, Norrathep Rattanavipanon2026-08-06
🤖 AI

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

تقترح هذه الورقة استراتيجية "تحسين السياسة النسبية للمجموعات المعايرة للرفض" (RC-GRPO)، وهي استراتيجية تعلم تعزيزي تمكن النماذج اللغوية الكبيرة متعددة الوسائط من رفض الكائنات غير الموجودة بفعالية في مهام فهم التعبيرات المرجعية المعممة دون المساس بدقة تحديد المواقع للأهداف الموجودة.

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang2026-08-06
💻 computer science

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

يُعد UniWorld-View إطار عمل موحداً يجمع بين التوجيه ثلاثي الأبعاد الصريح الواعي بالانسداد ونماذج الانتشار بالفيديو لتحقيق تركيب مشاهد ذات منظور جديد وعالي الدقة، ومتسق هندسياً، وقابل للتحكم بدقة من مدخلات أحادية العين شحيحة ذات قاعدة واسعة.

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan2026-08-06
🤖 machine learning

Design Choices That Matter: A Functional ANOVA Analysis for Remote Sensing Multi-Label Classification

تستخدم هذه الورقة تحليل التباين الوظيفي (functional ANOVA) لتحليل كيفية تأثير خيارات تصميم التعلم العميق المختلفة وتفاعلاتها بشكل منهجي على أداء التصنيف متعدد الملصقات عبر مجموعات بيانات متنوعة للاستشعار عن بعد، مما يكشف أن الاستراتيجيات المثلى تعتمد على خصائص محددة لمجموعة البيانات مثل النطاق والدقة.

Maryam Gholami Shiri, Eva Tuba, Sašo Džeroski, Tome Eftimov, Ana Nikolikj2026-08-06
💻 computer science

Multi-View Face and Gesture Animation with Dynamic Gaussians

تقدم هذه الورقة MVFGA، وهو مسار عمل متعدد الرؤى يجمع بين النمذجة المنفصلة للوجه واليدين مع شبكة بارامترية للجزء العلوي من الجسم وتقنية التقطيع الغاوسي ثلاثي الأبعاد (3D Gaussian splatting) لإنشاء صور رمزية (avatters) واقعية للغاية وعالية الدقة للجزء العلوي من الجسم مع تعبيرات وجه وإيماءات يد دقيقة، مصحوبة بإصدار مجموعة بيانات MVFGA-MoCap.

Alireza Javanmardi, Vippin Kumar Jeetmal, Christen Millerdurai, Alain Pagani, Didier Stricker2026-08-06