💻 computer science

π3\pi^3: Permutation-Equivariant Visual Geometry Learning

تقدم الورقة البحثية π3\pi^3، وهي شبكة عصبية أمامية (feed-forward) مبتكرة تحقق أداءً هو الأفضل في حالته (state-of-the-art) في مهام إعادة بناء الهندسة البصرية من خلال توظيف بنية متوافقة تماماً مع التبديل (fully permutation-equivariant) للتنبؤ بوضعيات الكاميرا وخرائط النقاط دون الاعتماد على منظور مرجعي ثابت.

Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong (…)2026-03-10
💻 computer science

Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery

تقترح هذه الورقة إطار عمل يعتمد على محول الرؤية (Vision Transformer)، يستفيد من الإشراف الضعيف المدفوع بتحليل المكونات الرئيسية (PCA) لتوسيع نطاق التوصيفات اليدوية المحدودة من أجل تحسين تقسيم المناطق المتضررة من الكوارث باستخدام صور الأقمار الصناعية "سنتينل-2" (Sentinel-2) و"فورموسات-5" (Formosat-5)، مما يعزز موثوقية وقابلية توسع منتج القيمة المضافة الطارئ (EVAP) التابع لوكالة فضاء تايوان في السيناريوهات التي تشح فيها البيانات الأرضية الحقيقية.

Yi-Shan Chu, Hsuan-Cheng Wei2026-03-10
💻 computer science

NS-Net: Decoupling CLIP Semantic Information through NULL-Space for Generalizable AI-Generated Image Detection

تقترح الورقة البحثية NS-Net، وهو إطار كشف مبتكر يعمل على فصل المعلومات الدلالية عالية المستوى عن ميزات CLIP باستخدام إسقاط الفضاء الصفري (NULL-Space projection) والتعلم التبايني لتحقيق تعميم فائق في تحديد الصور المولدة بواسطة الذكاء الاصطناعي عبر نماذج توليدية متنوعة وغير معروفة.

Jiazhen Yan, Fan Wang, Weiwei Jiang, Ziqiang Li, Zhangjie Fu2026-03-10
💻 computer science

TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation

تقدم هذه الورقة البحثية نموذج TransUNet-GradCAM، وهو نموذج هجين يجمع بين "Vision Transformer" و"U-Net" يعمل على تقسيم قرح القدم السكري بفعالية من خلال الجمع بين الانتباه العالمي واستخراج الميزات المحلية، محققاً دقة عالية في مجموعات البيانات الداخلية والخارجية مع توفير تصورات قابلة للتفسير للفائدة السريرية.

Akwasi Asare, Mary Sagoe, Justice Williams Asare, Stephen Edward Moore2026-03-10
💻 computer science

S2^2Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

تقترح الورقة البحثية إطار عمل S2^2Q-VDiT، وهو إطار للكمية ما بعد التدريب لنماذج محولات انتشار الفيديو (video diffusion transformers) يحقق أداءً غير منقوص تحت كمية W4A6 عبر استخدام اختيار البيانات البارزة المدرك لهيسيان (Hessian-aware) وتقطير الرموز المتناثر الموجه بالانتباه (attention-guided sparse token distillation) للتغلب على تباين المعايرة وتحديات التعلم الناتجة عن تسلسلات الرموز الطويلة.

Weilun Feng, Haotong Qin, Chuanguang Yang, Xiangqi Li, Han Yang, Yuqi Li, Zhulin An, Libo Huang, Michele Magno, Yongjun (…)2026-03-10
💻 computer science

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

يقدم Video-EM إطار عمل للذاكرة العرضية متمحوراً حول الأحداث وغير معتمد على التدريب، يعزز فهم مقاطع الفيديو طويلة المدى من خلال توجيه نموذج لغوي كبير لتحديد المواقع، وتقسيم، وتكرير اللحظات ذات الصلة بالاستعلام إلى خط زمني للأحداث مدمج ومتماسك زمنياً، مما يتغلب على قيود السياق في النماذج اللغوية الكبيرة للفيديو الحالية دون الحاجة إلى تغييرات هيكلية.

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu (…)2026-03-10
💻 computer science

PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis

إن PhysGM هو إطار عمل تغذية أمامية يتنبأ بشكل مشترك بتمثيلات غاوس ثلاثية الأبعاد والخصائص الفيزيائية من صورة واحدة لتمكين محاكاة رباعية الأبعاد فورية وعالية الدقة، مستفيداً من مجموعة بيانات جديدة تسمى PhysAssets وتحسين التفضيل المباشر للتغلب على قيود الطرق السابقة البطيئة، والمعتمدة بكثافة على التحسين، والمنفصلة فيزيائياً.

Chunji Lv, Zequn Chen, Donglin Di, Weinan Zhang, Hao Li, Wei Chen, Yinjie Lei, Changsheng Li2026-03-10
💻 computer science

Mix-modal Federated Learning for MRI Image Segmentation

تقدم هذه الورقة MixMFL، وهو نموذج تعلم اتحادي غير مركزي جديد لتقسيم صور الرنين المغناطيسي يعالج عدم تجانس البيانات والأنماط على مستوى العميل من خلال إطار عمل MDM-MixMFL المقترح الذي يتميز بفصل الأنماط لتوفير تحديثات مخصصة ومشتركة، وآلية ذاكرة للتعويض عن الأنماط المحلية غير المكتملة.

Guyue Hu, Siyuan Song, Jingpeng Sun, Zhe Jin, Chenglong Li, Jin Tang2026-03-10
⚡ electrical engineering

Classification of Driver Behaviour Using External Observation Techniques for Autonomous Vehicles

تقدم هذه الدراسة إطار عمل مبتكر للرؤية الحاسوبية يستخدم تقنيات المراقبة الخارجية، بما في ذلك كشف الأشياء القائم على نموذج YOLO ومراقبة المسارات، لتصنيف سلوكيات السائقين المشتتين والمختلين في المركبات غير المتصلة دون الاعتماد على الاتصال بين المركبات.

Ian Nell, Shane Gilroy2026-03-10
💻 computer science

UltraUPConvNet: A UPerNet- and ConvNeXt-Based Multi-Task Network for Ultrasound Tissue Segmentation and Disease Prediction

تُعد UltraUPConvNet إطار عمل متعدد المهام وفعال حاسوبياً، يعتمد على UPerNet وConvNeXt، ويقوم في آن واحد بمهام تقسيم أنسجة الموجات فوق الصوتية والتنبؤ بالأمراض، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات واسعة النطاق مع تقليل العبء الحسابي.

Zhi Chen, Le Zhang2026-03-10