💻 computer science

Query-Based Adaptive Aggregation for Multi-Dataset Joint Training Toward Universal Visual Place Recognition

تقترح هذه الورقة تقنية التجميع التكيفي القائم على الاستعلام (QAA)، وهي تقنية مبتكرة لتجميع الميزات تستخدم استعلامات متعلمة ككتب رموز مرجعية لمعالجة التباينات في مجموعات البيانات بفعالية في التدريب المشترك متعدد المجموعات، مما يحقق التعرف البصري العالمي القوي على الأماكن مع توازن في التعميم وأداء يضاهي أحدث ما توصل إليه العلم.

Jiuhong Xiao, Yang Zhou, Giuseppe Loianno2026-03-10
💻 computer science

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

تقترح هذه الورقة البحثية MCULoRA، وهو إطار عمل جديد فعال في كفاءة المعلمات يتميز بالتكيف منخفض الرتبة المدرك لدمج الأنماط والضبط الدقيق الديناميكي للمعلمات لحل صراعات التدرج وتحسين الأداء في التعرف على العواطف متعدد الوسائط غير المكتمل.

Xinkui Zhao, Jinsong Shu, Yangyang Wu, Guanjie Cheng, Zihe Liu, Naibo Wang, Shuiguang Deng, Zhongle Xie, Jianwei Yin2026-03-10
💻 computer science

π3\pi^3: Permutation-Equivariant Visual Geometry Learning

تقدم الورقة البحثية π3\pi^3، وهي شبكة عصبية أمامية (feed-forward) مبتكرة تحقق أداءً هو الأفضل في حالته (state-of-the-art) في مهام إعادة بناء الهندسة البصرية من خلال توظيف بنية متوافقة تماماً مع التبديل (fully permutation-equivariant) للتنبؤ بوضعيات الكاميرا وخرائط النقاط دون الاعتماد على منظور مرجعي ثابت.

Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong (…)2026-03-10
💻 computer science

Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery

تقترح هذه الورقة إطار عمل يعتمد على محول الرؤية (Vision Transformer)، يستفيد من الإشراف الضعيف المدفوع بتحليل المكونات الرئيسية (PCA) لتوسيع نطاق التوصيفات اليدوية المحدودة من أجل تحسين تقسيم المناطق المتضررة من الكوارث باستخدام صور الأقمار الصناعية "سنتينل-2" (Sentinel-2) و"فورموسات-5" (Formosat-5)، مما يعزز موثوقية وقابلية توسع منتج القيمة المضافة الطارئ (EVAP) التابع لوكالة فضاء تايوان في السيناريوهات التي تشح فيها البيانات الأرضية الحقيقية.

Yi-Shan Chu, Hsuan-Cheng Wei2026-03-10
💻 computer science

NS-Net: Decoupling CLIP Semantic Information through NULL-Space for Generalizable AI-Generated Image Detection

تقترح الورقة البحثية NS-Net، وهو إطار كشف مبتكر يعمل على فصل المعلومات الدلالية عالية المستوى عن ميزات CLIP باستخدام إسقاط الفضاء الصفري (NULL-Space projection) والتعلم التبايني لتحقيق تعميم فائق في تحديد الصور المولدة بواسطة الذكاء الاصطناعي عبر نماذج توليدية متنوعة وغير معروفة.

Jiazhen Yan, Fan Wang, Weiwei Jiang, Ziqiang Li, Zhangjie Fu2026-03-10
💻 computer science

TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation

تقدم هذه الورقة البحثية نموذج TransUNet-GradCAM، وهو نموذج هجين يجمع بين "Vision Transformer" و"U-Net" يعمل على تقسيم قرح القدم السكري بفعالية من خلال الجمع بين الانتباه العالمي واستخراج الميزات المحلية، محققاً دقة عالية في مجموعات البيانات الداخلية والخارجية مع توفير تصورات قابلة للتفسير للفائدة السريرية.

Akwasi Asare, Mary Sagoe, Justice Williams Asare, Stephen Edward Moore2026-03-10
💻 computer science

S2^2Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

تقترح الورقة البحثية إطار عمل S2^2Q-VDiT، وهو إطار للكمية ما بعد التدريب لنماذج محولات انتشار الفيديو (video diffusion transformers) يحقق أداءً غير منقوص تحت كمية W4A6 عبر استخدام اختيار البيانات البارزة المدرك لهيسيان (Hessian-aware) وتقطير الرموز المتناثر الموجه بالانتباه (attention-guided sparse token distillation) للتغلب على تباين المعايرة وتحديات التعلم الناتجة عن تسلسلات الرموز الطويلة.

Weilun Feng, Haotong Qin, Chuanguang Yang, Xiangqi Li, Han Yang, Yuqi Li, Zhulin An, Libo Huang, Michele Magno, Yongjun (…)2026-03-10
💻 computer science

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

يقدم Video-EM إطار عمل للذاكرة العرضية متمحوراً حول الأحداث وغير معتمد على التدريب، يعزز فهم مقاطع الفيديو طويلة المدى من خلال توجيه نموذج لغوي كبير لتحديد المواقع، وتقسيم، وتكرير اللحظات ذات الصلة بالاستعلام إلى خط زمني للأحداث مدمج ومتماسك زمنياً، مما يتغلب على قيود السياق في النماذج اللغوية الكبيرة للفيديو الحالية دون الحاجة إلى تغييرات هيكلية.

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu (…)2026-03-10
💻 computer science

PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis

إن PhysGM هو إطار عمل تغذية أمامية يتنبأ بشكل مشترك بتمثيلات غاوس ثلاثية الأبعاد والخصائص الفيزيائية من صورة واحدة لتمكين محاكاة رباعية الأبعاد فورية وعالية الدقة، مستفيداً من مجموعة بيانات جديدة تسمى PhysAssets وتحسين التفضيل المباشر للتغلب على قيود الطرق السابقة البطيئة، والمعتمدة بكثافة على التحسين، والمنفصلة فيزيائياً.

Chunji Lv, Zequn Chen, Donglin Di, Weinan Zhang, Hao Li, Wei Chen, Yinjie Lei, Changsheng Li2026-03-10
💻 computer science

Mix-modal Federated Learning for MRI Image Segmentation

تقدم هذه الورقة MixMFL، وهو نموذج تعلم اتحادي غير مركزي جديد لتقسيم صور الرنين المغناطيسي يعالج عدم تجانس البيانات والأنماط على مستوى العميل من خلال إطار عمل MDM-MixMFL المقترح الذي يتميز بفصل الأنماط لتوفير تحديثات مخصصة ومشتركة، وآلية ذاكرة للتعويض عن الأنماط المحلية غير المكتملة.

Guyue Hu, Siyuan Song, Jingpeng Sun, Zhe Jin, Chenglong Li, Jin Tang2026-03-10