💻 computer science

Few-Shot Synthetic Data Generation with Diffusion Models for Downstream Vision Tasks

تقترح هذه الورقة البحثية مساراً خفيف الوزن يعمل على ضبط محول (LoRA) على مجموعة صغيرة من الصور الحقيقية للاستفادة من نماذج الانتشار مسبقة التدريب لتوليد بيانات اصطناعية، مما يثبت أن هذا النهج يحسن بفعالية استدعاء الفئات النادرة ودرجات F1 في مهام الرؤية عبر المجالات الطبية والصناعية دون الحاجة إلى بيانات واقعية إضافية.

Daniil Dushenev, Nazariy Karpov, Daniil Zinovjev, Alexander Gorin, Konstantin Kulikov2026-05-13
🤖 AI

Beyond Point-wise Neural Collapse: A Topology-Aware Hierarchical Classifier for Class-Incremental Learning

تقترح هذه الورقة مصنفاً هرمياً مدركاً للطوبولوجيا، HC-SOINN، مقترناً بطريقة محاذاة البنية والطوبولوجيا عبر البواقي (STAR)، للتغلب على قيود افتراضات الانهيار العصبي النقطي في التعلم التزايدي للفئات من خلال نمذجة ماني فولد الفئات المعقدة بفعالية والتكيف مع انزياح الميزات غير الخطي.

Huiyu Yi, Zhiming Xu, Dunwei Tu, Zhicheng Wang, Baile Xu, Furao Shen2026-05-13
💻 computer science

Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

تقترح الورقة البحثية إطار عمل VISTA، وهو إطار تدريب للتحسين الذاتي المدرك للرؤية يعالج عدم توازن البيانات وتحيز الأولوية اللغوية في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تقديم إعادة أخذ عينات البادئة ودرجة انتباه مدركة للرؤية، مما يعزز بشكل كبير أداء الاستدلال متعدد الوسائط عبر مختلف المهام والنماذج.

Qihuang Zhong, Liang Ding, Wenjie Xuan, Juhua Liu, Bo Du, Dacheng Tao2026-05-13
💻 computer science

What Does It Mean for a Medical AI System to Be Right?

تجادل هذه الورقة بأن صحة أنظمة الذكاء الاصطناعي الطبي، والتي تتجلى في تصنيف الخلايا البلازمية لمرض الورم النخاعي المتعدد، هي مفهوم متعدد الأبعاد يعتمد على بيانات الخبراء، وقابلية التفسير، والمقاييس ذات المعنى، والمساءلة، بدلاً من كونها خاصية أحادية يمكن اختزالها في أداء المعايير المرجعية.

Antony Gitau2026-05-13
🤖 AI

A Transfer Learning Evaluation of Deep Neural Networks for Image Classification

تقيم هذه الورقة أحد عشر نموذجاً من الشبكات العصبية العميقة المدربة مسبقاً على مجموعة بيانات ImageNet لتصنيف الصور من خلال تحسين طبقات مخرجاتها ومعاملاتها عبر خمس مجموعات بيانات مستهدفة، وتقييم أدائها بناءً على الدقة، ووقت التدريب، وحجم النموذج لتوجيه الاختيار الأمثل للنموذج.

Nermeen Abou Baker, Nico Zengeler, Uwe Handmann2026-05-13
💻 computer science

FAME: Feature Activation Map Explanation on Image Classification and Face Recognition

تقدم هذه الورقة البحثية FAME، وهي طريقة جديدة للذكاء الاصطناعي القابل للتفسير تجمع بين التلاعب بالمدخلات المدفوع بالتدرج وتحليل تنشيط الميزات لإنتاج خرائط عزو تنافسية لتصنيف الصور والتعرف على الوجوه، مع إثبات أن افتراضات خرائط تنشيط الفئات التقليدية تفشل في الشبكات الأكثر عمقاً.

Xinyi Zhang, Manuel Günther2026-05-13
💻 computer science

What-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and Localization

يقدم محول "ماذا-أين" (WWT) بنية محولة رؤية قائمة على الفتحات (slot-based) مبتكرة تفصل صراحةً بين مظهر الكائن وموقعه المكاني إلى تدفقات متزامنة من الرموز (tokens) وخرائط الانتباه، مما يُمكّن من اكتشاف الكائنات بأسلوب التعلم الصفري (zero-shot) والتقطيع المعتمد على الإشراف الضعيف ببراعة من خلال قدرات التحديد الناشئة دون الحاجة إلى معالجة لاحقة إضافية.

Ryota Yoshihashi, Masahiro Kada, Satoshi Ikehata, Rei Kawakami, Ikuro Sato2026-05-13
⚡ electrical engineering

Spectral Vision Transformer for Efficient Tokenization with Limited Data

تقترح الورقة البحثية بنية "ترانسفورمر الرؤية الطيفي" (Spectral Vision Transformer) مبتكرة تستفيد من خصائص الأساس الطيفي لترميز الرموز بكفاءة وتقليل التعقيد، مما أظهر أداءً متكافئاً أو متفوقاً بعدد أقل من المعلمات عبر نماذج مختلفة على بيانات التصوير الطبي المحدودة.

Alexandra G. Roberts, Maneesh John, Jinwei Zhang, Dominick Romano, Mert Sisman, Ki Sueng Choi, Heejong Kim, Mert R. Sabu (…)2026-05-13
🤖 AI

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

تقدم هذه الورقة البحثية OmniClean، وهو معيار مرجعي مُنزّه بصرياً يكشف عن مكاسب مضخمة في النماذج متعددة الوسائط، ويُظهر أن وصفة تدريب لاحق ثلاثية المراحل (OmniBoost) تمكّن نموذجاً صغيراً بحجم 3 مليارات معلمة من التفوق على نظيره الأكبر بكثير بحجم 30 مليار معلمة عبر دمج الأدلة السمعية والبصرية واللغوية بفعالية دون الاعتماد على الاختصارات البصرية.

Che Liu, Lichao Ma, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Xuerui Yang, Fei Tian2026-05-13
💻 computer science

PairDropGS: Paired Dropout-Induced Consistency Regularization for Sparse-View Gaussian Splatting

يعالج PairDropGS عدم الاستقرار والتعلم غير الأمثل في تقنية Gaussian Splatting ثلاثية الأبعاد ذات المشاهد الشحيحة الناتج عن مجموعات الإسقاط (dropout) غير المتسقة، وذلك من خلال تقديم إطار عمل إسقاط مزدوج مع تنظيم اتساق التردد المنخفض واستراتيجية جدولة تدريجية لضمان إعادة بناء قوية وعالية الجودة.

Hantang Li, Qiang Zhu, Xiandong Meng, Xingtao Wang, Debin Zhao, Xiaopeng Fan2026-05-13