⚡ electrical engineering

Latent Wavelet Diffusion For Ultra-High-Resolution Image Synthesis

تقدم الورقة البحثية نموذج "الانتشار الموجي الكامن" (Latent Wavelet Diffusion - LWD)، وهو إطار عمل تدريبي خفيف الوزن وخالٍ من تكلفة الاستدلال، يعزز توليد الصور فائقة الدقة عبر توظيف استراتيجية قناع مدركة للتردد تعتمد على المويجات لإعطاء الأولوية للمناطق الغنية بالتفاصيل دون الحاجة إلى تعديلات هيكلية.

Luigi Sigillo, Shengfeng He, Danilo Comminiello2026-04-17
⚡ electrical engineering

Improving Prostate Gland Segmentation Using Transformer based Architectures

تُظهر هذه الدراسة أن البنى القائمة على المحولات (transformer-based architectures)، ولا سيما SwinUNETR، تتفوق على الشبكات العصبية الالتفافية (CNNs) التقليدية في تقسيم غدة البروستاتا في صور الرنين المغناطيسي الموزونة بالزمن الثاني (T2-weighted MRI) من خلال التخفيف الفعال لتباين القراء بين المستخدمين وانزياحات النطاق عبر آلية الانتباه الذاتي العالمي والنافذة المزاحة، محققةً درجات "دايس" (Dice scores) أعلى بنسبة تصل إلى خمس نقاط مع الحفاظ على الكفاءة الحسابية.

Shatha Abudalou Yasin Yilmaz Yoganand Balagurunathan2026-04-17
⚡ electrical engineering

Federated Breast Cancer Detection Enhanced by Synthetic Ultrasound Image Augmentation

تقترح هذه الورقة إطار عمل للتعلم الاتحادي للكشف عن سرطان الثدي يستخدم صور الموجات فوق الصوتية الاصطناعية الناتجة عن نماذج شبكات الخصومة التوليدية (GANs) ونماذج الانتشار لتعزيز مجموعات البيانات المحدودة وغير المتجانسة (non-IID)، مما يظهر تحسناً في أداء التصنيف مع تسليط الضوء على الحاجة الماسة لموازنة البيانات الحقيقية والاصطناعية لتجنب تناقص العوائد.

Hongyi Pan, Ziliang Hong, Gorkem Durak, Ziyue Xu, Ulas Bagci2026-04-17
💻 computer science

CSNR and JMIM Based Spectral Band Selection for Reducing Metamerism in Urban Driving

تقترح هذه الورقة استراتيجية مبتكرة لاختيار النطاق الطيفي تجمع بين تقنيتي CSNR وJMIM لتحديد النطاقات الطيفية المثلى التي تقلل بشكل كبير من الارتباك الميتاميري وتعزز قدرة الفصل بين مستخدمي الطريق المعرضين للخطر والخلفيات الحضرية، مما يؤدي إلى تحسين السلامة لأنظمة الإدراك في السيارات.

Jiarong Li, Imad Ali Shah, Diarmaid Geever, Fiachra Collins, Enda Ward, Martin Glavin, Edward Jones, Brian Deegan2026-04-17
💻 computer science

Feature Extraction in the Remote Sensing Data Value Chain: A Systematic Review of Methods and Applications

تقدم هذه الورقة مراجعة منهجية وإطاراً عملياً لاستخراج الميزات في الاستشعار عن بعد، متتبعةً تطورها عبر سلسلة قيمة البيانات ومقدمةً آفاقاً مستقبلية حول التحول نحو التمثيلات الموحدة وتكامل الأساليب الكلاسيكية مع النماذج التأسيسية الحديثة.

Nathan Mankovich, Kai-Hendrik Cohrs, Homer Durand, Vasileios Sitokonstantinou, Tristan Williams, Gustau Camps-Valls2026-04-17
💻 computer science

TwinOR: Photorealistic Digital Twins of Dynamic Operating Rooms for Embodied AI Research

تُعد TwinOR بنية تحتية من الواقع إلى المحاكاة تعمل على إنشاء توائم رقمية واقعية وديناميكية لغرف العمليات بدقة تصل إلى مستوى السنتيمتر، وذلك لتوفير بيئات آمنة وقابلة للتوسع وواقعية من حيث الاستشعار لتدريب وتقييم الذكاء الاصطناعي المتجسد في الأنظمة الجراحية.

Han Zhang, Yiqing Shen, Roger D. Soberanis-Mukul, Ankita Ghosh, Hao Ding, Lalithkumar Seenivasan, Jose L. Porras, Zhekai (…)2026-04-17
💻 computer science

CaptionQA: Is Your Caption as Useful as the Image Itself?

تقدم هذه الورقة CaptionQA، وهو معيار قائم على المنفعة يقيم مدى فعالية الأوصاف النصية للصور كبدائل للمحتوى البصري في المهام اللاحقة من خلال قياس مدى قدرة النماذج اللغوية الكبيرة على الإجابة على أسئلة متخصصة باستخدام الأوصاف وحدها، مما يكشف عن فجوات كبيرة في الأداء بين مقاييس الأسئلة والأجوبة الصورية التقليدية والمنفعة الفعلية للأوصاف النصية.

Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu2026-04-17
🤖 AI

DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA

يُعد DocVAL إطار عمل لتقطير سلسلة الأفكار الموثقة، يقوم بنقل الاستدلال المكاني الصريح من النماذج المعلمة الضخمة إلى نماذج الرؤية واللغة (VLMs) الطلابية المدمجة باستخدام مُتحقق ثنائي الأنماط قائم على القواعد وتحسين تكراري، مما يحقق تحسينات كبيرة في كل من دقة الإجابة والتحديد على مستوى البكسل لمهام الأسئلة والأجوبة الخاصة بالمستندات دون الحاجة إلى التعرف الضوئي على الحروف (OCR) عند الاستنتاج.

Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Ser-Nam Lim, Rajiv Ramnath2026-04-17
💻 computer science

SAM3-I: Segment Anything with Instructions

تقدم هذه الورقة البحثية نموذج SAM3-I، وهو امتداد لنموذج Segment Anything Model 3 يتبع التعليمات، حيث يوحد بين التأسيس على مستوى المفهوم والاستدلال على مستوى التعليمات من خلال آلية تكيف متتالية ومجموعة بيانات جديدة واسعة النطاق (HMPL-Instruct)، مما يتيح التفسير المباشر للتعليمات المعقدة باللغة الطبيعية دون التضحية بقدرات استدعاء المفاهيم الأصلية للنموذج.

Jingjing Li, Yue Feng, Yuchen Guo, Jincai Huang, Wei Ji, Qi Bi, Yongri Piao, Miao Zhang, Xiaoqi Zhao, Qiang Chen, Shihao (…)2026-04-17
💻 computer science

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction

تقترح هذه الورقة البحثية RepMD، وهي طريقة مبتكرة تعمل على تحسين اكتشاف الميمات الضارة دائم التغير من خلال بناء "رسم بياني لمفهوم التصميم" لإعادة إنتاج مبادئ التصميم الخبيثة الكامنة وتوجيه نموذج لغوي كبير متعدد الوسائط، مما يحقق دقة وكفاءة عاليتين حتى عندما تتطور الميمات بمرور الوقت.

Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang2026-04-17