🤖 AI

Enhancing Renal Tumor Malignancy Prediction: Deep Learning with Automatic 3D CT Organ Focused Attention

تقدم هذه الدراسة إطار عمل للتعلم العميق يستخدم دالة فقدان "التركيز الموجه للعضو" (OFA) للتنبؤ بدقة بخلل التنسج في أورام الكلى من صور الأشعة المقطعية ثلاثية الأبعاد دون الحاجة إلى تقسيم يدوي مجهد، محققةً أداءً يتفوق على النماذج التقليدية القائمة على التقسيم في كل من مجموعات البيانات الخاصة والعامة.

Zhengkang Fan, Chengkun Sun, Russell Terry, Jie Xu, Longin Jan Latecki2026-02-27
💻 computer science

MammoWise: Multi-Model Local RAG Pipeline for Mammography Report Generation

تُعد Mammowise مساراً عملياً ومحلياً متعدد النماذج، يستفيد من نماذج الرؤية واللغة مفتوحة المصدر المعززة بالتحفيز بلقطات قليلة والجيل المسترد لتعزيز المعلومات (RAG)، لتوليد تقارير تصوير الثدي الشعاعي عالية الجودة وإجراء تصنيفات سريرية دقيقة مع ضمان الخصوصية وقابلية التكرار.

Raiyan Jahangir, Nafiz Imtiaz Khan, Amritanand Sudheerkumar, Vladimir Filkov2026-02-27
💻 computer science

Pix2Key: Controllable Open-Vocabulary Retrieval with Semantic Decomposition and Self-Supervised Visual Dictionary Learning

يُعد Pix2Key إطار عمل مبتكر لاسترجاع الصور المركبة يستخدم التفكيك الدلالي وتعلم القواميس البصرية ذاتي الإشراف لتمثيل الاستعلامات والمرشحين كقواميس مفتوحة المفردات، مما يحقق مطابقة فائقة مدركة للقصد وإعادة ترتيب مدركة للتنوع دون الاعتماد على الثلاثيات الخاضعة للإشراف.

Guoyizhe Wei, Yang Jiao, Nan Xi, Zhishen Huang, Jingjing Meng, Rama Chellappa, Yan Gao2026-02-27
⚡ electrical engineering

HARU-Net: Hybrid Attention Residual U-Net for Edge-Preserving Denoising in Cone-Beam Computed Tomography

تقدم هذه الورقة البحثية HARU-Net، وهي بنية شبكة U-Net متبقية هجينة ذات انتباه (Hybrid Attention Residual U-Net) تدمج محولات الانتباه الهجينة والتعلم المتبقي لإزالة الضجيج بفعالية من صور التصوير المقطعي المحوسب بالحزمة المخروطية (CBCT) منخفضة الجرعة مع الحفاظ على الحواف التشريحية الحرجة، متفوقة بذلك على الأساليب الحديثة في كل من مقاييس جودة الصورة والكفاءة الحسابية.

Khuram Naveed, Ruben Pauwels2026-02-27
🤖 AI

BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model

يعزز BetterScene عملية تخليق المشهد من زوايا رؤية جديدة للصور الواقعية غير المقيدة والمنخفضة الكثافة عبر دمج نموذج إسقاط غاوسي ثلاثي الأبعاد ذي تغذية أمامية مع بنية Stable Video Diffusion التي تم ضبطها بدقة عبر تنظيم التكافؤ الزمني وتمثيلات محاذية لنماذج الرؤية التأسيسية داخل وحدة التشفير وفك التشفير (VAE) الخاصة به لإنتاج مشاهد متسقة وخالية من العيوب.

Yuci Han, Charles Toth, John E. Anderson, William J. Shuart, Alper Yilmaz2026-02-27
🤖 machine learning

DP-aware AdaLN-Zero: Taming Conditioning-Induced Heavy-Tailed Gradients in Differentially Private Diffusion

تقترح هذه الورقة البحثية آلية AdaLN-Zero المدركة للخصوصية التفاضلية (DP-aware)، وهي آلية تكييف مدركة للحساسية لترانسفورمرز الانتشار (diffusion transformers) تعمل على التخفيف من حدة التدرجات ذات الذيول الثقيلة الناتجة عن السياقات غير المتجانسة، مما يقلل من انحياز القص ويعزز الفائدة في مهام السلاسل الزمنية ذات الخصوصية التفاضلية دون المساس بالأداء القياسي.

Tao Huang, Jiayang Meng, Xu Yang, Chen Hou, Hong Chen2026-02-27
💻 computer science

Spectrally Distilled Representations Aligned with Instruction-Augmented LLMs for Satellite Imagery

تقدم الورقة البحثية SATtxt، وهو نموذج تأسيسي للرؤية واللغة يقوم بتقطير المعرفة متعددة الأطياف في إطار استدلال يعتمد على RGB فقط ومتوافق مع النماذج اللغوية الكبيرة المعززة بالتعليمات، مما يحقق أداءً فائقاً في التصنيف، والاسترجاع، والاختبار الخطي (linear probing) لصفر من المحاولات (zero-shot) على معايير صور الأقمار الصناعية.

Minh Kha Do, Wei Xiang, Kang Han, Di Wu, Khoa Phan, Yi-Ping Phoebe Chen, Gaowen Liu, Ramana Rao Kompella2026-02-27
🤖 AI

Instruction-based Image Editing with Planning, Reasoning, and Generation

تقترح هذه الورقة إطار عمل مبتكر لتحرير الصور القائم على التعليمات، والذي يربط بين الفهم والتوليد من خلال الاستفادة من نهج تسلسل الأفكار متعدد الوسائط للتعامل بشكل منفصل مع التخطيط، والاستدلال في منطقة التحرير، والتوليد الموجه بالتلميحات، مما يحقق أداءً فائقاً على الصور الواقعية المعقدة مقارنة بالأساليب السابقة أحادية الوسائط.

Liya Ji, Chenyang Qi, Qifeng Chen2026-02-27
💻 computer science

Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models

تقترح هذه الورقة وحدة تخصيص أوزان متعددة الوسائط (MWAM) قابلة للتركيب والتشغيل المباشر، تستخدم مقياس نسبة التردد لتقدير كمية مساهمات الوسائط وإعادة توازنها ديناميكيًا أثناء التدريب، مما يخفف من التدهور الكارثي في الأداء الناتج عن فقدان الوسائط ويعزز المتانة عبر البنيات المختلفة متعددة الوسائط.

Siqi Lu, Wanying Xu, Yongbin Zheng, Wenting Luan, Peng Sun, Jianhang Yao2026-02-27
🤖 AI

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

تقدم هذه الورقة البحثية SoPE، وهو تضمين موضعي جديد يعتمد على الإحداثيات الكروية يستبدل تضمين الموضع الدوراني (Rotary Position Embedding) غير الأمثل في النماذج اللغوية الرؤية الضخمة ثلاثية الأبعاد للحفاظ بشكل أفضل على الهياكل الهندسية ثلاثية الأبعاد والاعتمادات الاتجاهية، مما يعزز بشكل كبير الإدراك المكاني والقدرة على التعميم عبر مختلف المعايير المرجعية.

Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka- (…)2026-02-27