🤖 AI

BoneAgeTW2: Automated Skeletal Maturation Assessment via the Tanner-Whitehouse 2 Method, Deep Learning, and Clinical Report Generation with Distribution Curves

تقدم هذه الورقة البحثية BoneAgeTW2، وهو أول نظام مفتوح المصدر بالكامل يعمل على أتمتة التقييم الكامل للنضج الهيكلي وفق طريقة تانر-وايت هاوس 2 عن طريق اكتشاف 20 عظمة من عظام اليد باستخدام YOLOv8، وتصنيف مراحل نضجها باستخدام EfficientNet-B3، وإنشاء تقارير سريرية مع منحنيات التوزيع السكاني، وكل ذلك تم تدريبه على مجموعة بيانات RSNA عبر استراتيجية التسمية المستعارة (pseudo-labeling).

Juan Manuel Castillo Pinto2026-07-28
💻 computer science

A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions

تقترح هذه الورقة إطاراً لتقييم وصف الصور غير المعتمد على مرجع، والذي يقيس جودة الوصف من خلال قياس التكافؤ الدلالي بين الصورة الأصلية وإعادة بناء ناتجة عن الوصف، ويتم التحقق من ذلك عبر مجموعة من مهام الرؤية واللغة اللاحقة.

Zhijiang Tang, Jiaxin Qi, Kaihua Tang, Yuhua Zheng, Jianqiang Huang2026-07-28
⚡ electrical engineering

A Reference-Free Framework for Evaluating Single-Frame ISP Pipelines

تقترح هذه الورقة إطار عمل للتعلم الخالي من المراجع يقدر مقاييس جودة الصور القياسية التي تعتمد على المرجع الكامل (PSNR، SSIM، LPIPS) لخطوط معالجة الصور (ISP) أحادية الإطار، وذلك عن طريق التنبؤ بمرجع sRGB وسيط من صورة معالجة وبيانات ISO الوصفية، مما يتيح التقييم العملي دون الحاجة إلى أزواج من البيانات الأرضية المحاذية تماماً.

Yujin Cho, Sira Ferradans, Jean-Michel Morel, Gabriele Facciolo, Thomas Eboli2026-07-28
⚡ electrical engineering

Stabilizing Deep Reconstruction Operators with Contractive Anchoring

تقترح هذه الورقة إطار عمل استقرار قائم على البيانات يمنع نمط فشل "الذروة والانهيار" في إعادة بناء الصور بطريقتي "التوصيل والتشغيل" (Plug-and-Play) و"التنظيم عبر إزالة الضجيج" (Regularization-by-Denoising)، وذلك عبر تنظيم عدم الاستقرار المحلي تكيفياً باستخدام مؤثرات انكماشية خفيفة الوزن وقابلة للتدريب كمرتكزات، مما يضمن أداءً موثوقاً دون الحاجة لإعادة تدريب أجهزة إزالة الضجيج مسبقة التدريب.

Arghya Sinha, Trishit Mukherjee, Kunal N. Chaudhury2026-07-28
⚡ electrical engineering

Trainable Nonexpansive Denoisers for Contractive Image Reconstruction

تقدم هذه الورقة بنية مزيل ضجيج قابلة للتدريب تستغل تبديلات الشبكة الصورية لضمان عدم التوسع العالمي، مما يتيح إعادة بناء صور متقاربة بشكل مثبت للمسائل العكسية مثل تعزيز الدقة وإزالة الضباب مع الحفاظ على أداء تنافسي.

Arghya Sinha, Aditya Banerjee, Trishit Mukherjee, Kunal N. Chaudhury2026-07-28✓ Author reviewed
💬 NLP

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

تقدم هذه الورقة البحثية ParseFIxLIP، وهو إطار تفسيري مبتكر يدمج بين تحليل القواعد الشجرية (Tree-Gram Parsing) وتفاعلات بانزهاف الموزونة (Weighted Banzhaf interactions) لتجميع رموز النصوص المجزأة إلى مفاهيم طبية متماسكة دلالياً، مما يعزز قابلية التفسير والمتانة في اتخاذ القرار لنموذج BiomedCLIP في السياقات السريرية.

Jakub Rymarski (University of Warsaw, Poland), Adam Rempała (University of Warsaw, Poland), Bartłomiej Sobieski (Univers (…)2026-07-28
⚡ electrical engineering

Investigating the Visual Cues of CNNs for Vascular Segmentation: A Case Study in Microscopy and Fundus Imaging

تتقصى هذه الدراسة الإشارات البصرية التي تحرك عملية تقسيم الأوعية الدموية القائمة على الشبكات العصبية التلافيفية (CNN) في التصوير المجهري وتصوير قاع العين، كاشفةً أن النماذج تعتمد بشكل أساسي على شدة البكسل ضمن مجال استقبال محدود يبلغ 20 بكسلاً بدلاً من الملمس أو الشكل العام، وذلك رغم حفاظها على دقة عالية حتى عند إزالة هذه الإشارات.

Weslley dos Santos Silva, Cesar Henrique Comin2026-07-28
🤖 AI

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation

تقترح هذه الورقة إطار عمل لدمج الانتباه المتقاطع الموجه بالرمز والمنطقة (Token-Region Guided Cross-Attention Fusion) يدمج ميزات النصوص البصرية وعمليات التعرف الضوئي على الحروف (OCR) عالية الدقة عبر آلية انتباه متعدد الرؤوس، محققاً أداءً هو الأفضل في فئته في اكتشاف النوايا السياسية داخل الميمز (memes) باللغة البنغالية ذات الموارد المنخفضة.

Musa Tur Farazi, Nufayer Jahan Reza2026-07-28
💻 computer science

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

يُعد MemVLN إطار عمل للملاحة البصرية واللغوية في الوقت الفعلي، حيث يحقق أداءً هو الأفضل في فئته وبسرعة استدلال تبلغ 14 إطاراً في الثانية من خلال دمج ذاكرة عرضية هرمية للاحتفاظ الفعال بالتاريخ طويل المدى مع ذاكرة إجرائية تستخدم إجراءات ذرية متوسطة المستوى لتجاوز زمن تأخير فك الترميز ذاتي الانحدار.

Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia2026-07-28
💻 computer science

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction

تقدم هذه الورقة نموذج عالم مركزي بشري في الوقت الفعلي، يقوم بتخليق تفاعلات متماسكة للجزء العلوي من الجسم عبر الجمع بين تمثيل ضمني موحد متعدد المقاييس للحركة البشرية المستمرة مع حالات منفصلة مشفرة لغوياً للتحكم الدقيق في ملامسة الأشياء، محققاً سرعة استنتاج تبلغ 25 إطاراً في الثانية على وحدات معالجة الرسوميات H100.

Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang2026-07-28