💻 computer science

Understanding Representation Gaps Across Scales in Tropical Tree Species Classification from Drone Imagery

تبحث هذه الورقة في فجوة الأداء بين صور الطائرات بدون طيار عالية الدقة والملتقطة عن قرب، وبين الصور من منظور علوي ذات الدقة المنخفضة، في تصنيف أنواع الأشجار الاستوائية، حيث وجدت أنه بينما تحقق الصور الملتقطة عن قرب نتائج أفضل — خاصة بالنسبة للأنواع النادرة — فإن محاذاة التمثيل ذاتي الإشراف يمكن أن تسد هذه الفجوة لتحسين مراقبة المظلة الشجرية على نطاق واسع.

Sulagna Saha, Arthur Ouaknine, Etienne Laliberté, Carol Altimas, Evan M. Gora, Adriane Esquivel Muelbert, Ian R. McGrego (…)2026-04-28
💻 computer science

Urban Flood Observations (UFO): A hand-labeled training and validation dataset of post-flood inundation

تقدم الورقة البحثية "ملاحظات الفيضانات الحضرية" (UFO)، وهي مجموعة بيانات جديدة مصنفة يدويًا من صور أقمار "PlanetScope" عالية الدقة، صُممت لتحسين رسم خرائط والتحقق من غمر ما بعد الفيضانات في البيئات الحضرية المعقدة.

Rohit Mukherjee, Hannah K. Friedrich, Beth Tellman, Ariful Islam, Zhijie Zhang, Jonathan Giezendanner, Upmanu Lall, Venk (…)2026-04-28
💻 computer science

From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models

تقترح هذه الدراسة منهجية لتصنيف اعتلال الشبكية السكري القابل للتفسير من خلال دمج نماذج الشبكات العصبية الالتفافية (CNN) ونماذج المحولات (Transformer)، وتعزيز الفائدة السريرية عبر خرائط الإسناد البصري والمبررات النصية المولدة بواسطة نماذج الرؤية واللغة.

Pir Bakhsh Khokhar, Carmine Gravino, Fabio Palomba, Sule Yildirim Yayilgan, Sarang Shaikh2026-04-28
💻 computer science

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

تقدم الورقة البحثية **DeLock**، وهي طريقة تمنع "الارتباط القسري" (lock-in)—أي فقدان القدرة على اتباع التعليمات والتعميم أثناء مرحلة ما بعد التدريب ببيانات منخفضة لسياسات الرؤية واللغة والحركة (VLA)—عن طريق الحفاظ على الربط البصري المدرب مسبقاً واستخدام توجيه المحفز التبايني في وقت الاختبار للحفاظ على القدرة على التوجيه.

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg2026-04-28
🤖 machine learning

Learning from Imperfect Text Guidance: Robust Long-Tail Visual Recognition with High-Noise Label

لمواجهة التحدي المزدوج المتمثل في التوزيعات ذات الذيول الطويلة والضجيج العالي في الملصقات، يقترح هذا البحث **الإشراف بالمعلم الضعيف (WTS)**، وهي طريقة تستفيد من المحاذاة عبر الوسائط للنماذج اللغوية البصرية المدربة مسبقًا لتصحيح عدم الاتساق بين الملصق والصورة باستخدام معلومات نصية مساعدة.

Mengke Li, Haiquan Ling, Yiqun Zhang, Yang Lu, Hui Huang2026-04-28
🧬 biology

CNN-ViT Fusion with Adaptive Attention Gate for Brain Tumor MRI Classification: A Hybrid Deep Learning Model

تقترح هذه الورقة نموذجاً هجيناً للتعلم العميق يدمج بين شبكة عصبية تلافيفية بأسلوب SqueezeNet ومحول (transformer) بأسلوب MobileViT باستخدام بوابة انتباه تكيفية لدمج الميزات المحلية والعالمية ديناميكياً، مما يحقق دقة عالية في تصنيف صور الرنين المغناطيسي لأورام الدماغ.

Syed Ibad Hasnain, Muhammad Faris, Hafiza Syeda Yusra Tirmizi, Rabail Khowaja, Hafsa Israr2026-04-28
💻 computer science

UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

يُعد UpstreamQA إطار عمل نمطيًا يعمل على تحسين الإجابة على الأسئلة المتعلقة بالفيديو من خلال استخدام نماذج استدلال ضخمة لتوليد خطوات وسيطة صريحة — مثل تحديد الأشياء وسياق المشهد — لتعزيز القدرة على التفسير وقدرات الاستدلال متعدد الخطوات للنماذج متعددة الوسائط في المراحل اللاحقة.

Jason Nguyen, Ameet Rao, Alexander Chang, Ishaan Kumar, Erin Tan2026-04-28
💻 computer science

DyABD: The Abdominal Muscle Segmentation in Dynamic MRI Benchmark

تقدم هذه الورقة DyABD، وهو معيار مرجعي جديد وصعب للغاية للتصوير بالرنين المغناطيسي الديناميكي لتقسيم عضلات البطن، يتميز بتباين تشريحي شديد ناتج عن حركة المريض، بهدف دفع الأبحاث السريرية في مجال الفتوق البطنية وتقييم قدرات التعميم لنماذج التقسيم الحالية.

Niamh Belton, Victoria Joppin, Aonghus Lawlor, Catherine Masson, Thierry Bege, David Bendahan, Kathleen M. Curran2026-04-28
💻 computer science

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

يُعد AnalogRetriever إطار عمل استرجاع موحد ثلاثي الأنماط يتيح البحث عبر الأنماط للدوائر التناظرية (المخططات، والأوصاف، وقوائم التوصيل/netlists) من خلال رسم خرائط لها في فضاء تضمين مشترك، مما يحسن بشكل كبير من دقة الاسترجاع وأداء مهام التصميم الوكيلية اللاحقة.

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu2026-04-28
💻 computer science

LatentBurst: A Fast and Efficient Multi Frame Super-Resolution for Hexadeca-Bayer Pattern CIS images

تُعد LatentBurst شبكة فائقة السرعة والكفاءة لرفع دقة الصور متعددة الإطارات، وهي مصممة لصور مستشعرات CMOS ذات نمط hexadeca-Bayer، حيث تعالج تحديات إزالة الموزاييك (demosaicing)، وعدم محاذاة الحركة، والنشر في الأجهزة المحمولة من خلال نهج محاذاة الميزات الكامنة الهرمي وبنية خفيفة الوزن تعتمد على شبكة UNet.

Sangwook Baek, Vin Van Duong, Karam Park, Pilkyu Park2026-04-28