💻 computer science

From Content to Audience: A Multimodal Annotation Framework for Broadcast Television Analytics

تقدم هذه الورقة إطار عمل للتعليق التوضيحي متعدد الوسائط للبث التلفزيوني يقوم بتقييم تسعة نماذج رائدة بشكل منهجي على معيار اختبار للأخبار الإيطالية، مما يثبت أن أداء النماذج يعتمد بشكل كبير على تكوين المدخلات، وتطبق بنجاح المسار الأمثل لربط التعليقات التوضيحية للمحتوى على مستوى الدقيقة مع مقاييس تفاعل الجمهور.

Paolo Cupini, Francesco Pierri2026-03-31
💻 computer science

From Prediction to Diagnosis: Reasoning-Aware AI for Photovoltaic Defect Inspection

تقدم هذه الورقة REVL-PV، وهو إطار عمل للرؤية واللغة يعزز فحص عيوب الخلايا الكهروضوئية من خلال دمج الاستدلال التشخيصي الخاص بالمجال في التعلم متعدد الوسائط، محققاً دقة عالية وإنتاج تقارير تشخيصية قابلة للتفسير ومتوافقة مع خبرات المتخصصين.

Dev Mistry, Feng Qiu, Bo Chen, Feng Liu, Can Chen, Mohammad Shahidehpour, Ren Wang2026-03-31
💻 computer science

BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting

إن BHCast هو إطار عمل عصبي يحول صور الثقوب السوداء الفردية الضبابية إلى تنبؤات مستقرة وعالية الدقة لديناميكيات البلازما، مما يتيح استخراج المعلمات الفيزيائية الرئيسية مثل الدوران وزاوية الرؤية من خلال مسار نمطي وقابل للتفسير تم التحقق من صحته على كل من المحاكاة وبيانات تلسكوب أفق الحدث الحقيقية.

Renbo Tu, Ali SaraerToosi, Nicholas S. Conroy, Gennady Pekhimenko, Aviad Levis2026-03-31
💻 computer science

Limits of Imagery Reasoning in Frontier LLM Models

تُظهر هذه الورقة أن تزويد النماذج اللغوية الكبيرة الرائدة بـ "وحدة تصويرية" خارجية للتعامل مع المهام المكانية ثلاثية الأبعاد يفشل في تحسين الأداء بما يتجاوز دقة 62.5%، وذلك لأن هذه النماذج تفتقر إلى الأوليات البصرية المكانية التأسيسية وقدرات الاستدلال التأملي اللازمة للتواصل الفعال مع هذه الصور واستخدامها.

Sergio Y. Hayashi, Nina S. T. Hirata2026-03-31
💻 computer science

Can We Change the Stroke Size for Easier Diffusion?

تقترح هذه الورقة وتحلل تدخلًا للتحكم في حجم الضربة يقوم بتعديل الخشونة الفعالة للأهداف والاضطرابات ديناميكيًا عبر الخطوات الزمنية للتخفيف من التحديات التي تواجهها نماذج الانتشار في أنظمة نسبة الإشارة إلى الضجيج المنخفضة.

Yunwei Bai, Ying Kiat Tan, Yao Shu, Tsuhan Chen2026-03-31
💻 computer science

Confidence Matters: Uncertainty Quantification and Precision Assessment of Deep Learning-based CMR Biomarker Estimates Using Scan-rescan Data

تُظهر هذه الدراسة أنه بينما تحقق نماذج التعلم العميق لتقدير المؤشرات الحيوية في التصوير بالرنين المغناطيسي للقلب دقة عالية، فإن قياس عدم اليقين يكشف عن قيود كبيرة في دقة إعادة الفحص، مما يسلط الضوء على الحاجة الماسة للمقاييس القائمة على التوزيع بدلاً من التقديرات النقطية التقليدية لتقييم موثوقية النموذج بشكل صحيح.

Dewmini Hasara Wickremasinghe, Michelle Gibogwe, Andrew Bell, Esther Puyol-Antón, Muhummad Sohaib Nazir, Reza Razavi, Br (…)2026-03-31
💻 computer science

Elucidating the Design Space of Flow Matching for Cellular Microscopy

تحلل هذه الورقة بشكل منهجي فضاء التصميم لنماذج مطابقة التدفق (flow matching) المخصصة للمجهر الخلوي، كاشفةً أن العديد من التقنيات الشائعة تكون ضارة، وتقترح وصفة تدريب مبسطة وقابلة للتوسع تحقق أداءً هو الأفضل في حالته (state-of-the-art) في محاكاة استجابات الخلايا للاضطرابات البيولوجية.

Charles Jones, Emmanuel Noutahi, Jason Hartford, Cian Eastwood2026-03-31
💻 computer science

PhyDCM: A Reproducible Open-Source Framework for AI-Assisted Brain Tumor Classification from Multi-Sequence MRI

تُعد PhyDCM إطار عمل مفتوح المصدر وقابلاً لإعادة الإنتاج، يدمج بنية تصنيف هجينة قائمة على نموذج MedViT مع معالجة معيارية لبيانات DICOM وواجهة سطح مكتب نمطية لتحقيق دقة تتجاوز 93% في التصنيف المدعوم بالذكاء الاصطناًعي لأورام الدماغ من بيانات الرنين المغناطيسي متعددة المتواليات.

Hayder Saad Abdulbaqi, Mohammed Hadi Rahim, Mohammed Hassan Hadi, Haider Ali Aboud, Ali Hussein Allawi2026-03-31
💻 computer science

Deep Learning Aided Vision System for Planetary Rovers

تقدم هذه الورقة نظام رؤية قابل للتوسع وفعال حوسبياً لمركبات استكشاف الكواكب، يجمع بين وحدة في الوقت الفعلي تستخدم صوراً ستيريو محسنة بتقنية CLAHE ونموذج YOLOv11n للكشف عن الأجسام، وبين وحدة غير متصلة بالإنترنت تعتمد على نموذج Depth Anything V2 لإعادة بناء ثلاثي الأبعاد كثيف، محققةً متوسط خطأ في العمق قدره 2.26 سم على بيانات كاميرا الملاحة (NavCam) الخاصة بمهمة تشاندرايان 3.

Lomash Relia, Jai G Singla, Amitabh, Nitant Dube2026-03-31
💻 computer science

The Language of Touch: Translating Vibrations into Text with Dual-Branch Learning

تقدم هذه الورقة ViPAC، وهو إطار تعلم ثنائي المسار يولد أوصافاً باللغة الطبيعية من إشارات الاهتزاز اللمسي عن طريق فصل مكوناتها الدورية وغير الدورية، ويتحقق من صحة هذا النهج باستخدام مجموعة بيانات LMT108-CAP التي تم إنشاؤها حديثاً.

Jin Chen, Yifeng Lin, Chao Zeng, Si Wu, Tiesong Zhao2026-03-31