💻 computer science

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

تقدم الورقة البحثية BiasCareVL، وهو إطار عمل للتعلم متعدد الوسائط مدرك للتحيز تم تدريبه على 3.44 مليون عينة، يدمج التحكم في التحيز مباشرة في تصميم النموذج لتحقيق أداء تشخيصي متفوق وعادل ومتجاوز للقدرات البشرية عبر مختلف المهام السريرية والوسائط التصويرية.

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang2026-04-21
💻 computer science

EasyVideoR1: Easier RL for Video Understanding

تقدم هذه الورقة البحثية EasyVideoR1، وهو إطار عمل شامل وفعال للتعلم التعزيزي مصمم خصيصاً للتغلب على التحديات الحسابية والتقييمية لتدريب نماذج الرؤية واللغة الكبيرة على مهام فهم الفيديو من خلال المعالجة المسبقة المحسنة، ونظام مكافأة معياري، ونموذج تدريب مختلط.

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang2026-04-21
💻 computer science

Physics-Informed Tracking (PIT)

تقدم الورقة البحثية نظام التتبع المستند إلى الفيزياء (PIT)، وهو إطار عمل قائم على الفيديو يستخدم مشفرًا تلقائيًا بـ "عنق زجاجة منقسم" ووحدة فيزياء قابلة للتفاضل لتتبع الجسيمات الفردية من خلال فرض الاتساق الفيزيائي على المسارات، محققةً دقةً دون مستوى البكسل من خلال استراتيجيات تعلم غير خاضعة للإشراف (PILL) وخاضعة للإشراف (PILLS).

Emil Hovad, Allan Peter Engsig-Karup2026-04-21
💻 computer science

KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

تقدم هذه الورقة البحثية KIRA، وهو إطار عمل موحد مكون من خمس مراحل مصمم للتغلب على التحديات الرئيسية في التوليد المعزز بالاسترجاع البصري للمجالات المتخصصة من خلال دمج التقسيم الدلالي الهرمي، والمشفرات المتكيفة مع المجال، والاستدلال متعدد القفزات، والذي تم التحقق من صحته بواسطة معيار DOMAINVQAR الجديد ويُظهر دقة استرجاع وتأصيل فائقتين عبر مهام الصور الطبية والتقنية وصور الأقمار الصناعية.

Parthaw Goswami, Jaynto Goswami Deep2026-04-21
💻 computer science

Rethinking Cross-Dose PET Denoising: Mitigating Averaging Effects via Residual Noise Learning

تقترح هذه الورقة إطار عمل موحداً لتعلم الضوضاء المتبقية يقوم بتقدير الضوضاء مباشرة من صور التصوير المقطعي بالإصدار البوزيتروني ذات الجرعة المنخفضة للتخفيف من آثار المتوسط في النماذج التقليدية، مما يحسن بشكل كبير من أداء إزالة الضوضاء عبر الجرعات المختلفة والقدرة على التعميم عبر مستويات الضوضاء المتفاوتة.

Yichao Liu, Zongru Shao, Yueyang Teng, Junwen Guo2026-04-21
💻 computer science

CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering

تقترح الورقة البحثية إطار عمل CoGR-MoE، وهو إطار توجيه موجه بالمفاهيم للإجابة على الأسئلة البصرية يوازن بين اختيار الخبراء المستقر والمرن من خلال تسخير دلالات خيارات الإجابة لتوجيه المسار والتعلم التبايني لتحسين تمثيلات الخيارات التمييزية.

Xiyin Zeng, Yi Lu, Hao Wang2026-04-21
⚛️ quantum physics

Hybrid Quantum Neural Networks for Enhanced Breast Cancer Thermographic Classification: A Novel Quantum-Classical Integration Approach

تقترح هذه الورقة بنية شبكة عصبية كمومية هجينة (HQNN) مبتكرة تدمج دارة كمومية تباينية مكونة من 4 كيوبت مع طبقات تلافيفية كلاسيكية وآليات انتباه لتحقيق أداء فائق في تصنيف التصوير الحراري لسرطان الثدي مقارنة بنماذج التعلم العميق الكلاسيكية الحديثة.

Riza Alaudin Syah, Irwan Alnarus Kautsar, Gunawan Witjaksono, Haza Nuzly bin Abdull Hamed2026-04-21
💻 computer science

Training-inference input alignment outweighs framework choice in longitudinal retinal image prediction

تُثبت هذه الورقة أن مواءمة توزيعات مدخلات التدريب والاستدلال أكثر أهمية من اختيار أطر توليدية معقدة للتنبؤ بالصور الشبكية الطولية، مما أدى إلى تطوير نموذج TRU، وهو نموذج انحدار حتمي يتفوق على المعايير المرجعية الحالية عبر منصات تصوير ومجموعات أمراض متنوعة.

Liyin Chen, Nazlee Zebardast, Mengyu Wang, Tobias Elze, Jason I. Comander2026-04-21
💻 computer science

DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection

يُعد DVAR إطار عمل لا يتطلب تدريباً يعمل على تعزيز كشف أصالة الفيديو من خلال تنسيق مناظرة عدائية متعددة الوكلاء بين فرضيات توليدية وطبيعية، يتم التحكيم فيها عبر مبدأ طول الوصف الأدنى لتحقيق قدرة فائقة على التعميم والتفسير ضد تقنيات التزييف العميق غير المرئية.

Hongyuan Qi, Feifei Shao, Ming Li, Hehe Fan, Jun Xiao2026-04-21
💻 computer science

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

يُعد TeMuDance إطار عمل مبتكر يتيح التحكم الموجه بالنص لتوليد الرقصات المدفوعة بالموسيقى دون الحاجة إلى مجموعات بيانات موسيقية-نصية-حركية مشروحة يدويًا، وذلك من خلال الاستفادة من نموذج تجسير متمحور حول الحركة لمواءمة مصادر البيانات المنفصلة، واستراتيجية ضبط دقيق ثنائية المسار لضمان الدقة الإيقاعية والدقة الدلالية.

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng2026-04-21