💻 computer science

MedScribe: Clinically Grounded CT Reporting through Agentic Workflows

يُعد MedScribe إطار عمل قائم على الفرضيات يعمل على تعزيز دقة وتقصي تقارير الأشعة المقطعية من خلال إعادة صياغة عملية التوليد كعملية وكيلية تكرارية حيث يقوم نموذج لغوي كبير باستدعاء أدوات تشخيصية ديناميكياً لتجميع أدلة كمية قبل مرحلة التركيب، متفوقاً بذلك على النماذج الرؤيوية اللغوية الحالية دون الحاجة إلى ضبط دقيق مخصص للمهمة.

Giuseppe A. Orlando, Paolo Papotti, Maria A. Zuluaga, Olivier Humbert, Marco Lorenzi2026-05-05
💻 computer science

Exploring Data-Free LoRA Transferability for Video Diffusion Models

تحدد هذه الورقة أن عدم التوافق في فضاء الأوزان بين نماذج الانتشار بالفيديو القياسية وتلك القائمة على التقطير ينبع من التداخل الطيفي في المجموعات الوظيفية المشتركة، وتقترح إطار عمل "التحكيم الطيفي الواعي بالمجموعات" (CASA)، وهو إطار عمل خالي من البيانات يعمل ديناميكيًا على حل هذه الصراعات لاستعادة قابلية نقل (LoRA) ومنع الانهيار الهيكلي.

Yuchen Wang, Wenliang Zhong, Lichen Bai, Zikai Zhou, Shitong Shao, Bojun Cheng, Shuo Chen, Shuo Yang, Zeke Xie2026-05-05
🤖 machine learning

MER-DG: Modality-Entropy Regularization for Multimodal Domain Generalization

تقدم هذه الورقة MER-DG، وهي طريقة غير مرتبطة بهيكلية معينة تستخدم تنظيم اعتلاج النمط (modality-entropy regularization) لمنع "الفرط في التخصيص للدمج" (fusion overfitting) الناتج عن الاعتماد على التلازمات عبر الوسائط الخاصة بالمصدر، مما يحسن بشكل كبير أداء تعميم النطاق متعدد الوسائط على معايير مثل EPIC-Kitchens وHAC.

Yavuz Yarici, Ghassan AlRegib2026-05-05
💻 computer science

SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition

يقدم SignMAE طريقة تدريب مسبق ذاتي التوجيه قائمة على التجزئة، تستخدم التغطية القائمة على التجزئة لالتقاط إشارات اليد الدقيقة بشكل أفضل، محققةً أداءً هو الأفضل من نوعه في عدة مجموعات بيانات للغة الإشارة مع تقليل متطلبات المدخلات.

Kunyuan Xie, Zhixi Cai, Kalin Stefanov2026-05-05
💻 computer science

From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs

تقدم هذه الورقة البحثية SFI-Bench، وهو معيار تقييم قائم على الفيديو يضم أكثر من 1,500 سؤال تم تصنيفها من قبل خبراء لتقييم النماذج اللغوية الكبيرة متعددة الوسائط في الاستدلال المكاني والوظيفي المهيكل، مما يكشف عن عدم قدرتها الحالية على دمج الذاكرة المكانية مع الاستدلال الوظيفي بفعالية من أجل الذكاء المرتكز على الواقع.

Le Zhang, Jihan Yang, Soundarya Krishnan, Jimit Majmudar, Xiou Ge, Prasoon Puri, Prathamesh Nandkishor Saraf, Shruti Bha (…)2026-05-05
💻 computer science

Video Generation with Predictive Latents

تقدم هذه الورقة البحثية نموذج (Predictive Video VAE) أو (PV-VAE)، وهو إطار عمل مبتكر يعزز نمذجة توليد الفيديو من خلال دمج هدف إعادة بناء تنبؤي لترميز البنى التنبؤية الزمنية، مما يؤدي إلى جودة توليد فائقة، وتقارب أسرع، وفهم أفضل للمهام اللاحقة مقارنة بالطرق الحالية.

Yian Zhao, Feng Wang, Qiushan Guo, Chang Liu, Xiangyang Ji, Jian Zhang, Jie Chen2026-05-05
💻 computer science

NTIRE 2026 Challenge on Efficient Low Light Image Enhancement: Methods and Results

تقدم هذه الورقة مراجعة شاملة لتحدي NTIRE 2026 لتعزيز الصور في الإضاءة المنخفضة بكفاءة، حيث تفصل إحصائيات المشاركة، والحلول خفيفة الوزن المقترحة، ونتائج التقييم المنهجي التي تُظهر تقدماً ملحوظاً في تحقيق التوازن بين جودة الصورة والكفاءة الحسابية من أجل النشر على الأجهزة المحمولة.

Jiebin Yan, Chenyu Tu, Weixia Zhang, Zhihua Wang, Peibei Cao, Qinghua Lin, Yuming Fang, Xiaoning Liu, Zongwei Wu, Zhuyun (…)2026-05-05
⚡ electrical engineering

Biological Spatial Priors Regularize Foundation Model Representations for Cross-Site MSI Generalization in Colorectal Cancer

تُثبت هذه الورقة أن حقن الأولويات المكانية المستوحاة بيولوجياً، وتحديداً ترميز المسافة المحيطية الذي يعكس التفاعلات اللمفاوية الشبيهة بداء كروهن، في تمثيلات النماذج التأسيسية، يحسن بشكل كبير من تعميم عبر المواقع للتنبؤ بعدم استقرار الساتل الميكروي في سرطان القولون والمستقيم عن طريق تنظيم النماذج للتركيز على المورفولوجيا البيولوجية الثابتة بدلاً من العيوب التصويرية الخاصة بكل موقع.

Dasari Naga Raju2026-05-05
🤖 AI

Wake Vision: A Tailored Dataset and Benchmark Suite for TinyML Computer Vision Applications

يقدم هذا المساهمة "Wake Vision"، وهو مسار عمل مؤتمت يولد مجموعة بيانات ضخمة وعالية الجودة للكشف عن الأشخاص في مجال الـ TinyML، ويقلل بشكل كبير، مقارنة بمعيار Visual Wake Words السابق، من معدل خطأ التسمية مع تحسين دقة النموذج عبر مختلف البنيات والظروف.

Colby Banbury, Emil Njor, Andrea Mattia Garavagno, Mark Mazumder, Matthew Stewart, Pete Warden, Manjunath Kudlur, Nat Je (…)2026-05-04
⚡ electrical engineering

Discrete Cosine Transform Based Decorrelated Attention for Vision Transformers

تقترح هذه الورقة طريقتين تعتمدان على تحويل جيب التمام المتقطع (DCT) لنماذج "Vision Transformers": استراتيجية تهيئة للحفاظ على البنية لإسقاطات الانتباه الذاتي تعمل على تحسين دقة التصنيف، وتقنية ضغط في نطاق التردد تقلل من العبء الحسابي عن طريق بتر الضوضاء عالية التردد دون التضحية بالأداء.

Hongyi Pan, Emadeldeen Hamdan, Xin Zhu, Ahmet Enis Cetin, Ulas Bagci2026-05-04