🤖 AI

Detecting and refurbishing ground truth errors during training of deep learning-based echocardiography segmentation models

تُظهر هذه الدراسة أن طريقة تباين التدرجات (Variance of Gradients) فعالة في اكتشاف الأخطاء في تسميات الحقيقة الأرضية لتجزئة صور صدى القلب، وأن تصحيح هذه الأخطاء أثناء عملية التدريب يحسن أداء النموذج بشكل كبير، لا سيما عند مستويات الخطأ العالية.

Iman Islam, Bram Ruijsink, Andrew J. Reader, Andrew P. King2026-04-15
🤖 machine learning

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

يقدم VideoFlexTok طريقة لترميز الفيديو من الخشن إلى الناعم وذات طول مرن، تستبدل تمثيلات الشبكة ثلاثية الأبعاد الثابتة بتسلسلات رموز متغيرة الطول، مما يتيح تدريباً أكثر كفاءة وتوليد فيديوهات طويلة عبر إعطاء الأولوية للدلالات المجردة والحركة قبل التفاصيل الدقيقة.

Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehg (…)2026-04-15
🤖 machine learning

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

تقدم هذه الورقة برامج الإدراك (P2^2)، وهي طريقة لا تتطلب تدريباً تعمل على تحويل مخرجات أدوات الرؤية الكثيفة ذات مستوى البكسل إلى ملخصات موجزة ذات طبيعة لغوية، مما يمكّن النماذج اللغوية متعددة الوسائط من تحقيق مكاسب كبيرة في الأداء في مهام الاستدلال البصري دون الحاجة إلى إعادة تدريب النموذج أو إجراء تعديلات عليه.

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi2026-04-15
🤖 AI

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

تقدم هذه الدراسة المسحية تحليلاً شاملاً للهلوسة في النماذج اللغوية الكبيرة للفيديو من خلال تقديم تصنيف منهجي يميز بين التشويه الديناميكي وتزييف المحتوى، ومراجعة استراتيجيات التقييم والتخفيف الحالية، وتحديد الاتجاهات البحثية المستقبلية لبناء أنظمة فيديو-لغة أكثر متانة.

Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu2026-04-15
🤖 machine learning

Adaptive Data Dropout: Towards Self-Regulated Learning in Deep Neural Networks

تقترح هذه الورقة البحثية "التسرب التكيفي للبيانات" (Adaptive Data Dropout)، وهو إطار عمل للتعلم ذاتي التنظيم يقوم بتعديل مجموعة فرعية من بيانات التدريب ديناميكيًا بناءً على تغذية راجعة للأداء لتحسين الكفاءة والتعميم في الشبكات العصبية العميقة.

Amar Gahir, Varshil Patel, Shreyank N Gowda2026-04-15
💻 computer science

Boosting Visual Instruction Tuning with Self-Supervised Guidance

تقترح هذه الورقة V-GIFT، وهي طريقة خفيفة الوزن تعزز قدرات الاستدلال البصري للنماذج اللغوية الكبيرة متعددة الوسائط من خلال دمج جزء صغير من مهام التمهيد ذاتية الإشراف المعاد صياغتها كتعليمات لغوية طبيعية في بيانات التدريب، مما يجبر النماذج على الاعتماد على الأدلة البصرية بدلاً من الأولويات اللغوية.

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris2026-04-15
💻 computer science

AbdomenGen: Sequential Volume-Conditioned Diffusion Framework for Abdominal Anatomy Generation

تقدم الورقة البحثية AbdomenGen، وهو إطار عمل انتشار متسلسل مشروط بالحجم يستخدم "كمية التحكم في الحجم" (Volume Control Scalar) مبتكرة لتوليد تنوعات تشريحية للبطن ذات دلالة سريرية وأمانة هندسية مع تحكم مستقل متعدد الأعضاء ومحاذاة توزيعية محسنة لأبحاث التصوير الطبي.

Yubraj Bhandari, Lavsen Dahal, Paul Segars, Joseph Y. Lo2026-04-15
⚡ electrical engineering

Probabilistic Feature Imputation and Uncertainty-Aware Multimodal Federated Aggregation

تقدم هذه الورقة شبكة استكمال الميزات الاحتمالية (P-FIN)، وهي إطار عمل للتعلم الاتحادي يولد تقديرات عدم يقين معايرة للأنماط المفقودة لتمكين بوابات الميزات المحلية والجمع العالمي الواعي بالموثوقية، مما يحسن بشكل كبير أداء تصنيف صور الأشعة السينية للصدر متعددة الأنماط في البيئات الرعائية التي تحافظ على الخصوصية.

Nafis Fuad Shahid, Maroof Ahmed, Md Akib Haider, Saidur Rahman Sagor, Aashnan Rahman, Md Azam Hossain2026-04-15
💬 NLP

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

تقدم الورقة البحثية GlotOCR Bench، وهو معيار شامل لتقييم أداء التعرف الضوئي على الحروف (OCR) عبر أكثر من 100 نظام كتابة من أنظمة يونيكود، كاشفةً أن حتى نماذج الرؤية واللغة المتطورة تعاني في التعميم خارج مجموعة صغيرة من أنظمة الكتابة وتعتمد بشكل كبير على تغطية التدريب المسبق بدلاً من الإدراك البصري القوي.

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze2026-04-15
💻 computer science

Agentic Discovery with Active Hypothesis Exploration for Visual Recognition

تقدم الورقة البحثية HypoExplore، وهو إطار عمل وكيل (agentic framework) يعامل اكتشاف البنى العصبية كاستقصاء علمي قائم على الفرضيات باستخدام النماذج اللغوية الكبيرة، والتفرع التطوري، والتغذية الراجعة متعددة الوكلاء لتنقيح والتحقق من صحة البنى الرؤيوية خفيفة الوزن بشكل تكراري، محققاً أداءً هو الأفضل في فئته (state-of-the-art) على معايير مثل CIFAR وMedMNIST مع بناء فهم قابل للنقل لمجال التصميم.

Jaywon Koo, Jefferson Hernandez, Ruozhen He, Hanjie Chen, Chen Wei, Vicente Ordonez2026-04-15