🤖 AI

MindSet: Vision. A toolbox for testing DNNs on key psychological experiments

تقدم هذه الورقة "MindSet: Vision"، وهي مجموعة أدوات متعددة الاستخدامات تحتوي على مجموعات بيانات صور مُتلاعب بها بشكل منهجي وبرمجيات مصممة لاختبار الشبكات العصبية العميقة ضد 30 نتيجة نفسية محددة في الإدراك البصري البشري، متجاوزةً بذلك المعايير القائمة على الملاحظة لتقييم التعرف على الأشياء القائم على الفرضيات بصرامة.

Valerio Biscione, Milton L. Montero, Marin Dujmovic, Gaurav Malhotra, Dong Yin, Guillermo Puebla, Federico Adolfi, Rache (…)2026-03-27
💻 computer science

PE3R: Perception-Efficient 3D Reconstruction

يُعد PE3R إطار عمل أمامي التغذية، لا يتطلب ضبطاً، يدمج الهندسة متعددة الرؤى مع الأولويات الدلالية ثنائية الأبعاد لتحقيق إعادة بناء دلالي ثلاثي الأبعاد قابل للتوسع وبدون تدريب مسبق، وبسرعة استدلال أعلى ودقة تضاهي أحدث الأساليب المتاحة مقارنة بالطرق الحالية.

Jie Hu, Shizun Wang, Xinchao Wang2026-03-27
💻 computer science

Structure Causal Models and LLMs Integration in Medical Visual Question Answering

تقترح هذه الورقة إطار عمل جديد للاستدلال السببي لمهام الإجابة على الأسئلة البصرية الطبية (MedVQA)، يدمج بنية رسم بياني سببي جديدة، وطريقة تعديل "الباب الأمامي" لإعادة أخذ العينات متعدد المتغيرات للقضاء على الارتباك عبر الوسائط، واستراتيجية تعزيز التلقين، محققةً تحسينات كبيرة في الدقة وارتباطات سببية حقيقية عبر ثلاثة مجموعات بيانات.

Zibo Xu, Qiang Li, Weizhi Nie, Weijie Wang, Anan Liu2026-03-27
🤖 machine learning

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

تقدم هذه الورقة البحثية CAT-LVDM، وهو إطار عمل للتدريب المدرك للفساد لنماذج الانتشار الفيديوية الكامنة، والذي يستخدم مشغلات حقن ضوضاء مهيكلة ومتوافقة مع البيانات (BCNI وSACN) لتعزيز المتانة بشكل كبير ضد التكييف المشوب بالضوضاء وتحسين جودة توليد الفيديو مع التفوق على النماذج المرجعية الأكبر التي تدربت على بيانات أقل بكثير.

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang2026-03-27
🤖 machine learning

Patch2Loc: Learning to Localize Patches for Unsupervised Brain Lesion Detection

تقدم هذه الورقة Patch2Loc، وهي طريقة غير خاضعة للإشراف للكشف عن آفات الدماغ تقوم بتدريب شبكة عصبية للتنبؤ بالموقع المكاني لقطع صور الرنين المغناطيسي الطبيعية، وبالتالي تحديد الشذوذات كأقاليم ذات خطأ تنبؤ أو تباين عالٍ، وتُظهر أداءً يضاهي أحدث ما توصل إليه العلم في مجموعات بيانات متعددة.

Hassan Baker, Austin J. Brockmeier2026-03-27
🤖 AI

MedShift: Implicit Conditional Transport for X-Ray Domain Adaptation

تقدم هذه الورقة MedShift، وهو نموذج توليدي موحد مشروط بالفئة يعتمد على مطابقة التدفق وجسور شرودنغر، يتيح ترجمة غير مقترنة عالية الدقة بين صور الأشعة السينية الاصطناعية والحقيقية من خلال تعلم فضاء كامن مشترك محايد للمجال، مصحوباً بمجموعة بيانات X-DigiSkull الجديدة للقياس المرجعي.

Francisco Caetano, Christiaan Viviers, Peter H. N. de With, Fons van der Sommen2026-03-27
🤖 machine learning

Debugging Concept Bottleneck Models through Removal and Retraining

تقدم هذه الورقة CBDebug، وهو إطار عمل لتصحيح الأخطاء يتكون من خطوتين لنماذج عنق الزجاجة المفاهيمية (Concept Bottleneck Models)، يقوم بإزالة المفاهيم غير المرغوب فيها وإعادة تدريب النموذج باستخدام تغذية راجعة محولة على مستوى المفهوم للتخفيف من عدم المواءمة المنهجية والارتباطات الزائفة.

Eric Enouen, Sainyam Galhotra2026-03-27
💻 computer science

Easy3D-Labels: Supervising Semantic Occupancy Estimation with 3D Pseudo-Labels for Automotive Perception

تقدم هذه الورقة Easy3D-Labels، وهي طريقة تولد تسميات ثلاثية الأبعاد كحقائق أرضية زيفة باستخدام Grounded-SAM وMetric3Dv2 لتمكين الإشراف الثلاثي الأبعاد المباشر لتقدير الإشغال الدلالي، مما يلغي التكاليف الحسابية العالية لتوليد المناظر من زوايا جديدة مع تحسين دقة التحديد والأداء بشكل كبير على مجموعة بيانات Occ3D-nuScenes.

Seamie Hayes, Ganesh Sistu, Tim Brophy, Ciaran Eising2026-03-27
💻 computer science

One Dimensional CNN ECG Mamba for Multilabel Abnormality Classification in 12 Lead ECG

تقدم هذه الورقة إطار عمل هجين من نوع (One Dimensional CNN ECG Mamba) يجمع بين استخراج الميزات التلافيفية ونموذج فضاء الحالة ثنائي الاتجاه (Mamba) لتحقيق أداء فائق في تصنيف الاعتلالات متعددة الملصقات في تخطيط كهربية القلب بـ 12 مسرى مقارنة بطرق التعلم العميق الحالية.

Huawei Jiang, Husna Mutahira, Gan Huang, Mannan Saeed Muhammad2026-03-27
🤖 machine learning

Seeing and Knowing in the Wild: Open-domain Visual Entity Recognition with Large-scale Knowledge Graphs via Contrastive Learning

تقترح هذه الورقة البحثية إطار عمل KnowCoL، وهو إطار للتعلم التبايني الموجه بالمعرفة يدمج المدخلات المرئية مع المعرفة النصية والهيكلية القائمة على ويكيداتا (Wikidata) لتحقيق أداء رائد في التعرف على الكيانات المرئية في النطاق المفتوح، لا سيالما بالنسبة للكيانات النادرة وغير المرئية.

Hongkuan Zhou, Lavdim Halilaj, Sebastian Monka, Stefan Schmid, Yuqicheng Zhu, Jingcheng Wu, Nadeem Nazer, Steffen Staab2026-03-27