⚡ electrical engineering

Annotation-free deep learning for detection and segmentation of fetal germinal matrix-intraventricular hemorrhage in brain MRI

تقدم هذه الدراسة FreeHemoSeg، وهو إطار عمل للتعلم العميق لا يتطلب تسميات توضيحية، يقوم بتخليق صور نزيف كاذب من بيانات رنين مغناطيسي طبيعية للجنين للكشف بدقة عن وتجزئة نزيف المادة الرمادية داخل البطينات، مما يحسن حساسية التشخيص وكفاءة أطباء الأشعة دون الحاجة إلى مجموعات بيانات تدريبية موسومة يدويًا.

Mingxuan Liu, Yingqi Hao, Yi Liao, Juncheng Zhu, Haoxiang Li, Hongjia Yang, Yifei Chen, Yijin Li, Kasidit Anmahapong, Zi (…)2026-05-12
🤖 machine learning

Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning

تقدم هذه الورقة البحثية "تحسين السياسة المدرك للاحتفاظ" (RaPO)، وهي طريقة جديدة للضبط الدقيق بالتعزيز تخفف من حدة النسيان الكارثي في التعلم البصري المستمر من خلال معالجة عدم الإدراك بانحراف المسار عبر تشكيل مكافأة الاحتفاظ وتطبيع الميزة عبر المهام، مما يحقق أداءً فائقاً مقارنة بالنهج القائمة.

Meng Lou, Hanzhong Guo, Linwei Chen, Yizhou Yu2026-05-12
🤖 AI

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

تقدم الورقة البحثية DeepTumorVQA، وهو معيار مرجعي ثلاثي الأبعاد للأشعة المقطعية (CT) هرمي البنية يقوم بتفكيك تشخيص الأورام إلى أربع مراحل تدريجية لتقييم نماذج الرؤية واللغة الطبية والوكلاء المعززين بالأدوات، كاشفةً أن القياس الكمي يمثل عقبة رئيسية يمكن التخفيف من حدتها من خلال دمج الأدوات والإشراف خطوة بخطوة.

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zon (…)2026-05-12
🤖 AI

Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

تقدم هذه الورقة إطار عمل لتقطير المعرفة ينقل الاستدلال المكاني ثلاثي الأبعاد من نموذج معلم ضخم إلى نموذج طالب خفيف الوزن باستخدام VGGT وآلية "سلسلة أفكار خفية" (Hidden CoT) لـ "مسودة لاحقة" (latent scratchpad)، محققةً تخفيضات كبيرة في حجم النموذج وزمن الاستجابة مع الحفاظ على أداء قوي في مهام فهم المشاهد ثلاثية الأبعاد.

Alaa Asfour, Christopher Indris, Leihan Chen, Tejas Vyas, Guanghui Wang2026-05-12
🤖 AI

MoPO: Incorporating Motion Prior for Occluded Human Mesh Recovery

تُعد MoPO إطار عمل مبتكر لاستعادة الشبكة البشرية المحجوبة، حيث يستفيد من الأولويات الحركية من تسلسلات الوضعيات للكشف عن حالات الحجب، والتنبؤ بمواقع المفاصل المفقودة، وتحسين الوضع النهائي، مما يحقق دقة متطورة واتساقاً زمنياً في كل من المعايير الخاصة بالحجب والمعايير القياسية.

Tao Tang, Hong Liu, Xinshun Wang, Wanruo Zhang2026-05-12
🤖 AI

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

تقدم هذه الورقة EgoMemReason، وهو معيار شامل مصمم لتقييم فهم الفيديو من منظور الشخص الأول (egocentric) طويل المدى عبر اختبار الاستدلال القائم على الذاكرة عبر أنواع الكيانات والأحداث والسلوكيات، مما يكشف أن النماذج متعددة الوسائط الحالية تعاني بشكل كبير في دمج الأدلة المتفرقة عبر فترات زمنية تمتد لعدة أيام.

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal2026-05-12
🤖 AI

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

تقدم هذه الورقة البحثية Polaris-Bench، وهو معيار مرجعي يعيد صياغة مهام الاستدلال البصري في الإحداثيات القطبية للكشف عن ثغرة "الاختصار الكارتيزي" في النماذج اللغوية الكبيرة متعددة الوسائط الحالية، مما يكشف أن أداءها العالي في المعايوهات القياسية القائمة على الشبكات ينبع من استغلال أنماط الإحداثيات النصية بدلاً من الفهم البصري القوي والمستقل عن الطوبولوجيا.

Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang2026-05-12
🤖 AI

Hyperbolic Distillation: Geometry-Guided Cross-Modal Transfer for Robust 3D Object Detection

تقترح هذه الورقة البحثية إطار عمل HGC-Det، وهو إطار للتقطير عبر الوسائط موجه بالهندسة الزائدية يدمج ميزات الصور والسحب النقطية من خلال تحسين الفوكسل الموجه دلاليًا، ونقل الميزات المقيد بالهندسة الزائدية، والتجميع القائم على الهندسة لتحقيق كشف قوي للأجسام ثلاثية الأبعاد مع تحسين التوازن بين الدقة والتكلفة عبر مجموعات بيانات متنوعة داخلية وخارجية.

Kanglin Ning, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan2026-05-12
🤖 AI

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

يقدم KnotBench معياراً مرجعياً صارماً باستخدام ما يقرب من 860,000 مخطط للعقد لتوضيح أن النماذج اللغوية الرؤية الحالية، على الرغم من تحسن أدائها مع أوضاع "التفكير"، تعاني بشكل أساسي من صعوبة في ترجمة هياكل العقد البصرية إلى استدلال رمزي قابل للتنفيذ، وغالباً ما تفشل في التفوق على الخطوط المرجعية العشوائية في المهام التي تتطلب معالجة تخطيطية.

Hao Liu, Jicheng Liu2026-05-12
🤖 AI

Geometric 4D Stitching for Grounded 4D Generation

تقترح هذه الورقة البحثية "الخياطة الهندسية رباعية الأبعاد" (Geometric 4D Stitching)، وهي إطار عمل فعال يحدد بوضوح المناطق الهندسية المفقودة ويملؤها بغرز رباعية الأبعاد مستندة إلى معالم واقعية لمعالجة التناقضات في طرق التوليد رباعي الأبعاد الحالية، مما يتيح توسيع وتعديل المشاهد بسرعة وجودة عالية على وحدة معالجة رسوميات واحدة.

Sunwoo Park, Taesung Kwon, Jong Chul Ye2026-05-12