💻 computer science

PRS-Med: Position Reasoning Segmentation in Medical Imaging

تقدم الورقة البحثية إطار عمل موحد يُدعى PRS-Med، والذي يستفيد من نموذج رؤية ولغة طبية ومجموعة بيانات جديدة تم التحقق منها من قبل خبراء (PosMed) للقيام بتجزئة الاستدلال الموضعي عبر محاكاة أنماط البحث القائمة على المناطق لدى أخصائيي الأشعة، مما يؤدي إلى تحسين دقة التجزئة وقابليتها للتفسير بشكل كبير مقارنة بالطرق الحالية القائمة على التلقين.

Quoc-Huy Trinh, Minh-Van Nguyen, Jun Zeng, Debesh Jha, Ulas Bagci2026-04-01
🤖 AI

TTA-DAME: Test-Time Adaptation with Domain Augmentation and Model Ensemble for Dynamic Driving Conditions

يعالج TTA-DAME تحدي ظروف القيادة الديناميكية من خلال الاستفادة من تعزيز نطاق المصدر، ومميز النطاق، ومجموعة من الكواشف المدمجة عبر عملية تقليص القيم غير القصوى لتحسين أداء التكيف في وقت الاختبار بشكل كبير على معيار SHIFT.

Dongjae Jeon, Taeheon Kim, Seongwon Cho, Minhyuk Seo, Jonghyun Choi2026-04-01
🤖 AI

Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning

تقترح هذه الورقة طريقة للتعلم المستمر بزيادة الفئات مع التكرار (CIR) تستفيد من البيانات غير المصنفة الوفيرة من خلال تقطير المعرفة متعدد المستويات والتعلم الذاتي الخاضع للإشراف الديناميكي لتعزيز استقرار النموذج ومرونته، محققة المركز الثاني في تحدي CVPR 5th CLVISION.

Taeheon Kim, San Kim, Minhyuk Seo, Dongjae Jeon, Wonje Jeung, Jonghyun Choi2026-04-01
💻 computer science

Unified Multimodal Models as Auto-Encoders

تقترح هذه الورقة البحثية Unified-GRPO، وهي طريقة للتدريب اللاحق تعتمد على التعلم المعزز توحد بين فهم الصور إلى النصوص وتوليد الصور من النصوص ضمن إطار عمل للمشفر التلقائي، باستخدام مكافآت إعادة البناء لخلق دورة تعزيز متبادل حيث يؤدي تحسين الترميز الدلالي إلى تعزيز إعادة بناء الصور والعكس صحيح.

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Ji (…)2026-04-01
🤖 AI

Align Your Query: Representation Alignment for Multimodality Medical Object Detection

تقترح هذه الورقة إطار عمل غير مرتبط بكاشف محدد يعزز الكشف عن الأجسام الطبية متعدد الوسائط من خلال تقديم رموز وسائط خفيفة الوزن ومرحلة تدريب مسبق لمحاذاة تمثيلات استعلام الكائن مع وسائط التصوير الخاصة بها، مما يتغلب على تحديات إحصائيات البيانات غير المتجانسة دون الحاجة إلى تغييرات هيكلية أو ملصقات إضافية.

Ara Seo, Bryan Sangwoo Kim, Hyungjin Chung, Jong Chul Ye2026-04-01
🤖 AI

REN: Anatomically-Informed Mixture-of-Experts for Interstitial Lung Disease Diagnosis

تقدم هذه الورقة شبكات الخبراء الإقليمية (REN)، وهو إطار عمل لخليط من الخبراء مستند إلى التشريح يستفيد من التخصص الخاص بفصوص الرئة والبوابات متعددة الوسائط لتحسين دقة تشخيص أمراض الرئة الخلالية وقابليتها للتفسير بشكل كبير مقارنة بالنماذج المرجعية التقليدية للتعلم العميق.

Alec K. Peltekian, Halil Ertugrul Aktas, Gorkem Durak, Kevin Grudzinski, Bradford C. Bemiss, Carrie Richardson, Jane E. (…)2026-04-01
🤖 AI

TransFIRA: Transfer Learning for Face Image Recognizability Assessment

تُعد TransFIRA إطار عمل للتعلم بنقل المعرفة خفيف الوزن وخالٍ من التوسيم، يعمل على تحسين تقييم قابلية التعرف على صور الوجوه من خلال ربط مقاييس الجودة مباشرة في فضاء التضمين عبر تشابه مركز الفئة والانفصال الزاوي، محققاً دقة تحقق رائدة في عمليات التحقق وموسعاً نطاق التطبيق ليشمل التعرف على الجسم والقابلية للتفسير دون الاعتماد على تسميات خارجية أو استدلالات تقريبية.

Allen Tu, Kartik Narayan, Joshua Gleason, Jennifer Xu, Matthew Meyn, Tom Goldstein, Vishal M. Patel2026-04-01
💻 computer science

PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding

تُعد PartNeXt مجموعة بيانات من الجيل التالي تضم أكثر من 23,000 نموذج ثلاثي الأبعاد عالي الجودة وذات ملمس واقعي مع تعليقات توضيحية دقيقة وهرمية للأجزاء، مما يعالج أوجه القصور في مجموعات البيانات السابقة ويطور بشكل كبير الأبحاث في مجال تقسيم الأجزاء ثلاثية الأبعاد والإجابة على الأسئلة المتمحورة حول الأجزاء.

Penghao Wang, Yiyang He, Xin Lv, Yukai Zhou, Lan Xu, Jingyi Yu, Jiayuan Gu2026-04-01
💻 computer science

Text-guided Fine-Grained Video Anomaly Understanding

تقترح الورقة البحثية إطار عمل T-VAU، وهو إطار عمل موجه بالنصوص يستفيد من مُفكك شفرة خريطة حرارية للتشوهات (Anomaly Heatmap Decoder) ومُشفّر تشوهات مدرك للمناطق (Region-aware Anomaly Encoder) لتمكين النماذج الرؤية-اللغوية الضخمة من إجراء كشف موحد للتشوهات في الفيديو بدقة عالية، وتحديد المواقع بدقة على مستوى البكسل، والاستدلال الدلالي القابل للتفسير.

Jihao Gu, Kun Li, He Wang, Kaan Akşit2026-04-01
💻 computer science

"It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with Vision-Language Models

تقيم هذه الورقة كيف تؤدي مشكلات جودة الصور الشائعة إلى تدهور دقة نماذج الرؤية واللغة في توليد أوصاف المنتجات للمستخدمين المكفوفين وضعاف البصر، مما يكشف عن انخفاض كبير في الأداء ويؤكد الحاجة إلى ممارسات تقييم متمحورة حول ذوي الإعاقة لضمان تلبية هذه الأدوات لاحتياجات الوصول في العالم الحقيقي.

Kapil Garg, Xinru Tang, Jimin Heo, Dwayne R. Morgan, Darren Gergle, Erik B. Sudderth, Anne Marie Piper2026-04-01