🤖 machine learning

US-JEPA: A Joint Embedding Predictive Architecture for Medical Ultrasound

تقترح الورقة البحثية US-JEPA، وهو إطار عمل للتعلم الذاتي ذاتي الإشراف يستخدم هدف تدريب كامن غير متماثل ذو معلم ثابت للتغلب على تحديات الضجيج في تصوير الموجات فوق الصوتية، مما يظهر أداءً تنافسيًا ضد النماذج الرائدة في اختبار UltraBench الشامل.

Ashwath Radhachandran, Vedrana Ivezić, Shreeram Athreya, Ronit Anilkumar, Corey W. Arnold, William Speier2026-02-24
🤖 AI

RetinaVision: XAI-Driven Augmented Regulation for Precise Retinal Disease Classification using deep learning framework

تقدم هذه الدراسة RetinaVision، وهو إطار عمل للتعلم العميق مدفوع بالذكاء الاصطنا تفسيري (XAI) يستخدم بنيتي Xception وInceptionV3 مع تعزيز متقدم للبيانات لتحقيق تصنيف عالي الدقة لأمراض الشبكية من صور التصوير المقطعي للتماسحي البصري (OCT) مع ضمان القابلية للتفسير السريري من خلال GradCAM وLIME.

Mohammad Tahmid Noor, Shayan Abrar, Jannatul Adan Mahi, Md Parvez Mia, Asaduzzaman Hridoy, Samanta Ghosh2026-02-24
🤖 machine learning

MentalBlackboard: Evaluating Spatial Visualization via Mathematical Transformations

تقدم الورقة البحثية MentalBlackboard، وهو معيار لتقييم التصور المكاني في النماذج اللغوية البصرية من خلال مهام طي الورق وثقبها، كاشفةً أن حتى النماذج المتطورة تعاني بشكل كبير مع التحويلات المتماثلة والتخطيط متعدد المراحل، حيث تحقق دقة لا تتجاوز 25% في مهام التنبؤ الجوهرية.

Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang2026-02-24
💻 computer science

Referring Layer Decomposition

تقدم هذه الورقة مهمة تفكيك الطبقات المرجعية (RLD)، المدعومة بمجموعة بيانات RefLade واسعة النطاق ونموذج مرجعي جديد يسمى RefLayer، لتمكين التفكيك الدقيق للصور الفردية من نوع RGB إلى طبقات RGBA قابلة للتعديل بناءً على الأوامر النصية من أجل التحكم المتقدم في المحتوى البصري.

Fangyi Chen, Yaojie Shen, Lu Xu, Ye Yuan, Shu Zhang, Yulei Niu, Longyin Wen2026-02-24
🤖 AI

Time Series, Vision, and Language: Exploring the Limits of Alignment in Contrastive Representation Spaces

تتقصى هذه الورقة تقارب تمثيلات السلاسل الزمنية والرؤية واللغة، كاشفةً أنه في حين أن المشفرات المدربة مسبقاً بشكل مستقل تكون متعامدة تقريباً، فإن المحاذاة التباينية اللاحقة تتحسن مع حجم النموذج ولكنها تظهر عدم تماثل حيث تتماشى السلاسل الزمنية مع الرؤية بقوة أكبر من النص، كما أن الأوصاف النصية أو البصرية الأكثر ثراءً تحقق عوائد متناقصة بعد تجاوز عتبة كثافة معينة.

Pratham Yashwante, Rose Yu2026-02-24
🤖 AI

Redefining the Down-Sampling Scheme of U-Net for Precision Biomedical Image Segmentation

تقدم هذه الورقة البحثية "Stair Pooling"، وهي استراتيجية جديدة لتقليل العينات تستبدل خفض الأبعاد العنيف بتسلسل من عمليات التجميع متوسطة المدى ومتعددة الاتجاهات لتقليل فقدان المعلومات وتعزيز التقاط الميزات بعيدة المدى، مما يحسن بشكل كبير دقة التجزئة لبنيات U-Net ثنائية وثلاثية الأبعاد في التصوير الطبي الحيوي.

Mingjie Li, Yizheng Chen, Md Tauhidul Islam, Lei Xing2026-02-24
💻 computer science

CountEx: Fine-Grained Counting via Exemplars and Exclusion

يُعد CountEx إطار عمل تمييزي جديد للعد البصري يستفيد من مطالبات التضمين والاستبعاد متعددة الوسائط، إلى جانب وحدة صقل الاستعلام التمييزي، لعد الأشياء بدقة في المشاهد المزدحمة عن طريق كبح المشتتات المتشابهة بصرياً بشكل صريح، وهو ما تم التحقق منه بواسطة معيار CoCount الجديد.

Yifeng Huang, Gia Khanh Nguyen, Minh Hoai2026-02-24
💻 computer science

Decoupling Vision and Language: Codebook Anchored Visual Adaptation

تقدم الورقة البحثية CRAFT، وهي طريقة خفيفة الوزن تفصل بين التكيف البصري واللغوي من خلال ضبط المشفرات البصرية باستخدام كتاب رموز منفصل لترسيخ التمثيلات البصرية، مما يحقق مكاسب كبيرة في الأداء في المهام الخاصة بنطاقات معينة دون تعديل النموذج اللغوي أو الحاجة إلى إعادة المحاذاة عبر بنيات مختلفة.

Jason Wu, Tianchen Zhao, Chang Liu, Jiarui Cai, Zheng Zhang, Zhuowei Li, Aaditya Singh, Xiang Xu, Mani Srivastava, Jonat (…)2026-02-24
🤖 machine learning

Laplacian Multi-scale Flow Matching for Generative Modeling

تقدم هذه الورقة البحثية LapFlow، وهو إطار عمل جديد للنمذجة التوليدية يستفيد من تمثيل هرم لابلاتسيان متعدد المقاييس وبنية خليط متوازي من المحولات لتحقيق جودة صورة فائقة واستدلال أسرع بتكاليف حوسبة أقل مقارنة بطرق مطابقة التدفق أحادية المقياس والمتتالية الحالية.

Zelin Zhao, Petr Molodyk, Haotian Xue, Yongxin Chen2026-02-24
💻 computer science

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

تقدم هذه الورقة MICON-Bench، وهو معيار شامل لتقييم توليد سياق الصور المتعددة في النماذج متعددة الوسائط الموحدة، إلى جانب آلية إعادة توازن الانتباه الديناميكي (DAR) الخالية من التدريب وإطار تقييم مدفوع بنماذج اللغات الكبيرة متعددة الوسائط (MLLM) لتعزيز التماسك عبر الصور وتقليل الهلوسة.

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji2026-02-24