🤖 AI

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

تقترح هذه الورقة إطار عمل للضبط الدقيق كفء في المعلمات يجمع بين نموذج الرؤية واللغة Florence-2 للإجابة على الأسئلة البصرية السريرية، ونموذج Stable Diffusion 2.1 المعزز بتقنية LoRA لتوليد صور جهاز هضمي اصطناعية تحافظ على الخصوصية، مما يظهر أداءً فائقًا وتكاليف حوسبة منخفضة مقارنة بالنماذج الحالية.

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman2026-05-26
💻 computer science

HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithm

تقترح هذه الورقة البحثية إطار عمل HCL-FF، وهو إطار عمل مبتكر يعزز خوارزمية Forward-Forward من خلال استراتيجية تعلم هرمية من الخشن إلى الناعم وهدف تبايني تحت إشراف، محققاً أداءً هو الأفضل في فئته على مجموعات بيانات CIFAR-10 وCIFAR-100 وTiny-ImageNet عبر معالجة قيود التحسين المحلي الصرف والغموض الدلالي.

Jie-En Yao, Hong-En Chen, C. -C. Jay Kuo2026-05-26
🤖 AI

Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

تقدم هذه الورقة استنتاج "فرق تسد" (DCI)، وهي استراتيجية مبتكرة لتوسيع نطاق الاستنتاج في وقت الاختبار، تعمل على تخفيف انهيار الأداء في التعرف البصري واسع النطاق من خلال تفكيك مهام التصنيف المعقدة بشكل متكرر إلى مشكلات فرعية محلية، مما يؤدي إلى تحسين نسب الإشارة إلى الضوضاء والكفاءة الحسابية لتمكين النماذج اللغوية الكبيرة متعددة الوسائط مفتوحة المصدر والخفيفة من منافسة العمالقة المغلقين من الطراز الأول دون تدريب إضافي.

Zhipeng Ye, Jiaqi Huang, Feng Jiang, Qiufeng Wang, Yikang Duan, Dawei Wang, Xihang Zhou, Qian Qiao2026-05-26
💻 computer science

Fishbone: From One 3D Asset to a Million Controllable Edits

تقدم الورقة البحثية "Fishbone"، وهو تمثيل موحد للضلوع والعمود الفقري يحول شبكة ثلاثية الأبعاد واحدة إلى مليون تعديل قابل للتحكم من خلال تمكين التشوه البارامتري في الوقت الفعلي، وديناميكيات المساحة المختزلة، والتحريك عبر بنية مدركة هندسياً مستوحاة من الكائنات الطبيعية.

Yumeng He, Xiaoying Wang, Peihao Li, Yanjia Huang, Joe Masterjohn, Jiajun Wu, Leonidas Guibas, Yin Yang, Ying Jiang, Che (…)2026-05-26
💻 computer science

CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation

تقدم هذه الورقة البحثية CLIP-Guided SAM، وهو إطار عمل فعال من حيث المعلمات يعمل على تعزيز نموذج "Segment Anything Model" الأعمى دلاليًا عبر حقن ميزات مستمدة من CLIP مباشرة في مشفر الصور الخاص به من خلال محولات (adapters) خفيفة الوزن، مما يتيح تقسيمًا قويًا محدد المفاهيم في كل من الأنماط التفاعلية والنصية فقط مع الحفاظ على واجهة النموذج الأصلية القابلة للتوجيه بالنماذج.

Shayan Jalilian, Abdul Bais2026-05-26
💻 computer science

AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning

تقترح الورقة البحثية AOEPT، وهي طريقة جديدة لضبط التلقين (prompt tuning)، تتغلب على اختناق تقليص الأنماط الضمني في سيناريوهات الأنماط المفقودة من خلال إدخال تلقينات سياقية نمطية (MCPs) خفيفة الوزن لاستعادة نطاق الاستدلال للمحولات متعددة الوسائط بما يتجاوز الأنماط الملحوظة.

Jian Lang, Rongpei Hong, Ting Zhong, Fan Zhou2026-05-26
🤖 AI

Multiscale Real-Time Object Detection in the NMS-Free Era: A Comparative Performance Evaluation of YOLOv8 and YOLO26

تقدم هذه الورقة تقييماً مقارناً لنموذج YOLO26 الخالي من عملية حذف التداخل غير الأقصى (NMS-free) ونموذج YOLOv8 القائم على عملية حذف التداخل (NMS-based) عبر مقاييس ومجموعات بيانات متعددة، مما يكشف أنه في حين يوفر YOLO26 دقة وكفاءة متفوقتين في المهام العامة، فإن الاختيار الأمثل للكاشف يعتمد في النهاية على خصائص مجموعة البيانات المحددة، ومقاييس الأجسام، والقيود المتعلقة بالأجهزة.

Chidera G. Oguine, Kanyifeechukwu J. Oguine, Obiozor M. Oguine, Ozioma C. Oguine2026-05-26
🤖 AI

Adversarial Error Correction for Visual Autoregressive Generation

تقدم هذه الورقة البحثية AID-VAR، وهو إطار عمل جاهز للاستخدام (plug-and-play) يعمل على الحد من انتشار الأخطاء المتتالية في نماذج التوليد الذاتي البصري (VAR) عبر توظيف آلية تشخيص تنافسية لتنقية فضاءات الميزات (feature manifolds) عند كل مقياس، مما يؤدي إلى تحسين دقة الصور والاتساق الهيكلي بشكل كبير مع حد أدنى من العبء الحسابي.

Ligong Bi, Tao Huang, Jianyuan Guo, Chang Xu2026-05-26
💻 computer science

QuoVLA: Quotient Space for Vision-Language-Action Models

يتحدى QuoVLA الرؤية السائدة بأن نماذج الرؤية واللغة مسبقة التدريب تفتقر إلى معلومات الحركة من خلال تقديم إطار عمل فضاء خارج (quotient-space) يضغط تمثيلاتها الكامنة إلى تمثيلات كافية للحركة، مما يحسن بشكل كبير من تعميم التحكم في الروبوت عبر التحولات البصرية واللغوية والبيئية.

Xuan Wang, Yinan Wu, Haoran Duan, Jungong Han2026-05-26
💻 computer science

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

يُعد X-Foresight نموذجاً مبتكراً للرؤية واللغة والعمل (Vision-Language-Action)، حيث يدمج نمذجة العالم التنبؤية مع التحكم في الوقت الفعلي من خلال استراتيجية تتابعية تعتمد على الكتل (chunk-wise) طويلة المدى وأخذ عينات الأهمية الزمنية، مما يتغلب بفعالية على قيود التنبؤ الساذج بالإطارات لتعزيز التخطيط الآمن والقابل للتعميم والفهم الفيزيائي في الأنظمة ذاتية القيادة.

Baolu Li (Victor), Jingyu Qian (Victor), Rui Guo (Victor), Yilun Chen (Victor), Hanpeng Liu (Victor), Yuan Lin (Victor) (…)2026-05-26