💬 NLP

VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation

تقترح هذه الورقة إطار عمل VAUQ، وهو إطار عمل لتقدير عدم اليقين مدرك للرؤية وخالٍ من التدريب، يستفيد من درجة معلومات الصورة (Image-Information Score) وإخفاء المنطقة المركزية غير الخاضع للإشراف للكشف بشكل موثوق عن الهلوسة في النماذج اللغوية البصرية الكبيرة من خلال قياس اعتمادها صراحةً على الأدلة البصرية.

Seongheon Park, Changdae Oh, Hyeong Kyu Choi, Sean Du, Sharon Li2026-05-05
💻 computer science

LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

تُعد LeapAlign طريقة لضبط النماذج بالتدريب اللاحق لنماذج مطابقة التدفق (flow matching)، حيث تتغلب على مشكلات الذاكرة وانفجار التدرج الناتجة عن الانتشار العكسي للمسارات الطويلة عبر بناء مسارات قفز عشوائية من خطوتين، مما يتيح تحديثات تدرج مباشرة وفعالة ومستقرة من المكافآت إلى خطوات التوليد المبكرة لتحقيق جودة صور ومواءمة فائقة.

Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng2026-05-05
💻 computer science

Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis

تقدم هذه الورقة تحليلاً تجريبياً ولغوياً شاملاً لـ 14 طريقة من أحدث أساليب استرجاع النصوص إلى الفيديو عبر ثلاث مجموعات بيانات، كاشفةً أن أداء النماذج يصل إلى مرحلة الثبات عند التعامل مع الاستعلامات المعقدة أو متعددة الخطوات أو دقيقة التفاصيل، بينما يتفوق في الاستعلامات البسيطة والواضحة، كما تقدم رؤى حول كيفية تأثير خصائص الاستعلام وتنوع مجموعات البيانات على الفعالية الهيكلية.

Maria-Eirini Pegia, Dimitrios Stefanopoulos, Björn {\TH}ór Jónsson, Anastasia Moumtzidou, Ilias Gialampoukidis, Stefanos (…)2026-05-05
💻 computer science

Synthetic Designed Experiments for Diagnosing Vision Model Failure

تقترح هذه الورقة "التجارب التصميمية الاصطناعية لكفاية التمثيل" (SDRS)، وهو إطار عمل يطبق تصميم التجارب الإحصائي لتدقيق نماذج الرؤية بشكل منهجي بحثًا عن أنماط فشل محددة (فجوات التغطية والارتباطات الزائفة) ووصف بيانات اصطناعية مستهدفة لمعالجتها بكفاءة.

Krisanu Sarkar2026-05-05
💻 computer science

Visual Chart Representations for Cryptocurrency Regime Prediction: A Systematic Deep Learning Study

تُظهر هذه الدراسة المنهجية للتعلم العميق أنه بالنسبة للتنبؤ بنظام العملات المشفرة، فإن الشبكات العصبية التلافيفية (CNNs) البسيطة المكونة من 4 طبقات والمدرّبة على مخططات الشموع اليابانية الخام ذات الدقة المنخفضة تتفوق على البنيات المعقدة سابقة التدريب وطرق ترميز الصور المتقدمة، محققةً مساحة تحت منحنى خصائص تشغيل المستقبِل (AUC-ROC) تبلغ 0.892 مع الاستفادة بشكل كبير من نقل التعلم من قاعدة بيانات ImageNet.

Dustin M. Haggett2026-05-05
🤖 machine learning

GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

تقدم الورقة البحثية GAZE، وهو إطار عمل وكيل مُرتبط يُمكّن النماذج اللغوية البصرية الطبية من فحص صور الرنين المغناطيسي للدماغ بشكل تكراري باستخدام أدوات على مستوى العارض واسترجاع الأدبيات، مما يحسن بشكل كبير من أداء التعلم الصفري في الحالات العصبية النادرة مقارنة بالنماذج القياسية ذات التمرير الواحد.

Duaa Alim, Mogtaba Alim, Liam Chalcroft2026-05-05
💻 computer science

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

يقدم هذا البحث نموذج LiteVLA-H، وهو نموذج رؤية-لغة-فعل مدمج بـ 256 مليون معلمة، مُحسَّن للنشر الجوي على متن منصة NVIDIA Jetson AGX Orin، والذي يحقق استدلالاً ثنائي المعدل منخفض التأخير عبر فصل التوجيه التفاعلي السريع (50.65 مللي ثانية) عن السرد الدلالي الأبطأ من خلال استراتيجية ضبط دقيق متخصصة للحفاظ على المعرفة.

Justn williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar2026-05-05
💻 computer science

Skeleton-Based Posture Classification to Promote Safer Walker-Assisted Gait in Older Adults

تُظهر هذه الدراسة أن نماذج تعلم الآلة، ولا سيما النهج الهندسي (Geometric approaches) وخوارزمية XGBoost، تصنف بفعالية استخدام المشايات ووضعيات المستخدم بدقة عالية، مما يقدم حلاً واعداً لتعزيز الوقاية من السقوط والتفاعل بين الإنسان والروبوت في المشايات الذكية لكبار السن.

Sergio D. Sierra M., Monica Sinha, Marcela Múnera, Carlos A. Cifuentes2026-05-05
💻 computer science

X2SAM: Any Segmentation in Images and Videos

يُعد X2SAM نموذجاً لغوياً لغوياً ضخماً موحداً متعدد الوسائط يوسع قدرات أي نوع من أنواع التجزئة من الصور إلى الفيديوهات عبر ربط نموذج لغوي كبير بوحدة ذاكرة قناعية، مما يتيح توليد أقنعة عالية الجودة ومتسقة زمنياً من التعليمات الحوارية والمحفزات البصرية عبر مهام تجزئة متنوعة.

Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang2026-05-05
💻 computer science

When To Adapt? Adapting the Model or Data in Federated Medical Imaging

تقارن هذه الورقة بشكل منهجي بين استراتيجيات تخصيص النماذج وتنسيق البيانات في التصوير الطبي الاتحادي، كاشفةً أن نهج التكيف الأمثل يعتمد على طبيعة التباين في النطاق، حيث يتفوق التنسيق في التباينات القائمة على المظهر، بينما تتفوق التخصيص في الاختلافات الهيكلية.

Chamani Shiranthika, Parvaneh Saeedi2026-05-05