🤖 AI

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

إن MetaphorStar هو إطار عمل للتعلم التعزيزي البصري متكامل من البداية إلى النهاية، يستخدم مجموعة بيانات جديدة دقيقة التفاصيل (TFQ-Data) وطريقة تعلم تعزيزي متخصصة (TFQ-GRPO) لتعزيز قدرة النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير على فهم والاستدلال حول الاستعارات والآثار الصورية المعقدة.

Chenhao Zhang, Yazhe Niu, Hongsheng Li2026-02-12
⚡ electrical engineering

Enhancing Underwater Images via Adaptive Semantic-aware Codebook Learning

تقترح الورقة البحثية SUCode، وهي شبكة لتحسين الصور تحت الماء مدركة للدلالات (semantic-aware) تستخدم تمثيلات كتاب رموز (codebook) منفصلة وتكيفية على مستوى البكسل ونموذج تدريب ثلاثي المراحل لمعالجة التدهور غير المتسق عبر المناطق الدلالية المختلفة من أجل استعادة فائقة للألوان والنسيج.

Bosen Lin, Feng Gao, Yanwei Yu, Junyu Dong, Qian Du2026-02-12
💻 computer science

Fast Person Detection Using YOLOX With AI Accelerator For Train Station Safety

تقيم هذه الورقة أداء نموذج كشف الأشياء YOLOX لسلامة الركاب في محطات القطارات، حيث أظهرت أن مسرع الذكاء الاصطناعي Hailo-8 يتفوق على Jetson Orin Nano من حيث الدقة وزمن الاستجابة على حد سواء.

Mas Nurul Achmadiah, Novendra Setyawan, Achmad Arif Bryantono, Chi-Chia Sun, Wen-Kai Kuo2026-02-12
💻 computer science

AurigaNet: A Real-Time Multi-Task Network for Enhanced Urban Driving Perception

تُعد AurigaNet بنية شبكية متقدمة متعددة المهام تدمج بين كشف الأجسام، وكشف المسارات، وتجزئة مثيل المنطقة القابلة للقيادة لتوفين حل إدراك عالي الدقة والكفاءة وفي الوقت الفعلي للقيادة الذاتية، كما يتضح من أدائها المتفوق على مجموعة بيانات BDD100K ونشرها الناجح على الأجهزة المدمجة.

Kiarash Ghasemzadeh, Sedigheh Dehghani2026-02-12
🤖 AI

TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning

تقدم الورقة البحثية TwiFF، وهو إطار عمل جديد للاستنتاج البصري الديناميكي يتميز بمجموعة بيانات واسعة النطاق (TwiFF-2.7M)، ومعيار تقييم متخصص (TwiFF-Bench)، ونموذج موحد يعزز الاستنتاج متعدد الوسائط من خلال التوليد التكراري لإطارات الأفعال المستقبلية وخطوات الاستنتاج النصية.

Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, Kun Kuang2026-02-12
🤖 AI

A Diffusion-Based Generative Prior Approach to Sparse-view Computed Tomography

تقترح هذه الورقة إطار عمل "الأولوية التوليدية العميقة" (DGP) المُحسَّن الذي يدمج النماذج القائمة على الانتشار مع التحسين التكراري لتحسين جودة إعادة بناء صور الأشعة المقطعية من مخططات السينوغرافرام ذات الرؤية المتفرقة.

Davide Evangelista, Pasquale Cascarano, Elena Loli Piccolomini2026-02-12
💻 computer science

OccFace: Unified Occlusion-Aware Facial Landmark Detection with Per-Point Visibility

تُعد "OccFace" إطار عمل موحداً واعياً بالانسداد للوجوه المتنوعة الشبيهة بالبشر، حيث يتنبأ بشكل مشترك بإحداثيات المعالم الوجهية ووضوح كل نقطة من خلال دمج الأدلة المحلية مع سياق المعالم المتقاطع.

Xinhao Xiang, Zhengxin Li, Saurav Dhakad, Theo Bancroft, Jiawei Zhang, Weiyang Li2026-02-12
🤖 machine learning

Spectral-Spatial Contrastive Learning Framework for Regression on Hyperspectral Data

تقترح هذه الورقة إطار عمل للتعلم التبايني الطيفي-المكاني غير المرتبط بنموذج محدد ومجموعة من عمليات تعزيز البيانات المتخصصة المصممة لتحسين أداء الانحدار على البيانات فائقة الطيف عبر مختلف البنى الأساسية.

Mohamad Dhaini, Paul Honeine, Maxime Berar, Antonin Van Exem2026-02-12
💻 computer science

From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?

تقدم هذه الورقة البحثية **CyclingVQA**، وهو معيار تشخيصي جديد مصمم لتقييم ما إذا كانت النماذج اللغوية البصرية (VLMs) يمكنها تعميم قدراتها في الإدراك والاستنتاج من منظور متمحور حول المركبة إلى منظور متمحور حول راكب الدراجة، مما يكشف أن النماذج الحالية — بما في ذلك النماذج المتخصصة في القيادة — لا تزال تعاني في الفهم المكاني المرتبط براكب الدراجة وربط قواعد المرور.

Krishna Kanth Nakka, Vedasri Nakka2026-02-12
🤖 machine learning

Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training

تقترح هذه الورقة أن التعلم المعزز (RL) يتفوق على الضبط الدقيق الخاضع للإشراف (SFT) في تعميم النماذج البصرية اللغوية (VLM) لأنه يعطي الأولوية ضمنياً للبيانات متوسطة الصعوبة، مما دفع المؤلفين إلى تقديم "الضبط الدقيق المنسق حسب الصعوبة" (DC-SFT)، وهو أسلوب أكثر كفاءة يحقق أداءً فائقاً خارج نطاق التوزيع من خلال التصفية الصريحة لعينة الصعوبة المثلى.

Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun2026-02-12