🤖 AI

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

يقدم RubiCap إطار عمل جديد للتعلم التعزيزي يستفيد من القواعد التقييمية المولدة بواسطة النماذج اللغوية الكبيرة لإنشاء إشارات مكافأة مهيكلة ومتعددة الأوجه لوصف الصور الكثيف، مما يتغلب على قيود التقطير الخاضع للإشراف والفاحصات الحتمية لتحقيق أداء رائد وكفاءة فائقة في استخدام الكلمات عبر مختلف المعايير المرجعية.

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu2026-03-11
🔭 astrophysics

POLISH'ing the Sky: Wide-Field and High-Dynamic Range Interferometric Image Reconstruction with Application to Strong Lens Discovery

تقدم هذه الورقة إطار عمل للتعلم العميق محسّن، يُدعى POLISH، والذي يستخدم التدريب القائم على الرقع (patch-wise training) وتحويلات الكثافة غير الخطية لتحقيق تصوير تداخلي راديوي واسع المجال وذي نطاق ديناميكي عالٍ وقوي، مما يظهر قدرته على زيادة معدل اكتشاف العدسات الجاذبية القوية بشكل كبير مقارنة بالطرق التقليدية.

Zihui Wu, Liam Connor, Samuel McCarty, Katherine L. Bouman2026-03-11
💻 computer science

Progressive Split Mamba: Effective State Space Modelling for Image Restoration

تقترح الورقة البحثية نموذج (Progressive Split-Mamba (PS-Mamba، وهو إطار عمل هرمي لحالة الفضاء مدرك للطوبولوجيا يعالج قيود التشوه المكاني والاضمحلال بعيد المدى لنماذج (Mamba) القياسية في ترميم الصور من خلال توظيف تقسيم متسق هندسيًا واختصارات متناظرة عبر المقاييس لتحقيق توازن فعال بين الحفاظ على البنية المحلية والتماسك العالمي.

Mohammed Hassanin, Nour Moustafa, Weijian Deng, Ibrahim Radwan2026-03-11
💻 computer science

Point Cloud as a Foreign Language for Multi-modal Large Language Model

تقدم الورقة البحثية SAGE، وهو أول نموذج لغوي كبير متعدد الوسائط من طرف إلى طرف يعامل السحب النقطية الخام كـ "لغة أجنبية" عبر مُجزئ رموز ثلاثي الأبعاد خفيف الوزن وتحسين التفضيل القائم على المحاذاة الدلالية، محققاً أداءً وكفاءة متفوقين على الطرق الحالية القائمة على المشفر في مهام الفهم ثلاثي الأبعاد.

Sneha Paul, Zachary Patterson, Nizar Bouguila2026-03-11
🤖 machine learning

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

يُعد MM-Zero أول إطار عمل قائم على التعلم المعزز يُمكّن نماذج الرؤية واللغة من التطور الذاتي من الصفر دون بيانات عبر توظيف نظام متعدد الأدوار (المقترح، والمبرمج، والمحلل) يتم تدريبه باستخدام تحسين السياسة النسبي للمجموعات لتوليد مفاهيم بصرية، وتجسيدها عبر الكود، وحل مهام الاستدلال متعدد الوسائط دون الحاجة إلى أي صور بذرية.

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zh (…)2026-03-11
💻 computer science

UniField: A Unified Field-Aware MRI Enhancement Framework

تقدم الورقة البحثية UniField، وهو إطار عمل موحد يستفيد من النماذج التأسيسية ثلاثية الأبعاد مسبقة التدريب وآلية تصحيح طيفي مدركة للمجال مبتكرة للتغلب على ندرة البيانات والانحياز الطيفي في تعزيز شدة مجال التصوير بالرنين المغناطيسي، مدعوماً بإصدار مجموعة بيانات ضخمة متعددة المجالات تتفوق بشكل كبير على الأساليب الحالية المتطورة.

Yiyang Lin, Chenhui Wang, Zhihao Peng, Yixuan Yuan2026-03-11
💻 computer science

HelixTrack: Event-Based Tracking and RPM Estimation of Propeller-like Objects

تُعد HelixTrack طريقة تعتمد كلياً على الأحداث، حيث تتبع بشكل مشترك الأجسام الشبيهة بالمراوح وتُقدر عدد دورات في الدقيقة الخاص بها بـتأخير ميكروثانوي عبر إعادة إسقاط الأحداث عكسياً إلى مستوى دوار وتحسين الوضعية من خلال هندسة مقترنة بالطور، وقد تم التحقق من صحتها باستخدام مجموعة بيانات TQE المستحدثة حيث تفوقت على النماذج المرجعية الحالية.

Radim Spetlik, Michal Pliska, Vojtěch Vrba, Jiri Matas2026-03-11
💻 computer science

When Detectors Forget Forensics: Blocking Semantic Shortcuts for Generalizable AI-Generated Image Detection

تقدم هذه الورقة البحثية "الفصل الدلالي الهندسي" (GSD)، وهو وحدة برمجية خالية من المعلمات تعمل على تعزيز قدرة كواشف الصور المولدة بالذكاء الاصطناعي على التعميم من خلال الإزالة الصريحة للمسبقات الدلالية المهيمنة من التمثيلات المتعلمة، مما يجبر النماذج على الاعتماد على الآثار الجنائية القوية بدلاً من الفشل عبر "الارتداد الدلالي" عند مواجهة مسارات توليد غير مرئية.

Chao Shuai, Zhenguang Liu, Shaojing Fan, Bin Gong, Weichen Lian, Xiuli Bi, Zhongjie Ba, Kui Ren2026-03-11
🤖 AI

Multi-model approach for autonomous driving: A comprehensive study on traffic sign-, vehicle- and lane detection and behavioral cloning

تقدم هذه الدراسة نهجاً شاملاً للتعلم العميق متعدد النماذج يدمج الشبكات العصبية مسبقة التدريب والمخصصة مع تقنيات متقدمة لتعزيز البيانات ونقل التعلم لتعزيز قدرات القيادة الذاتية من خلال المعالجة الفعالة لتصنيف علامات المرور، وكشف المركبات والمسارات، واستنساخ السلوك عبر مجموعات بيانات متنوعة.

Kanishkha Jaisankar, Pranav M. Pawar, Diana Susane Joseph, Raja Muthalagu, Mithun Mukherjee2026-03-11
💻 computer science

Multimodal Graph Representation Learning with Dynamic Information Pathways

تقترح هذه الورقة البحثية DiP، وهو إطار عمل جديد لتعلم تمثيل الرسوم البيانية متعدد الوسائط يستخدم عُقداً وهمية خاصة بكل وسيط ومسارات معلومات ديناميكية لتحقيق انتشار رسائل تكيفي، متناثر، وذو تعقيد خطي، متفوقاً باستمرار على النماذج المرجعية الحالية في مهام التنبؤ بالروابط وتصنيف العُقد.

Xiaobin Hong, Mingkai Lin, Xiaoli Wang, Chaoqun Wang, Wenzhong Li2026-03-11