💻 computer science

Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain

تقترح هذه الورقة استراتيجية تدريب تدريجية متعددة المراحل لتطوير نموذج وصف صور متخصص في مجال تكنولوجيا المعلومات والاتصالات بـ 7 مليارات معلمة، والذي يستفيد من البيانات المُخلّقة والموسومة من قبل الخبراء ليتفوق بشكل كبير على النماذج الأكبر والأكثر تطوراً في استخراج النصوص المنطقية من الصور التقنية.

Lianying Chao, Kai Zhang, Haoran Cai, Sijie Wu, Xubin Li, Xin Chen2026-05-08
💻 computer science

LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning

تقدم هذه الورقة "مُنتقي الإطارات القابل للتعلم" (LFS)، وهي طريقة تستفيد من التغذية الراجعة للتعليقات الوصفية من النماذج اللغوية الكبيرة للفيديو (video-LLMs) المجمدة لاختيار إطارات متنوعة زمنياً وذات صلة بالأحداث بشكل ديناميكي لتحسين التعليق الوصفى للفيديو، مع اقتراح أيضاً معيار ICH-CC المتوافق مع البشر لتقييم فهم الفيديو التفصيلي بشكل أفضل.

Lianying Chao, Linfeng Yin, Peiyu Ren, Yifan Jiang, Qiaoyu Ren, Dingcheng Shan, Jing-cheng Pang, Sijie Wu, Xubin Li, Kai (…)2026-05-08
🤖 machine learning

FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models

يُعد FRISM إطار عمل لحقن الاستدلال دقيق الحبيبات يعزز نماذج الرؤية واللغة عبر تفكيك متجهات مهام نماذج الاستدلال الكبيرة بواسطة تحليل القيم المفردة وضبط معاملات قياس الفضاء الجزئي بشكل تكيفي، مما يؤدي بفعالية إلى تحسين قدرات الاستدلال مع الحفاظ على الأداء البصري.

Chenyu Huang, Peng Ye, Xudong Tan, Jinhan Mu, Shenghe Zheng, Li Shen, Tao Chen2026-05-08
🔢 mathematics

SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing

تقدم هذه المساهمة "الاستدلال الإحصائي للعضوية" (SMI)، وهو إطار تدقيق خالٍ من التدريب يتغلب على القيود الجوهرية والأعباء الحسابية لهجمات استدلال العضوية التقليدية، وذلك عبر إعادة صياغة التحقق من نسيان النموذج كمسألة لتقدير نسب خليط غير الأعضاء، مما يتيح تقييماً للأداء أكثر موثوقية وكفاءة مع ضمانات نظرية.

Jialong Sun, Zeming Wei, Jiaxuan Zou, Jiacheng Gong, Jie Fu, Chengyang Dong, Heng Xu, Jialong Li, Bo Liu2026-05-08
⚡ electrical engineering

Mitigating Error Accumulation in Continuous Navigation via Memory-Augmented Kalman Filtering

تقدم هذه الورقة NeuroKalman، وهو إطار عمل معزز بالذاكرة يخفف من تراكم الأخطاء في الملاحة البصرية اللغوية للطائرات بدون طيار عبر إعادة صياغة التنبؤ المتسلسل كمسألة تقدير بايزي تكراري، مما يفصل بفعالية بين التنبؤ القبلي القائم على الحركة وتصحيح الاحتمالية المدفوع بالملاحظة لتنظيم انحراف الحالة.

Yin Tang, Jiawei Ma, Jinrui Zhang, Alex Jinpeng Wang, Deyu Zhang2026-05-08
🤖 AI

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

تقدم هذه الورقة البحثية "Visual Para-Thinker"، وهو أول إطار عمل للتفكير المتوازي للنماذج اللغوية الكبيرة متعددة الوسائط، والذي يتغلب على قيود الاستكشاف في التوسع الرأسي التقليدي من خلال الاستفادة من التقسيم البصري، وPa-Attention، وLPRoPE لتحقيق استيعاب بصري متنوع وفعال.

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan2026-05-08
🤖 machine learning

MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models

تقدم الورقة البحثية إطار عمل MARVL، وهو إطار توجيه متعدد المراحل يعمل على الضبط الدقيق لنماذج الرؤية واللغة من أجل تحقيق الاتساق المكاني والدلالي لتوليد مكافآت كثيفة تلقائياً، مما يحسن بشكل كبير من كفاءة العينات والمتانة في مهام التعلم التعزيزي للروبوتات مقارنة بالطرق الحالية.

Xunlan Zhou, Xuanlin Chen, Shaowei Zhang, ShengHua Wan, Xiaohai Hu, Lei Yuan, De-chuan Zhan2026-05-08
💻 computer science

UniE2F: A Unified Diffusion Framework for Event-to-Frame Reconstruction with Video Foundation Models

يُعد UniE2F إطار عمل انتشار موحداً يستفيد من نماذج الفيديو التأسيسية مسبقة التدريب والتوجيه المتبقي بين الإطارات القائم على الأحداث لإعادة بناء إطارات فيديو عالية الدقة من بيانات أحداث متفرقة، مع تمكين استيفاء إطارات الفيديو والتنبؤ بها بنمط الصفر المعرف (zero-shot) أيضاً.

Gang Xu, Zhiyu Zhu, Junhui Hou2026-05-08
💻 computer science

Seeing What Shouldn't Be There: Counterfactual GANs for Medical Image Attribution

تقترح هذه الورقة طريقة قائمة على شبكات الخصومة التوليدية (GAN) القائمة على التناقض الواقعي لنسب الصور الطبية، والتي تولد حالات تناقض واقعي معقولة لتقديم رؤى قائمة على القياس وتفسيرية ذاتية لقرارات التصنيف، مما يعالج أوجه القصور في تقنيات التصور التمييزية الحالية.

Shakeeb Murtaza2026-05-08
💻 computer science

LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World

تقترح الورقة البحثية إطار عمل LAMP، وهو إطار عمل مبتكر يحقق تتبعًا قويًا لحركة البشر ثلاثية الأبعاد في بيئات الكاميرات المتعددة ذات المنظور الشخصي الديناميكي، وذلك من خلال توحيد عمليات الكشف ثنائية الأبعاد أولاً في إطار عالمي متري ثلاثي الأبعاد باستخدام حركة الجهاز المعروفة، ثم ملاءمة محول مكاني-زماني لهذه السحابة الشعاعية ثلاثية الأبعاد، مما يعمل بفعالية على فصل حركة المراقب عن حركة الهدف للتغلب على تحديات مثل الحركة الذاتية الشديدة والانسدادات.

Nan Yang, Julian Straub, Fan Zhang, Richard Newcombe, Jakob Engel, Lingni Ma2026-05-08