💻 computer science

RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding

تقدم الورقة البحثية RoiMAM، وهو نموذج رؤية-لغة فعال ولا يتطلب تدريباً، يستفيد من توليد منطقة الاهتمام والكبح الدلالي الانتقائي لتحقيق دقة فائقة في مهام MedVQA على معايير SLAKE وPMC-VQA مع تقليل حجم النموذج بنسبة تزيد عن 80% مقارنة بـ MedVInT-TD.

Jiayan Yang, Zhuoyu Wu, Wenqi Fang2026-05-18
💻 computer science

MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays

تقدم الورقة البحثية MI-CXR، وهو معيار جديد مصمم لتقييم قدرات الاستدلال الطولي لنماذج الرؤية واللغة عبر تسلسلات صور الأشعة السينية للصدر متعددة الزيارات، مما يكشف أن النماذج الحالية المتطورة تعاني من ضعف في الاتساق الزمني وتلخيص المسار العالمي رغم تحقيقها دقة متواضلة فقط فوق مستوى التخمين العشوائي.

Sunghwan Steve Cho, Yunseok Han, Jaeyoung Do2026-05-18
⚡ electrical engineering

TVRN: Invertible Neural Networks for Compression-Aware Temporal Video Rescaling

تقترح هذه الورقة البحثية إطار عمل TVRN، وهو شبكة عصبية عكسية شاملة (end-to-end) تجمع بين تحويل موجي زمني متعدد المدخلات والمخرجات مع شبكة بديلة للترميزات ذات الفقد لتحقيق إعادة تحجيم زمني للفيديو متوافق مع الضغط وقوي مع جودة إعادة بناء فائقة باستخدام استراتيجية التعلم من أجل الترتيب.

Xinmin Feng, Li Li, Dong Liu, Feng Wu2026-05-18
💻 computer science

Unsupervised 3D Human Pose Estimation via Conditional Multi-view Ancestral Sampling

تقترح هذه الورقة طريقة أخذ عينات أسلاف متعددة المشاهد مشروطة (cMAS) تستفيد من نماذج الانتشار الحركي ثنائية الأبعاد لتقدير وضعيات الجسم البشرية ثلاثية الأبعاد من مشاهد أحادية، محققةً أداءً فائقاً عبر النطاقات المختلفة في الوضعيات القصوى مقارنة بالأساليب الحالية الرائدة.

Ryohei Goto, Takuya Fujihashi, Shunsuke Saruwatari, Fumio Okura2026-05-18
🤖 AI

See Before You Code: Learning Visual Priors for Spatially Aware Educational Animation Generation

تقدم الورقة البحثية OmniManim، وهو إطار عمل مدرك للتغذية الراجعة لعملية الرندرة (render-feedback-aware) يستفيد من وكيل رؤية (Vision Agent) ذي تخطيط بصري صريح وتحسين مدرك للاستكمال (interpolation-aware optimization) لإنتاج رسوم متحركة تعليمية عالية الجودة ودقيقة مكانياً عبر معالجة العيوب البصرية التي لا يمكن اكتشافها إلا بعد تنفيذ الكود.

Yuejia Li, Ke He, Junheng Li, Shutong Chen, Jingkang Xia, Zhiyue Su, Junchi Zhang, Mang Ye2026-05-18
💻 computer science

Efficient Image Synthesis with Sphere Latent Encoder

تقدم هذه الورقة إطار عمل مفكك يتكون من مشفر صور مسبق التدريب وثابت ونموذج إزالة ضجيج كامن كروي منفصل يلغي الانتقالات غير الفعالة في فضاء البكسل وتضارب الأهداف، مما يحقق جودة توليد وسرعة استدلال فائقتين مقارنة بـ Sphere Encoder وغيره من النماذج المرجعية ذات الخطوات القليلة.

Tung Do, Thuan Hoang Nguyen, Hao Li2026-05-18
🤖 machine learning

CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage

تقدم هذه الورقة CM-EVS، وهي مجموعة بيانات بانورامية متفرقة من نوع RGB-D-pose مشتقة من أصول ثلاثية الأبعاد متنوعة باستخدام خوارزمية COVER الخالية من التدريب، والتي تعمل بكفاءة على تنسيق وجهات نظر متسقة هندسيًا لضمان تغطية كاملة للمشهد مع حد أدنى من التكرار ومصدر قابل للتدقيق للتعلم البصري ثلاثي الأبعاد.

Jiale Liu, Jungang Li, Jieming Yu, Xinglin Yu, Zihao Dongfang, Zongjian Ding, Kaifeng Ding, Yi Yang, Lidong Chen, Yang Z (…)2026-05-18
🤖 AI

Latent Video Prediction Learns Better World Models

تقدم هذه الورقة دراسة منهجية تثبت أن نماذج التنبؤ بالفيديو الكامنة، مثل V-JEPA 2.1، تتفوق على النماذج التقليدية القائمة على إعادة البناء والنماذج الخاضعة للإشراف عبر خمسة محاور للمتانة، مما يثبت أنها مرشحات متفوقة لبناء نماذج عالم متينة.

Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam, James Bailey, Naveed Akhtar2026-05-18
💻 computer science

Learning Disentangled Representations for Generalized Multi-view Clustering

تقترح هذه الورقة البحثية "المشفر التلقائي متعدد الرؤى المعمم" (GMAE)، وهو إطار عمل يستخدم مشفرات تلقائية ثنائية المسار ومميزات تنافسية لتعلم تمثيلات منفصلة، مما يعالج تشابك توزيع الرؤى ويحقق أداءً فائقاً في مهام التجميع متعدد الرؤى، سواء كانت كاملة أو ناقصة، عبر 13 مجموعة بيانات مرجعية.

Xin Zou, Ruimeng Liu, Chang Tang, Zhenglai Li, Xinwang Liu, Kunlun He, Wanqing Li2026-05-18
💻 computer science

ChronoEarth-492K: A Large Scale and Long Horizon Spatiotemporal Hyperspectral Earth Observation Dataset and Benchmark

تقدم هذه الورقة ChronoEarth-492K، وهي أول مجموعة بيانات للتعلم الذاتي فائقة الطيف، واسعة النطاق ومعايرة زمنياً، مستمدة من أرشيف NASA لـ EO-1 Hyperion الممتد لـ 17 عاماً، إلى جانب معيار شامل وبروتوكول تقييم لتعزيز النمذجة المكانية الزمانية طويلة المدى لبيانات مراقبة الأرض.

Haozhe Si, Yuxuan Wan, Yuqing Wang, Minh Do, Han Zhao2026-05-18