💻 computer science

A Novel Graph-Regulated Disentangling Mamba Model with Sparse Tokens for Enhanced Tree Species Classification from MODIS Time Series

تقدم هذه الورقة نموذج "GDS-Mamba" (الممبا المتناثر المنفصل المنظم بيانياً)، الذي يدمج السياق الطوبولوجي القائم على الرسوم البيانية، وبنية منفصلة لاستخراج الميزات بشكل مستقل، ورموزاً متناثرة تكيفية لتحقيق تصنيف رائد لأنواع الأشجار من بيانات سلاسل MODIS الزمنية عبر التغلب على التحديات المتعلقة بالتوقيعات الدقيقة واقتران المعلومات.

Motasem Alkayid, Zhengsen Xu, Saeid Taleghanidoozdoozan, Yimin Zhu, Megan Greenwood, Quinn Ledingham, Zack Dewis, Mabel (…)2026-05-08
💻 computer science

An extremely coarse feedback signal is sufficient for learning human-aligned visual representations

تُظهر هذه الدراسة أن تدريب الشبكات العصبية باستخدام إشارات تغذية راجعة خشنة للغاية، مثل التمييز بين ثماني فئات عريضة فقط، كافٍ لتعلم تمثيلات بصرية تتوافق مع نشاط الدماغ البشري والأحكام الإدراكية بشكل وثيق أكثر من النماذج المدربة بأهداف دقيقة أو ذاتية التوجيه.

Yash Mehta, Michael F. Bonner2026-05-08
💻 computer science

Text-to-CAD Retrieval: a Strong Baseline

تقدم هذه الورقة البحثية استرجاع النصوص إلى نماذج التصميم بمساعدة الحاسوب (text-to-CAD) كمهمة جديدة متعددة الوسائط، وتقترح إطاراً موحداً يتعلم تمثيلات غنية (embeddings) متعددة الوسائط من المتواليات الإجرائية والسحب النقطية الهندسية، معززاً بفك تشفير ميزات مبتكر للمحاذاة الضمنية، وذلك لإنشاء خط أساس قوي لاسترجاع نماذج التصميم بمساعدة الحاسوب ذات الصلة دلالياً باستخدام استعلامات اللغة الطبيعية بكفاءة عالية.

Honghu Pan, Zibo Du, Daxiang Liu, Chengliang Liu, Xiaoling Luo2026-05-08
💬 NLP

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

تحدد هذه الورقة البحثية وتعالج "إعادة التشويه" (recorruption)، وهي نمط فشل في نماذج التوليد المعزز بالاسترجاع متعدد الوسائط حيث يتسبب السياق الدقيق في تخلي النماذج عن التنبؤات الصحيحة بسبب العمى البصري والتحيز الموضعي، وذلك عبر اقتراح إطار عمل "تدخل انتباه عنق الزجاجة للاسترداد" (BAIR) الخالي من المعلمات لاستعادة البروز البصري وتحسين موثوقية التشخيص دون الحاجة لإعادة التدريب.

Hoin Jung, Xiaoqian Wang2026-05-08
🤖 machine learning

RAM-H1200: A Unified Evaluation and Dataset on Hand Radiographs for Rheumatoid Arthritis

تقدم الورقة البحثية RAM-H1200، وهي مجموعة بيانات معيارية جديدة واسعة النطاق تضم 1,200 صورة شعاعية لليد مع تعليقات توضيحية متعددة المستويات لتجزئة عظام اليد كاملة، وأقنعة تآكل العظام على مستوى البكسل، وتصنيف SvdH المعياري سريرياً، مما يؤسس لأول إطار موحد لتقييم تحليل التهاب المفاصل الروماتويدي الشامل مع الكشف عن أن الكشف الكمي عن تآكل العظام لا يزال يشكل تحدياً كبيراً مقارنة بالنمذجة التشريحية.

Songxiao Yang, Haolin Wang, Yao Fu, Junmu Peng, Lin Fan, Hongruixuan Chen, Jian Song, Masayuki Ikebe, Shinya Takamaeda-Y (…)2026-05-08
🤖 machine learning

Leveraging Image Generators to Address Training Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping

تقدم هذه الورقة مجموعة بيانات Gen4Regen وإطار عمل يستفيد من نموذج الرؤية واللغة Nano Banana Pro لتوليد أزواج صور وأقنعة متوافقة بكسلياً، مما يثبت أن دمج هذه العينات المولدة بالذكاء الاصطناًعي مع بيانات محدودة من العالم الحقيقي يحسن بشكل كبير أداء التجزئة الدلالية لأنواع تجدد الغابات النادرة وغير الممثلة كفاية.

Gabriel Jeanson, David-Alexandre Duclos, William Larrivée-Hardy, Noé Cochet, Matěj Boxan, Anthony Deschênes, François Po (…)2026-05-08
💻 computer science

Learning a Delighting Prior for Facial Appearance Capture in the Wild

تقترح هذه الورقة مساراً مبتكراً لالتقاط مظهر الوجه في الظروف الطبيعية يستفيد من نموذج مسبق لشبكة إزالة الإضاءة (delighting network) مدرب، معزز بآلية تعديل مجموعات البيانات الكامنة (Dataset Latent Modulation) لتوحيد بيانات التدريب غير المتجانسة، مما يتيح تقدير الانعكاسية بجودة عالية من مقاطع الفيديو العفوية وإنشاء مجموعة بيانات NeRSemble-Scan واسعة النطاق ومفتوحة المصدر.

Yuxuan Han, Xin Ming, Tianxiao Li, Zhuofan Shen, Qixuan Zhang, Lan Xu, Feng Xu2026-05-08
💻 computer science

MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality

تقترح الورقة البحثية إطار عمل MUSE، الذي يحل المفاضلة الجوهرية بين إعادة بناء البكسل والتجريد الدلالي في التوحيد الرمزي البصري من خلال إدخال التعامد الطوبولوجي لفك الارتباط بين التدرجات الهيكلية والدلالية، محققاً بذلك جودة توليد رائدة وتفوقاً على النموذج المعلم في الإدراك الدلالي.

Panqi Yang, Haodong Jing, Jiahao Chao, Tingyan Xiang, Li Lin, Yao Hu, Yang Luo, Yongqiang Ma2026-05-08
🤖 AI

Large Vision-Language Models Get Lost in Attention

تقترح هذه الورقة إطاراً موحداً من منظور المعلومات والمنظور الهندسي للكشف عن أن آليات الانتباه في النماذج اللغوية البصرية الضخمة هي فائضة وظيفياً وغالباً ما يتم تخصيصها بشكل خاطئ، حيث يمكن لاستبدال أوزان الانتباه المتعلمة بقيم محددة مسبقاً أن يؤدي إلى أداء مماثل أو متفوق.

Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang2026-05-08
🤖 AI

CFE-PPAR: Compression-friendly encryption for privacy-preserving action recognition leveraging video transformers

تقترح هذه الورقة البحثية CFE-PPAR، وهي أول طريقة تشفير صديقة للضغط من أجل التعرف على الأفعال مع الحفاظ على الخصوصية، والتي تستخدم محولات فيديو محولة بالمفاتيح للحفاظ على أداء تعرُّف عالٍ وجودة بصرية حتى عندما يتم ضغط الفيديوهات المشفرة.

Haiwei Lin, Shoko Imaizumi, Hitoshi Kiya2026-05-08