🤖 machine learning

The Latent Color Subspace: Emergent Order in High-Dimensional Chaos

تقدم هذه الورقة طريقة خالية من التدريب للتحكم الدقيق في الألوان في نموذج توليد الصور FLUX.1 عبر تحديد ومعالجة "فضاء لوني كامن" (Latent Color Subspace) ضمن الفضاء الكامن لـ VAE، والذي يشفر بنيوياً كلاً من التدرج اللوني (Hue)، والتشبع (Saturation)، والسطوع (Lightness).

Mateusz Pach, Jessica Bader, Quentin Bouniot, Serge Belongie, Zeynep Akata2026-03-13
⚡ electrical engineering

Segmentation of Retinal Low-Cost Optical Coherence Tomography Images using Deep Learning

تقدم هذه الورقة إطار عمل للتعلم العميق يستخدم شبكة عصبية تلافيفية (CNN) مدمجة مع مشفر تلقائي تلافي للضجيج تلافي (CDAE) لتقسيم هياكل الشبكية الكلية وانفصالات الظهارة الصبغية بدقة في صور التصوير المقطعي للاتساق البصري (OCT) حديثة ومنخفضة التكلفة ذات المجال الكامل، مما يتيح التشخيص المؤتمت بمساعدة الكمبيوتر للمراقبة المنزلية للتنكس البقعي المرتبط بالعمر.

Timo Kepp, Helge Sudkamp, Claus von der Burchard, Hendrik Schenke, Peter Koch, Gereon Hüttmann, Johann Roider, Mattias P (…)2026-03-12
💻 computer science

In Pursuit of Many: A Review of Modern Multiple Object Tracking Systems

تجمع هذه الدراسة المسحية التطورات الأخيرة في تتبع الكائنات المتعددة (MOT) من خلال تصنيف الأساليب وفقًا لنماذجها الأساسية والتحديات المستهدفة، ومراجعة التطور من التتبع عبر الكشف إلى البنيات الحديثة مثل المحولات (transformers) والنماذج التأسيسية (foundation models)، وتحليل اتجاهات المعايير والمقاييس، ورسم التوجهات المستقبلية للنشر العملي والبحث.

Mk Bashar, Samia Islam, Kashifa Kawaakib Hussain, Md. Bakhtiar Hasan, A. B. M. Ashikur Rahman, Md. Hasanul Kabir2026-03-12
⚡ electrical engineering

Absorption-Based, Passive Range Imaging from Hyperspectral Thermal Measurements

تقدم هذه الورقة طريقة تصوير مدى سلبية تقوم بتقدير مسافة الأجسام والخصائص الجوهرية بشكل مشترك من القياسات الحرارية فائقة الطيف عبر الفصل الحسابي لتأثيرات الامتصاص الجوي عن الإشعاع السطحي، وذلك باستخدام التنظيم والنمذجة الجوية لاستعادة ميزات المدى في المشاهد الطبيعية دون إضاءة نشطة.

Unay Dorken Gallastegi, Hoover Rueda-Chacon, Martin J. Stevens, Vivek K Goyal2026-03-12
💻 computer science

ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval

تقدم هذه الورقة البحثية ChatSearch، وهي مجموعة بيانات جديدة تتميز باستعلامات محادثة متعددة الوسائط ومتعددة الجولات لاسترجاع الصور في النطاق المفتوح، إلى جانب ChatSearcher، وهو نموذج استرجاع توليدي تم تدريبه من البداية إلى النهاية ليعمل بفعالية مع السياق متعدد الوسائط ويستفيد من المعرفة العالمية لتحقيق أداء فائق في البحث التفاعلي عن الصور.

Zijia Zhao, Longteng Guo, Tongtian Yue, Erdong Hu, Shuai Shao, Zehuan Yuan, Hua Huang, Jing Liu2026-03-12
💻 computer science

Sketch-Guided Stylized Landscape Cinemagraph Synthesis

تقدم هذه الورقة البحثية Sketch2Cinemagraph، وهو إطار عمل موجه بالرسوم التخطيطية يستفيد من نماذج الانتشار الكامنة وتقدير حقل الحركة لتخليق سينماغرافات للمناظر الطبيعية ذات طابع فني وجذاب مع تدفق زمني مستمر قابل للتخصيص من رسومات يدوية حرة.

Hao Jin, Hengyuan Chang, Xiaoxuan Xie, Zhengyang Wang, Xusheng Du, Shaojun Hu, Haoran Xie2026-03-12
⚛️ high-energy experiments

Particle Trajectory Representation Learning with Masked Point Modeling

تقدم هذه الورقة PoLAr-MAE، وهو إطار عمل لنمذجة النقاط المقنعة ذاتي الإشراف لبيانات غرف الإسقاط الزمني للأرجون السائل (LArTPC)، والذي يتعلم تمثيلات مسار ذات معنى فيزيائي من الأحداث غير المصنفة، محققاً أداءً رائدًا في التجزئة بأقل قدر من البيانات المصنفة، ومبرهناً على إمكانات نموذج أساسي عالمي في فيزياء الجسيمات.

Sam Young, Yeon-jae Jwa, Kazuhiro Terao2026-03-12
💻 computer science

vS-Graphs: Tightly Coupling Visual SLAM and 3D Scene Graphs Exploiting Hierarchical Scene Understanding

تقدم هذه الورقة البحثية vS-Graphs، وهو إطار عمل للملاحة ورسم الخرائط البصرية المتزامنة (Visual SLAM) في الوقت الفعلي، والذي يربط بشكل وثيق بين فهم المشهد القائم على الرؤية والرسوم البيانية للمشاهد ثلاثية الأبعاد لتوليد خرائط هرمية غنية دلالياً، محققاً تحسناً في الدقة بنسبة 15.22% مقارنة بالطرق الرائدة مع مضاهاة أداء الكشف الدلالي القائم على تقنية ليدار (LiDAR) باستخدام الميزات البصرية فقط.

Ali Tourani, Saad Ejaz, Hriday Bavle, Miguel Fernandez-Cortizas, David Morilla-Cabello, Jose Luis Sanchez-Lopez, Holger (…)2026-03-12
🤖 machine learning

Is CLIP ideal? No. Can we fix it? Yes!

تثبت هذه الورقة أن الفضاء الكامن لنموذج CLIP لا يمكنه أساساً التعامل في آن واحد مع المحتوى الأساسي، وربط الصفات، والعلاقات المكانية، والنفي، وتقترح خرائط التشابه الجيبي الكثيفة (DCSMs) كبديل منهجي يتغلب على هذه القيود الهندسية من خلال الحفاظ على الطوبولوجيا الدلالية لقطع الصور ورموز النصوص لتحقيق أداء متفوق.

Raphi Kang, Yue Song, Georgia Gkioxari, Pietro Perona2026-03-12
🤖 AI

SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models

تقدم هذه الورقة البحثية SCAM، وهي أكبر وأكثر مجموعة بيانات واقعية تنوعاً لصور الهجمات الطباعية (typographic attack images)، لتقييم وإثبات الضعف الكبير لنماذج التأسيس متعددة الوسائط الحديثة تجاه مثل هذه الهجمات، مع تقديم رؤى تجريبية حول كيفية تأثير بنية النموذج وبيانات التدريب على المتانة.

Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe2026-03-12