💻 computer science

StreamDAM: Presence-Aware Memory for Real-Time Streaming Video Object Segmentation

يعالج StreamDAM مشكلتي زمن الاستجابة والعمى عن الحضور في متتبعات تقسيم كائنات الفيديو المتطورة في البث المباشر من خلال تقديم مسار ذاكرة مدرك للحضور ومدمج داخل النموذج يعمل على تحسين استخدام الذاكرة وقرارات المخرجات ديناميكيًا لكل إطار، محققًا دقة تقارب دقة المعالجة غير المتزامنة مع تجاوز أداء النموذج الأصلي في المحتوى الصعب.

Xiang Chen2026-08-05
💻 computer science

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

تقدم الورقة البحثية EcoFrame، وهو إطار عمل لا يتطلب تدريباً يعزز فهم الفيديوهات الطويلة بكفاءة من خلال الجدولة التكيفية للأدلة المرئية عبر توسيع الميزانية المعتمد على الإنتروبيا والبحث عن المرشحين الموجه بالانتباه، محققاً توازناً متفوقاً بين الدقة والكفاءة مقارنة بالطرق الاستاتيكية والطرق القائمة على الوكلاء الحالية.

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen2026-08-05
🤖 machine learning

PRISM: Powerful Time Series to Image (TS2I) Representations for Multivariate Anomaly Detection

تقدم الورقة البحثية PRISM، وهو سير عمل ميتا (meta-workflow) يعمل بشكل منهجي على تحويل السلاسل الزمنية متعددة المتغيرات إلى صور متعددة القنوات للكشف عن الشذوذ، مما يثبت أن التمثيلات القائمة على الصور المصممة جيداً مع استراتيجيات التشكيل في قنوات مبتكرة ومشفرات رؤية مدربة مسبقاً يمكن أن تتفوق بشكل كبير على النماذج المرجعية التقليدية في المجال الزمني.

Mateusz Smendowski, Kamil Faber, Piotr Nawrocki, Nathalie Japkowicz, Roberto Corizzo2026-08-05
💻 computer science

UniWorld-Design: From Pixel Generation to Layer-Native Design

تقدم UniWorld-Design إطار عمل مبتكر يعيد تعريف توليد الصور من خلال الانتقال من التخليق المسطح للبكسلات إلى الإنشاء الهيكلي القائم على الطبقات باستخدام طبقات RGBA الدلالية كوحدات ذرية، مما يتيح فهماً أكثر قوة، وتحريراً، وتلاعباً وكيلياً بالمحتوى البصري من خلال نماذجها المتخصصة في تحويل النص إلى RGBA وتحويل الصورة إلى طبقة.

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan (…)2026-08-05
⚡ electrical engineering

Neural Born Series Operator for Biomedical Ultrasound Computed Tomography

تقدم هذه الورقة مشغل سلسلة بورن العصبي (NBSO)، وهو تقنية تعلم عميق مبتكرة تسرع محاكاة الموجات وتتيح إجراء عكس كامل للموجة بكفاءة وفي وقت يقارب الزمن الحقيقي للتصوير المقطعي المحوسب بالموجات فوق الصوتية عالي الدقة، كما تم التحقق من صحته عبر مجموعات بيانات شاملة للدماغ والثدي.

Zhijun Zeng, Yihang Zheng, Youjia Zheng, Yubing Li, Zuoqiang Shi, He Sun2026-08-04
⚡ electrical engineering

GCDance: Genre-Controlled Music-Driven 3D Full Body Dance Generation

يُعد GCDance إطار عمل قائماً على الانتشار (diffusion-based framework) يقوم بتوليد تسلسلات رقص ثلاثية الأبعاد لكامل الجسم ومتحكم في نوعها الموسيقي، وذلك من خلال دمج الموسيقى والمطالبات النصية عبر آلية تحكم مبتكرة واستراتيجية تحسين متعددة المهام، مما يحقق محاذاة فائقة بين تصميم الرقصات والإيقاع والسمات الأسلوبية.

Xinran Liu, Xu Dong, Shenbin Qian, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng2026-08-04
💻 computer science

Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

تقترح هذه الورقة البحثية إطار عمل UTok3D، وهو إطار عمل فعال من حيث المعلمات يتيح إعادة استخدام نماذج CLIP المدربة مسبقاً على ثنائية الأبعاد والمجمدة لفهم السحب النقطية ثلاثية الأبعاد، وذلك عبر تعلم مُرمز (tokenizer) مُطبع بمقياس الرسم يتكيف مع المقاييس الهندسية غير المتجانسة ويستفيد من التقطير عبر الوسائط ذاتي الإشراف من الصور متعددة الزوايا.

Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poi (…)2026-08-04
🤖 AI

Deep Learning for Retinal Degeneration Assessment: A Comprehensive Analysis of the MARIO Challenge

تقدم هذه الورقة تحليلاً شاملاً لتحدي MARIO في مؤتمر MICCAI 2024، حيث تفصل كيف استخدمت 35 فرق بيانات التصوير المقطعي للتماسك البصري (OCT) والبيانات السريرية متعددة الأنماط لتقييم أداء الذكاء الاصطناعي في تشخيص تنكس الشبكية، مما كشف أنه بينما يضاهي الذكاء الاصطناعي دقة الأطباء في اكتشاف تطور التنكس البقعي المرتبط بالسن (AMD)، فإنه لا يزال حالياً يقصر عن التنبؤ بالتطور المستقبلي للمرض.

Rachid Zeghlache, Ikram Brahim, Pierre-Henri Conze, Mathieu Lamard, Mohammed El Amine Lazouni, Zineb Aziza Elaouaber, Le (…)2026-08-04
💻 computer science

MatchPlant: An Open-Source Pipeline for UAV-Based Single-Plant Detection and Data Extraction

تقدم هذه الورقة MatchPlant، وهو مسار معالجة برمجي مفتوح المصدر ومرن بلغة بايثون، يدمج بين معالجة صور الطائرات بدون طيار، والكشف عن الأجسام القائم على التعلم العميق، والإسقاط الجيومكاني، لتمكين الكشف عن النباتات الفردية واستخراج سماتها بدقة وقابلية للتوسع والتكرار من أجل التنميط عالي الإنتاجية.

Worasit Sangjan, Piyush Pandey, Norman B. Best, Jacob D. Washburn2026-08-04
💻 computer science

CDG-MAE: Cross-view Masked Modeling using Diffusion Generated Views

تقدم هذه الورقة البحثية CDG-MAE، وهي طريقة للتعلم الخاضع للإشراف الذاتي تستفيد من مناظر اصطناعية متنوعة ناتجة عن الانتشار (diffusion) من صور ثابتة واستراتيجية قناع متعددة المرتكزات للتغلب على قيود البيانات في الترميز التلقائي المقنع عبر الرؤى، مما يقلص بفعالية فجوة الأداء مع الطرق القائمة على الفيديو مع الحفاظ على كفاءة التدريب القائم على الصور فقط.

Varun Belagali, Pierre Marza, Srikar Yellapragada, Zilinghan Li, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Stergios (…)2026-08-04