💻 computer science

Blind Bitstream-corrupted Video Recovery via Metadata-guided Diffusion Model

تقدم هذه الورقة نموذج الانتشار الموجه بالبيانات الوصفية (M-GDM)، وهو نهج مبتكر لاستعادة الفيديو التالف بفعل فساد تدفق البتات الأعمى، والذي يلغي الحاجة إلى أقنعة محددة مسبقًا من خلال الاستفادة من البيانات الوصفية الجوهرية لتحديد التدهور وتوجيه عملية استعادة قائمة على الانتشار.

Shuyun Wang, Hu Zhang, Xin Shen, Dadong Wang, Xin Yu2026-04-16
🤖 machine learning

ASTER: Latent Pseudo-Anomaly Generation for Unsupervised Time-Series Anomaly Detection

إن ASTER هو إطار عمل غير مُراقب للكشف عن الشذوذ في السلاسل الزمنية، يستفيد من نموذج لغوي كبير مُدرب مسبقاً لإثراء التمثيلات الكامنة ومن مُفكك شفرة لتوليد حالات شذوذ زنيفة مخصصة، مما يمكّن مصنفاً قائماً على المحولات (Transformer) من تحقيق أداء رائد في مجاله دون الحاجة إلى خبرة متخصصة في المجال أو بيانات مصنفة.

Romain Hermary, Samet Hicsonmez, Dan Pineau, Abd El Rahman Shabayek, Djamila Aouada2026-04-16
💻 computer science

A Multi-Stage Optimization Pipeline for Bethesda Cell Detection in Pap Smear Cytology

تقدم هذه الورقة الحل الفائز بالمركز الثاني في مسابقة Riva Cytology (المسار B)، حيث تقدم خط معالجة للتحسين متعدد المراحل يجمع بين مجموعة من بنيات YOLO وU-Net مع إزالة التداخل والتصنيف الثنائي لتحقيق درجة mAP50-95 تبلغ 0.5909 في اكتشاف خلايا بيثيسدا في صور لطخة باب (Pap smear).

Martin Amster, Camila María Polotto2026-04-16
💻 computer science

Heuristic Style Transfer for Real-Time, Efficient Weather Attribute Detection

تقدم هذه الورقة بنيات معمارية خفيفة الوزن وزمنية حقيقية (RTM وPMG) تستفيد من تقنيات مستوحاة من الأسلوب مثل مصفوفات غرام (Gram matrices) وPatchGAN للكشف بكفاءة عن الظروف الجوية و11 سمة تكميلية من الصور ذات الألوان الأصلية (RGB)، محققةً دقة عالية وقدرة عالية على التعميم مع إطلاق مجموعة بيانات ضخمة مشروحة.

Hamed Ouattara, Pierre Duthon, Pascal Houssam Salmane, Frédéric Bernardin, Omar Ait Aider2026-04-16
💻 computer science

MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images

يقدم البحث نموذج MApLe، وهو نموذج رؤية-لغة متعدد المهام ومتعدد الحالات، يعمل على تحسين محاذاة التقارير التشخيصية المعقدة مع الصور الطبية الكبيرة من خلال فصل المناطق التشريحية عن النتائج التشخيصية وربط رقع الصور المحلية بجمل نصية محددة.

Felicia Bader, Philipp Seeböck, Anastasia Bartashova, Ulrike Attenberger, Georg Langs2026-04-16
💻 computer science

HiProto: Hierarchical Prototype Learning for Interpretable Object Detection Under Low-quality Conditions

تقترح الورقة البحثية HiProto، وهو إطار عمل لتعلم النماذج الأولية الهرمية يعزز كشف الأشياء القابل للتفسير في ظل ظروف التصوير منخفضة الجودة من خلال إدخال خسائر تباين وتنظيم متخصصة إلى جانب استراتيجية تسمية مستعارة مدركة للمقياس لتحسين التمييز الدلالي دون الاعتماد على تحسين الصور أو البنى المعقدة.

Jianlin Xiang, Linhui Dai, Xue Yang, Chaolei Yang, Yanshan Li2026-04-16
🤖 AI

Reward Design for Physical Reasoning in Vision-Language Models

تقدم هذه الورقة دراسة استئصال منهجية تثبت أن تصميم المكافأة في التدريب القائم على GRPO للنماذج اللغوية البصرية يستحث سلوكيات استدلالية خاصة بمجالات معينة، حيث تحقق المكافآت القائمة على الدقة أقوى المكاسب الإجمالية بينما تعزز مكافآت أوزان الانتباه الجديدة الاستدلال المكاني بشكل كبير دون الحاجة إلى تسميات توضيحية مكانية.

Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana2026-04-16
💻 computer science

Depth-Aware Image and Video Orientation Estimation

تقترح هذه الورقة إطار عمل جديداً ومتيناً لتقدير توجيه الصور والفيديو، يستفيد من توزيع العمق، واتساق تدرج العمق، وتحليل التماثل الأفقي لتحقيق محاذاة دقيقة وتماسك مكاني لتطبيقات مثل الواقع الافتراضي، والواقع المعزز، والملاحة الذاتية.

Muhammad Z. Alam, Larry Stetsiuk, M. Umair Mukati, Zeeshan Kaleem2026-04-16
💻 computer science

Free Geometry: Refining 3D Reconstruction from Longer Versions of Itself

تقدم الورقة البحثية "Free Geometry"، وهو إطار عمل للتعلم الذاتي (self-supervised) يُمكّن نماذج إعادة البناء ثلاثي الأبعاد ذات التغذية الأمامية (feed-forward) من تحسين تنبؤاتها بشكل تكيفي عند الاختبار عبر فرض اتساق الميزات بين المشاهدات الكاملة والجزئية، مما يؤدي إلى تحسين الدقة دون الحاجة إلى بيانات حقيقية ثلاثية الأبعاد (3D ground truth).

Yuhang Dai, Xingyi Yang2026-04-16
💬 NLP

UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding

تقترح الورقة البحثية UI-Zoomer، وهو إطار عمل تكيفي للتقريب لا يتطلب تدريباً يقوم بتفعيل وتغيير حجم قص الصور ديناميكياً بناءً على عدم اليقين في التنبؤ لتحسين دقة تحديد عناصر واجهة المستخدم الرسومية (GUI grounding) بشكل كبير للأيقونات الصغيرة والتخطيطات الكثيفة دون الحاجة إلى تدريب إضافي للنموذج.

Fei Tang, Bofan Chen, Zhengxi Lu, Tongbo Chen, Songqin Nong, Tao Jiang, Wenhao Xu, Weiming Lu, Jun Xiao, Yueting Zhuang (…)2026-04-16