💻 computer science

TrendGen: An Outfit Recommendation and Display System

تقدم هذه الورقة نظام TrendGen، وهو نظام ذكاء اصطناعي تم نشره على منصة تجارة إلكترونية كبرى يعمل على تعزيز تسوق الأزياء عبر الإنترنت من خلال إنشاء توصيات ملابس متجانسة واستخدام الذكاء الاصطناعي التوليدي لتحويل صور الملابس الخام إلى عروض عرض مسطحة (lay-down views) عالية الجودة ومعيارية.

Theodoros Koukopoulos, Dimos Klimenof, Ioannis Xarchakos2026-03-31
💻 computer science

TrackMAE: Video Representation Learning via Track Mask and Predict

تُعد TrackMAE طريقة لتعلم تمثيل الفيديو ذاتي الإشراف، وهي تُحسّن من نمذجة الفيديو المقنعة التقليدية عبر الاستفادة صراحةً من مسارات الحركة المستمدة من متتبعات النقاط لتوجيه الحجب المدرك للحركة وتوفير أهداف حركة تكميلية لإعادة البناء، مما يؤدي إلى أداء فائق في المهام التي تركز على الحركة.

Renaud Vandeghen, Fida Mohammad Thoker, Marc Van Droogenbroeck, Bernard Ghanem2026-03-31
💻 computer science

Dual-Path Learning based on Frequency Structural Decoupling and Regional-Aware Fusion for Low-Light Image Super-Resolution

تقترح هذه الورقة إطار عمل "الفصل ثم الإدراك" (DTP)، وهو نهج جديد يعتمد على التردد لرفع دقة الصور منخفضة الإضاءة، يستخدم الفصل الهيكلي المدرك للتردد، والتمثيل ثنائي المسار الخاص بالدلالات، وإعادة التشكيل الدلالي عبر الترددات لنمذجة السطوع والملمس بشكل مستقل، مما يتفوق بشكل كبير على الأساليب الرائدة الحالية في مقاييس PSNR وSSIM وLPIPS.

Ji-Xuan He, Jia-Cheng Zhao, Feng-Qi Cui, Jinyang Huang, Yang Liu, Sirui Zhao, Meng Li, Zhi Liu2026-03-31
🤖 AI

TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba

يُعد TokenDance إطار عمل لتوليد الرقصات من الموسيقى يتكون من مرحلتين، ويستخدم التجزئة ثنائية الأنماط عبر التكميم القياسي المحدود ومولد "توكن-إلى-توكن" يعتمد على بنية Mamba ثنائية الاتجاه للتغلب على قيود البيانات، محققاً أداءً فائقاً في جودة التوليد، والمحاذاة، وسرعة الاستنتاج.

Ziyue Yang, Kaixing Yang, Xulong Tang2026-03-31
🤖 AI

Improving Automated Wound Assessment Using Joint Boundary Segmentation and Multi-Class Classification Models

تقدم هذه الدراسة نموذجاً للتعلم العميق قائماً على YOLOv11 يقوم في آن واحد بتجزئة حدود الجرح والتصنيف متعدد الفئات عبر خمسة أنواع من الجروح، مما يثبت أن تعزيز البيانات يعزز الأداء بشكل كبير وأن النسخة خفيفة الوزن YOLOv11n توفر حلاً قوياً وفعالاً من حيث الموارد للتقييم السريري وعن بُعد للجروح في الوقت الفعلي.

Mehedi Hasan Tusar, Fateme Fayyazbakhsh, Igor Melnychuk, Ming C. Leu2026-03-31
💻 computer science

EVA: Bridging Performance and Human Alignment in Hard-Attention Vision Models for Image Classification

تقدم الورقة البحثية إطار عمل EVA، وهو إطار انتباه حاد مستوحى من علم الأعصاب يوازن صراحةً بين دقة التصنيف والمحاذاة مع مسارات المسح البصري الشبيهة بالبشر من خلال التحكم في التباين والبوابات التكيفية، محققاً قدرة فائقة على التفسير في مجموعات بيانات مثل CIFAR-10 وCOCO-Search18 دون الحاجة إلى إشراف نظرات العين.

Pengcheng Pan, Yonekura Shogo, Kuniyoshi Yasuo2026-03-31
💬 NLP

Inference-Time Structural Reasoning for Compositional Vision-Language Understanding

تقدم هذه الورقة إطاراً موحداً لتقييم وتعزيز نماذج الرؤية واللغة عبر الاستدلال الهيكلي باستخدام الرسوم البيانية للمشهد، مما يثبت أن نموذج Qwen3-VL-8B-Thinking يتفوق بشكل كبير على البنيات الأخرى في معيار Winoground، لا سيما عند تعزيزه باستراتيجية تصفية الرسوم البيانية للمشهد متعددة الجولات.

Amartya Bhattacharya2026-03-31
⚡ electrical engineering

Guided Lensless Polarization Imaging

تقدم هذه الورقة نظام تصوير استقطابي عديم العدسات موجهًا يجمع بين مستشعر استقطاب-RGB مدمج وكاميرا RGB تقليدية مساعدة ومسار إعادة بناء ثنائي المراحل لتحقيق صور استقطابية متعددة الزوايا عالية الجودة وقابلة للتعميم بتكلفة منخفضة.

Noa Kraicer, Erez Yosef, Raja Giryes2026-03-31
💻 computer science

Falcon Perception

تقدم الورقة البحثية Falcon Perception، وهو نموذج Transformer كثيف موحد يستبدل خطوط معالجة المشفر والمفكك التقليدية المكونة من وحدات متعددة بهندسة دمج مبكر واحدة للتعامل في آن واحد مع الإدراك ونمذجة المهام، مما يظهر أداءً فائقاً في مهام التنبؤ بالقناع والتعرف الضوئي على الحروف (OCR) من خلال التصميم المبسط وإشارات التدريب المتخصصة.

Aviraj Bevli, Sofian Chaybouti, Yasser Dahou, Hakim Hacid, Ngoc Dung Huynh, Phuc H. Le Khac, Sanath Narayan, Wamiq Reyaz (…)2026-03-31
💻 computer science

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

تقدم هذه الورقة KAWHI، وهي آلية لإعادة وزن المكافآت قابلة للتوصيل والتشغيل تسد الفجوة بين التمثيل البصري والتعلم المعزز من المكافآت القابلة للتحقق (RLVR) في النماذج اللغوية البصرية الكبيرة عبر مواءمة الأدلة البصرية المكانية بشكل تكيفي مع خطوات الاستدلال الحاسمة دلاليًا للتغلب على الاختناقات الهيكلية وتعزيز أداء الاستدلال متعدد الوسائط.

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang2026-03-31