💻 computer science

Exploring Motion-Language Alignment for Text-driven Motion Generation

تقترح هذه الورقة البحثية إطار عمل MLA-Gen، وهو إطار لتوليد الحركة مدفوع بالنص يدمج الأولويات العالمية مع التكييف المحلي دقيق التفاصيل، ويعالج ظاهرة "مصب الانتباه" (attention sink) المكتشفة حديثاً من خلال مقياس جديد واستراتيجيات تحكم لتحسين جودة الحركة والمواءمة بين النص والحركة بشكل كبير.

Ruxi Gu, Zilei Wang, Wei Wang2026-04-07
💻 computer science

Explicit Time-Frequency Dynamics for Skeleton-Based Gait Recognition

تقدم هذه الورقة البحثية "تدفق ميزات المويجات" (Wavelet Feature Stream) القابل للتشغيل والتركيب، والذي يعزز التعرف على مشية المشي القائمة على الهيكل العظمي من خلال استخراج ديناميكيات الزمن والتردد الصريحة من سرعات المفاصل عبر تحويلات المويجات المستمرة، محققاً أداءً هو الأفضل في حالته على مجموعة بيانات CASIA-B، لا سيما في ظل تغيرات المظهر الصعبة مثل حمل الحقائب أو ارتداء المعاطف.

Seoyeon Ko, Yeojin Song, Egene Chung, Luca Quagliato, Taeyong Lee, Junhyug Noh2026-04-07
💻 computer science

QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection

إن QVAD هو إطار عمل وكيل مركزي قائم على الأسئلة ولا يتطلب تدريباً، يستفيد من الحوار الديناميكي بين نموذج لغوي كبير ونماذج لغوية-بصرية خفيفة الوزن لتحسين الاستعلامات بشكل تكراري، محققاً أداءً رائدًا في كشف الشذوذ في الفيديو بأقل قدر من المعلمات وكفاءة عالية مناسبة للأجهزة الطرفية.

Lokman Bekit, Hamza Karim, Nghia T Nguyen, Yasin Yilmaz2026-04-07
💻 computer science

Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model

تقدم الورقة البحثية MV-VDP، وهي سياسة انتشار فيديو متعددة الرؤى تتنبأ بشكل مشترك بفيديو RGB وخريطة حرارية متعددة الرؤى لنمذجة الديناميكيات المكانية والزمانية ثلاثية الأبعاد بفعالية، مما يتيح تلاعبًا روبوتيًا فعالًا من حيث البيانات، وقويًا، وقابلًا للتعميم باستخدام عشر عروض توضيحية فقط.

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Li (…)2026-04-07
💻 computer science

VOSR: A Vision-Only Generative Model for Image Super-Resolution

تقدم الورقة البحثية VOSR، وهو إطار عمل توليدي يعتمد على الرؤية فقط لرفع دقة الصور، يحقق جودة إدراكية ودقة هيكلية تنافسية بتكاليف تدريب أقل بكثير من الطرق القائمة على تحويل النص إلى صورة، وذلك من خلال الاستفاء من التوجيه الدلالي البصري واستراتيجية توجيه مبتكرة موجهة للترميم دون الاعتماد على التدريب المسبق متعدد الوسائط.

Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Xiangtao Kong, Jixin Zhao, Shihao Wang, Lei Zhang2026-04-07
💻 computer science

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

يُعد CoME-VL إطار عمل رؤية ولغة معياريًا يعمل على رفع مستوى الأداء من خلال دمج مشفرات بصرية تباينية وذاتية الإشراف متكاملة عبر التجميع الموجه بالإنتروبيا والانتباه المتقاطع المعزز بـ RoPE، محققًا بذلك نتائج رائدة في مختلف معايير الفهم والتوطين.

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan2026-04-07
🤖 AI

A reconfigurable smart camera implementation for jet flames characterization based on an optimized segmentation model

تقدم هذه الورقة إطار عمل مبتكر للحوسبة الطرفية في الوقت الفعلي لتوصيف لهب النفاث الصناعي، والذي يستخدم نموذج UNet مُحسَّنًا تم نشره على نظام Ultra96 SoC FPGA، محققاً تقليلاً بمقدار 125 ضعفاً في معاملات النموذج وتحسناً في زمن الاستجابة بمقدار 7.5 ضعفاً للوصول إلى 30 إطاراً في الثانية دون التضحية بدقة التجزئة.

Gerardo Valente Vazquez-Garcia, Carmina Perez Guerrero, Eduardo Garduño, Miguel Gonzalez-Mendoza, Adriana Palacios, Gera (…)2026-04-07
🤖 AI

MoViD: View-Invariant 3D Human Pose Estimation via Motion-View Disentanglement

يُعد MoViD إطار عمل لتقدير وضعية جسم الإنسان ثلاثية الأبعاد غير متأثرة بمنظور الرؤية، حيث يقوم بفصل ميزات الحركة ومنظور الرؤية من خلال مُقدِّر للمنظور وإسقاط متعامد، محققاً دقة فائقة في الأداء مع تقليل متطلبات البيانات وإمكانية الاستنتاج في الوقت الفعلي على الأجهزة الطرفية.

Yejia Liu, Hengle Jiang, Haoxian Liu, Runxi Huang, Xiaomin Ouyang2026-04-07
🤖 AI

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

تحدد هذه الورقة قيودًا جوهرية في النماذج اللغوية الكبيرة متعددة الوسائط فيما يتعلق بفهم الفيزياء الحدسية، وتستعرض مهام اختبار معيارية جديدة لتقييم هذه القدرة، وتقترح نهج مجال المشهد الديناميكي (SDF)، الذي يستفيد من محاكيات الفيزياء لتحسين الأداء والتعميم في الاستدلال الفيزيائي بشكل كبير.

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li2026-04-07
🤖 AI

V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators

يُعد V-Reflection إطار تدريب يحوّل النماذج اللغوية الكبيرة متعددة الوسائط من مجرد مراقبين سلبيين إلى مستجوبين نشطين عبر توظيف آلية "فكر-ثم-انظر" باستخدام استراتيجية تقطير ثنائية المرحلة لربط الاستدلال بالأدلة البصرية، مما يقلل بشكل كبير من الهلوسات المتعلقة بالإدراك مع الحفاظ على كفاءة الاستدلال النهائي من طرف إلى طرف.

Jiazhou Zhou, Yucheng Chen, Hongyang Li, Qing Jiang, Hu Zhou, Ying-Cong Chen, Lei Zhang2026-04-07