💻 computer science

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

تقدم هذه الورقة البحثية UMo، وهي بنية نمذجة حركة موحدة ومتباعدة تستفيد من إطار عمل "خليط الخبراء" المتباعد مكانياً وتصميم متمحور حول الإطارات الرئيسية ومتباعد زمنياً، لتحقيق رسوم متحركة لصور رمزية (أفاتار) متزامنة مع الكلام عالية الدقة وفي الوقت الفعلي مع محاذاة دقيقة بين الصوت والحركة.

Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim (…)2026-05-15
💬 NLP

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

تقدم الورقة البحثية Video2GUI، وهو إطار عمل مؤتمت يقوم بتخليق مجموعة بيانات ضخمة تضم 12 مليون مسار تفاعل مع واجهات المستخدم الرسومية (GUI) من فيديوهات إنترنت غير مصنفة للتغلب على ندرة البيانات وتعزيز أداء تعميم وكلاء واجهات المستخدم الرسومية متعددي الوسائط بشكل كبير.

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian2026-05-15
🤖 machine learning

BioHuman: Learning Biomechanical Human Representations from Video

تقدم هذه الورقة BioHuman، وهو نموذج متكامل (end-to-end) تم تدريبه على مجموعة بيانات BioHuman10M المنشأة حديثاً لاستنتاج تنشيطات العضلات الداخلية وحركة الإنسان مباشرة من فيديو أحادي العدسة، مما يسد الفجوة بين الملاحظات البصرية والحالات الميكانيكية الحيوية لتطبيقات في إعادة التأهيل وتقييم الإصابات.

Yujun Huo, He Zhang, Chentao Song, Honglin Song, Zongyu Zuo, Tao Yu2026-05-15
💬 NLP

Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

تكشف هذه الورقة أن معايير استرجاع الصور المركبة الحالية تبالغ في تقدير قدرات التركيب متعدد الوسائط لأن جزءاً كبيراً من الاستعلامات يمكن حله عبر طرق مختصرة أحادية الوسائط أو أنها صيغت بشكل سيئ، مما يستلزم وجود مجموعة فرعية تم التحقق منها لضمان دمج النماذج فعلياً بين المدخلات الصورية والنصية.

Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo (…)2026-05-15
💻 computer science

Can Visual Mamba Improve AI-Generated Image Detection? An In-Depth Investigation

تقدم هذه الورقة تقييماً منهجياً لنماذج "Vision Mamba" للكشف عن الصور المولدة بواسطة الذكاء الاصطناعي، من خلال مقارنة دقتها وكفاءتها وقدرتها على التعميم مقابل كواشف تعتمد على الشبكات العصبية الالتفافية (CNN)، والمحولات البصرية (ViT)، والنماذج اللغوية البصرية (VLM) المرجعية، وذلك لتوضيح إمكاناتها وحدودها في التمييز بين المحتوى البصري الحقيقي والاصطناعي.

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdelmalik Taleb-Ahmed, Xianxun Zhu, Abdenour Hadid2026-05-15
💻 computer science

SuperADD: Training-free Class-agnostic Anomaly Segmentation -- CVPR 2026 VAND 4.0 Workshop Challenge Industrial Track

تقدم الورقة البحثية SuperADD، وهو مسار لتجزئة الشذوذ غير مرتبط بفئة ولا يتطلب تدريباً، يستفيد من نموذج DINOv3 الأساسي وتقنيات المعالجة المسبقة القوية لتحقيق أداء رائد في مجموعة بيانات MVTec AD 2 تحت تحولات التوزيع الصعبة دون الحاجة إلى ضبط المعلمات الفائقة لكل فئة.

Lukas Roming, Felix Lehnerer, Jonas V. Funk, Andreas Michel, Georg Maier, Thomas Längle, Jürgen Beyerer2026-05-15✓ Author reviewed
💻 computer science

Probing into Camera Control of Video Models

تقترح هذه الورقة طريقة للتحكم في الكاميرا خالية من التدريب لنماذج الانتشار بالفيديو، تعيد صياغة حركة الكاميرا كإرشاد هندسي عبر حقول الإزاحة وإعادة أخذ العينات القابلة للتفاضل، مما يتيح تحكماً فعالاً مع العمل كأداة استقصاء لتحليل ومعايرة القدرات والانحيازات الجوهرية ثلاثية الأبعاد/رباعية الأبعاد للنماذج الأساسية.

Chen Hou, Christian Rupprecht2026-05-15
💻 computer science

The Velocity Deficit: Initial Energy Injection for Flow Matching

تحدد هذه الورقة البحثية "عجز السرعة" في مطابقة التدفق كسبب لتأخر التكامل في الفضاءات عالية الأبعاد، وتقترح مصحح جدول المقياس (SSC) الخالي من التدريب ومطابقة تدفق المقدار الواعي (MAFM) القائم على التدريب لحقن الطاقة الأولية، مما يحسن جودة التوليد وكفاءته بشكل كبير عبر معايير ImageNet وMS-COCO.

Linze Li, Zong-Wei Hong, Shen Zhang, Bo Lin, Jinglun Li, Yao Tang, Jiajun Liang2026-05-15
💻 computer science

HDRFace: Rethinking Face Restoration with High-Dimensional Representation

يعالج HDRFace تحدي استعادة الوجه في ظل التدهورات المعقدة عن طريق حقن تمثيلات غنية دلاليًا وعالية الأبعاد من كل من المدخلات منخفضة الجودة وعمليات الاستعادة الوسيطة في نماذج الانتشار عبر آلية دمج تكيفية جديدة واعية بالبنية والتفاصيل، مما يعزز استعادة الهوية ودقة التفاصيل دون تغيير الهيكل التوليدي الأساسي.

Zirui Wang, Xianhui Lin, Yi Dong, Bo Wei, Gangjian Zhang, Siteng Ma, Zebiao Zheng, Xing Liu, Hong Gu, Minjing Dong2026-05-15
💻 computer science

Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis

تقدم هذه الورقة أول معيار وإطار تقييم لتحرير الصور التجريدي، كاشفةً أن النماذج الحالية تعاني في الموازنة بين القصد والحفاظ على التفاصيل، وموضحةً أن مشفرات النماذج اللغوية الكبيرة المتقدمة والتفكير التكراري ضروريان لسد الفجوة بين التواصل التجريدي البشري والتنفيذ الآلي.

Mor Ventura, Roy Hirsch, Yonatan Bitton, Regev Cohen, Roi Reichart2026-05-15