💻 computer science

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

تقدم هذه الورقة Skyra، وهو نموذج لغوي كبير متعدد الوسائط متخصص يكتشف ويفسر مقاطع الفيديو المُنشأة بواسطة الذكاء الاصطناعي من خلال تحديد الآثار البصرية التي يمكن للإنسان إدراكها، مدعوماً بمجموعة بيانات ViF-CoT-4K الجديدة، واستراتيجية تدريب ثنائية المرحلة، وتقييم ViF-Bench الشامل.

Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu2026-05-18
🤖 AI

OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL

تقدم هذه الورقة البحثية OmniVL-Guard، وهو إطار عمل موحد للرؤية واللغة يستخدم توليد سلسلة أفكار (CoT) ذاتي التطور وسياسة تحسين قياس المكافأة التكيفية للتغلب على انحياز الصعوبة وتحقيق كشف وتحديد دقيق وقوي للتزييف عبر مختلف أشكال التضليل متعدد الوسائط.

Jinjie Shen, Jing Wu, Yaxiong Wang, Lechao Cheng, Shengeng Tang, Tianrui Hui, Nan Pu, Zhun Zhong2026-05-18
💻 computer science

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding

تقدم هذه الورقة Chain-of-Glimpse، وهو إطار عمل موجه بالبحث يعزز فهم الفيديو من خلال ربط الاستدلال متعدد الخطوات بمناطق كائنات بصرية محددة بشكل تكراري عبر التعلم التعزيزي، مما يحسن الدقة، والقابلية للتفسير، والقدرة على التعميم عبر معايير قياسية متنوعة.

Zhixuan Wu, Quanxing Zha, Teng Wang, Genbao Xu, Wenyuan Gu, Wei Rao, Nan Ma, Bo Cheng, Soujanya Poria2026-05-18
💻 computer science

Vision-Based Safe Human-Robot Collaboration with Uncertainty Guarantees

تقترح هذه الورقة إطار عمل قائمًا على الرؤية للتعاون بين الإنسان والروبوت يضمن السلامة القابلة للتحقق من خلال دمج تقدير عدم اليقين العشوائي وكشف البيانات الخارجة عن التوزيع لتوليد مجموعات تنبؤ متوافقة لحركة الإنسان مع ثقة احتمالية مضمونة.

Jakob Thumm, Marian Frei, Tianle Ni, Matthias Althoff, Marco Pavone2026-05-18
🤖 AI

Probabilistic Dating of Historical Manuscripts via Evidential Deep Regression on Visual Script Features

تقدم هذه الورقة إطاراً للتعلم العميق الاحتمالي يعامل تأريخ المخطوطات التاريخية كمسألة انحدار مستمر، محققاً دقة هي الأفضل في فئتها ومعايرة فائقة لعدم اليقين على معيار DIVA-HisDB من خلال إخراج توزيعات تنبؤية كاملة مع تفكيك عدم اليقين العشوائي والنموذجي في تمريرة أمامية واحدة.

Ranjith Chodavarapu2026-05-18
🤖 machine learning

Mask-Morph Graph U-Net: A Generalisable Mesh-Based Surrogate for Crashworthiness Field Prediction under Large Geometric Variation

تقدم هذه الورقة نموذج Mask-Morph Graph U-Net (MMGUNet)، وهو نموذج بديل مبتكر يعزز القدرة على التعميم وكفاءة البيانات للتنبؤ بمجالات ملاءمة التصادم القائمة على الشبكات (mesh) تحت التغيرات الهندسية الكبيرة، وذلك عن طريق تحويل هرميات الرسوم البيانية الخشنة (coarsened graph hierarchies) إلى الشبكات المدخلة واستخدام التدريب المسبق الخاضع للإشراف المقنع مع الضبط الدقيق كفء المعلمات.

Haoran Li, Tobias Lehrer, Yingxue Zhao, Haosu Zhou, Philipp Stocker, Tobias Pfaff, Nan Li2026-05-18
💻 computer science

ReactiveGWM: Steering NPC in Reactive Game World Models

يُعد ReactiveGWM نموذجاً مبتكراً لعالم الألعاب يعمل على فصل عناصر تحكم اللاعب عن سلوكيات الشخصيات غير القابلة للعب لتخليق عمليات محاكاة ديناميكية وتفاعلية، مما يتيح نقل الاستراتيجيات بنمط "الصفر من التدريب" (zero-shot) واستجابات قابلة للتوجيه للشخصيات غير القابلة للعب عبر ألعاب مختلفة دون الحاجة لإعادة تدريب خاص بكل مجال.

Zeqing Wang, Danze Chen, Zhaohu Xing, Zizhao Tong, Yinhan Zhang, Xingyi Yang, Yeying Jin2026-05-18
💻 computer science

One Pass Is Not Enough: Recursive Latent Refinement for Generative Models

تقدم الورقة البحثية نموذج RTM، وهو نموذج توليدي يستبدل التعيين الكامن أحادي المرور بالصقل المتكرر لإعطاء الأولوية صراحةً لتغطية النمط، مما يحقق دقة واستدعاءً متفوقين إلى جانب درجات FID تنافسية عبر مجموعات بيانات متعددة.

Mehdi Esmaeilzadeh, Alexia Jolicoeur-Martineau, Chirag Vashist, Ke Li2026-05-18
💻 computer science

FFAvatar: Few-Shot, Feed-Forward, and Generalizable Avatar Reconstruction

يعد FFAvatar إطار عمل عاماً وتغذوياً يعيد بناء صور رمزية ثلاثية الأبعاد للرأس بجودة عالية وقابلة للتحريك من صور قليلة غير محددة الوضعية في ثوانٍ معدودة، وذلك عبر دمج بيانات متعددة المشاهد في تمثيل موحد والتنبؤ بمعلمات نموذج FLAME بشكل متكامل من البداية إلى النهاية، محققاً أداءً رائداً في مجاله ونشراً برمجياً في الوقت الفعلي من خلال منهج تدريبي مبتكر يتكون من ثلاث مراحل.

Thuan Hoang Nguyen, Jiahao Luo, Yinyu Nie, Hao Li, Gordon Guocheng Qian, Jian Wang2026-05-18
💻 computer science

COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

يُعد COPRA إطار عمل مبتكرًا يسخر التعلم المعزز لتوليد تحديثات للمعلمات الخاصة بالمدخلات للنماذج الرؤيوية اللغوية المجمدة، مما يحل بفعالية عدم التطابق بين التدريب والاستدلال ويحقق أداءً رائدًا في كشف الشذوذ في الفيديو ومهام فهم الفيديو الأخرى.

Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He2026-05-18