🤖 AI

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

يقدم ForgeWM إطار تدريب تدريجي يحول مولدات الفيديو ثنائية الاتجاه إلى نماذج عالم فعالة ومنخفضة زمن الاستجابة وقليلة الخطوات، قادرة على محاذاة عناصر التحكم في الألعاب المنفصلة والمستمرة بدقة مع توليد الفيديو، محققاً أداءً هو الأفضل في فئته من حيث الجودة ودقة التحكم من خلال تقنيات مثل تقطير الاتساق السببي وبروتوكول النشر ثنائي المسار مع تحسين وقت إعادة التشغيل.

Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bia (…)2026-08-17
💻 computer science

Discovery and Spatial Characterisation of Multiple Shortcut Groups for Auditing Vision Model Bias

تقدم هذه الورقة طريقة لتجميع خرائط العزو لكل صورة في أنماط اختصار مكانية متكررة باستخدام تقنيات التجميع، مما يتيح تحديد مجموعات فرعية محددة من الصور ذات معدلات خطأ عالية وتطوير تدخلات مستهدفة تقلل من تفاوت الأداء في نماذج الرؤية.

Akshit Achara, Vishnunarayan Manickam, Thomas Day, Esther Puyol Anton, Alexander Hammers, Andrew P. King2026-08-17
💻 computer science

Owner3D: Ownership-Guided Style Writing for Training-Free Localized 3D Stylization

يُعد Owner3D إطار عمل خالٍ من التدريب للنمذجة ثلاثية الأبعاد الموضعية بأسلوب فني، حيث يستفيد من كتابة الأسلوب الموجهة بالملكية والفتحات المزدوجة للحدود لحقن الأساليب المرجعية بدقة داخل المناطق المستهدفة ضمن نماذج إعادة البناء الضخمة، مما يقلل بشكل كبير من تسرب الأسلوب ويحافظ على مظهر المناطق غير المستهدفة دون الحاجة إلى تدريب إضافي.

Suchang Tao, Kaifeng Shi, Zhiyan Liu, Zhuoyuan Jiang, Yuqi Ouyang2026-08-17
🤖 AI

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

تقدم الورقة البحثية AlignFace، وهو مقياس لتشابه الوجوه قابل للتفسير يستفيد من مبادئ علم النفس المعرفي ومجموعة بيانات FACETS المبتكرة للتغلب على قيود النماذج الحالية "الصندوق الأسود" عبر النمذجة الصريحة للتباينات الإدراكية البشرية والاستدلال القائم على السمات من أجل تقييم أكثر دقة وشفافية للمحتوى الوجهي.

Ying Huang, Wencan Zhang, Brian Y. Lim2026-08-17
🤖 AI

SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

يُعد SPARGen إطار عمل توليدي موحد متعدد الوسائط وأصيل يدمج إعادة البناء ثلاثي الأبعاد، والارتباط الكثيف، والاستدلال المكاني في مهام التوليد المشروطة بالتعليمات، مما يتيح أداءً تنافسيًا عبر هذه المهام المكانية غير المتجانسة من خلال تمثيلات مشتركة.

Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo2026-08-17
🤖 AI

Self-Supervised Visual On-Policy Distillation

تقدم الورقة البحثية طريقة التقطير البصري ذاتي الإشراف والمنبثق من السياسة نفسها (S2^2VOPD)، وهي طريقة تولد إشارات تعلم غنية بالمعلومات عبر طرح المعلومات من الطالب عبر تعزيزات قوية بدلاً من إضافة بيانات متميزة إلى المعلم، مما يحقق أداءً رائدًا في المعايير البصرية دقيقة التفاصيل دون الحاجة إلى تسميات توضيحية حقيقية أو نماذج معلم أقوى.

Yijiang Li, Yijun Liang, Yunjie Tian, Bingyang Wang, Ke Zhang, Zhenfei Yin, Di Fu, Philip Torr, Nuno Vasconcelos2026-08-17
💻 computer science

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

يُعد RankT2I إطار عمل مبتكرًا، ولا يتطلب تدريبًا، ومستقلاً عن النموذج، يعمل على أتمتة اكتشاف الدلالات ذات الصلة، والقابلة للتعديل، والمتنوعة لنماذج تحويل النص إلى صورة من خلال الاستفادة من نماذج الرؤية واللغة متعددة الوسائط ونهج التحسين شبه المودولي للقضاء على الحاجة إلى التجربة والخطأ اليدوي.

Ritika Allada, Pinar Yanardag2026-08-17
💻 computer science

Zero-Shot Skeleton-Based Action Anticipation

تقدم هذه الورقة المهمة الجديدة المتمثلة في التنبؤ بالأفعال القائمة على الهياكل العظمية بنمط التعلم الصفري (ZS-SkAA)، وتقترح نموذجاً مرجعياً يعمل على محاذاة سمات الهيكل العظمي الجزئية مع التضمينات الدلالية عبر تعظيم المعلومات المتبادلة للتعرف على الأفعال غير المرئية، وتضع بروتوكول تقييم صارم باستخدام مجموعة بيانات NTU RGB+D.

Hongsong Wang, Pengbo Yan, Yang Zhang, Qiuxia Lai2026-08-17
💻 computer science

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

تقدم هذه الورقة معيار Endo-C6 ونموذج RobustEndoCLIP لإثبات أنه في حين تعاني نماذج الرؤية واللغة الزمنية الجاهزة من انهيار حاد في الأداء تحت تأثير تشوهات الفيديو الخاصة بمنظار البطن، فإن التكيف خفيف الوزن القائم على التعلم بلقطات قليلة يمكن أن يعزز متانتها بشكل كبير دون تغيير الواجهة القائمة على المطالبات.

Darakshan Rashid, Raza Imam, Ufaq Khan, Muhammad Bilal, Shazad Ashraf, Dwarikanath Mahapatra, Mohammad Yaqub, Muhammad H (…)2026-08-17
🤖 AI

GBU-Palm: A Multimodal Video Dataset and Benchmark for Palm Presentation Attack Detection

تقدم هذه الورقة البحثية GBU-Palm، وهي مجموعة بيانات ومعيار للفيديو متعدد الوسائط واسع النطاق يضم 21,326 عينة متزامنة من الأشعة المرئية (RGB) والأشعة تحت الحمراء القريبة (NIR) عبر بيئات متنوعة، وذلك لتقييم وكشف أوجه القصور في طرق الكشف الحالية عن هجمات تقديم كف اليد تحت ظروف البيئات المتقاطعة بشكل منهجي.

Yingjie Ma, Zitong Yu, Wei Jia, Ajay Kumar, Linlin Shen2026-08-17