💬 NLP

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

تقيم هذه الورقة بشكل منهجي موثوقية نماذج الرؤية واللغة المستخدمة كمقيمين لمهام تحويل الصور إلى نصوص والنصوص إلى صور، كاشفةً عن وجود نقاط عمياء كبيرة لديها — لا سيما في اكتشاف الهلوسة، والأخطاء المكانية، والتناقضات الواقعية — حيث تفشل غالباً في تحديد الاضطرابات المسببة لتدهور الجودة في أكثر من 50% من الحالات.

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra2026-04-24
💻 computer science

Deep kernel video approximation for unsupervised action segmentation

تقترح هذه الورقة طريقة غير خاضعة للإشراف لتجزئة الأفعال، تقوم بتقريب توزيعات إطارات الفيديو عبر فضاء نواة عميق باستخدام النواة المماسية العصبية وتفاوت المتوسط الأقصى لتحقيق أداء تنافسي دون الحاجة إلى مجموعات بيانات ضخمة أو معرفة بعدد الأجزاء.

Silvia L. Pintea, Jouke Dijkstra2026-04-24
💻 computer science

Local Neighborhood Instability in Parametric Projections: Quantitative and Visual Analysis

تقدم هذه الورقة إطاراً كمياً وبصرياً لتقييم الاستقرار المحلي للإسقاطات البارامترية ضد اضطرابات المدخلات، مما يثبت قدرتها على تحديد المناطق غير المستقرة في أجهزة الإسقاط العصبية القائمة على UMAP وt-SNE التي تفشل المقاييس التقليدية في اكتشافها.

Frederik L. Dennig, Daniel A. Keim2026-04-24
💻 computer science

Causal Disentanglement for Full-Reference Image Quality Assessment

تقترح هذه الورقة نموذجاً جديداً لتقييم جودة الصور القائم على المرجع الكامل، والذي يستفيد من فك الارتباط السببي ووحدة القناع لعزل سمات التدهور المتأثرة بالمحتوى، محققاً أداءً تنافسياً في بيئات التعلم الخاضع للإشراف، والتعلم ببيانات قليلة، والتعلم غير الخاضع للإشراف، مع إظهار قدرة فائقة على التعميم عبر النطاقات المختلفة في مجالات الصور غير القياسية المتنوعة.

Zhen Zhang, Jielei Chu, Tian Zhang, Weide Liu, Fengmao Lv, Tianrui Li, Jun Cheng, Yuming Fang2026-04-24
💻 computer science

Encoder-Free Human Motion Understanding via Structured Motion Descriptions

تقدم هذه الورقة "وصف الحركة المهيكل" (SMD)، وهو إطار عمل خالٍ من المشفرات يقوم بتحويل تسلسلات مواضع المفاصل إلى نص لغوي طبيعي حتمي، مما يمكّن النماذج اللغوية الكبيرة من الاستفåادة من معرفتها المتأصلة بالعالم لتحقيق فهم واستدلال متطور لحركة الإنسان دون الحاجة إلى وحدات محاذاة عبر الوسائط.

Yao Zhang, Zhuchenyang Liu, Thomas Ploetz, Yu Xiao2026-04-24
💻 computer science

Sapiens2

تعد Sapiens2 عائلة من نماذج المحولات الرؤيوية عالية الدقة المتمحورة حول الإنسان، والتي تتراوح أحجامها بين 0.4 إلى 5 مليارات معلمة، وتحقق أداءً جديداً هو الأفضل في فئته عبر مهام متنوعة مثل تقدير الوضعية والتقسيم من خلال هدف تدريب مسبق موحد، ومجموعة بيانات منسقة تضم مليار صورة بشرية، وتحسينات معمارية تدعم دقة تصل إلى 4K.

Rawal Khirodkar, He Wen, Julieta Martinez, Yuan Dong, Su Zhaoen, Shunsuke Saito2026-04-24
💻 computer science

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

تقدم هذه الورقة WorldMark، وهي أول مجموعة معايير موحدة وحلبة عبر الإنترنت تتيح مقارنة عادلة ومعيارية لنماذج عوالم الفيديو التفاعلية من خلال توفير مجموعة مشتركة من المشاهد، وتسلسلات الأفعال، ومقاييس التقييم عبر الأنظمة المتنوعة.

Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Kaipeng Zhang, Yongtao Ge2026-04-24
💻 computer science

Bridging the Training-Deployment Gap: Gated Encoding and Multi-Scale Refinement for Efficient Quantization-Aware Image Enhancement

تقترح هذه الورقة نموذجاً فعالاً لتحسين الصور للأجهزة المحمولة يجمع بين بنية هرمية مع ترميز بوابي وتحسين متعدد المقاييس، إلى جانب التدريب الواعي بالكمية، لسد الفجوة بين التدريب والنشر والحفاظ على دقة بصرية عالية في ظل قيود الدقة المنخفضة.

Dat To-Thanh, Nghia Nguyen-Trong, Hoang Vo, Hieu Bui-Minh, Tinh-Anh Nguyen-Nhu2026-04-24
🤖 machine learning

Interpretable facial dynamics as behavioral and perceptual traces of deepfakes

تُظهر هذه الدراسة أن السمات الحيوية-السلوكية القابلة للتفسير لديناميكيات الوجه، ولا سيما تلك المتعلقة بالتعبير العاطفي، تعمل كبصمات سلوكية قابلة للقياس للكشف عن التزييف العميق، وتكشف أنه في حين يتقارب النماذج الحاسوبية والإدراك البشري حول المحتوى العاطفي، إلا أنهما يعتمدان على استراتيجيات كشف مختلفة جوهرياً.

Timothy Joseph Murphy, Jennifer Cook, Hélio Clemente José Cuve2026-04-24
💻 computer science

Reshoot-Anything: A Self-Supervised Model for In-the-Wild Video Reshooting

يقدم هذا البحث Reshoot-Anything، وهو إطار عمل ذاتي الإشراف يتغلب على ندرة البيانات متعددة المشاهد المزدوجة للمشاهد غير الصلبة من خلال توليد ثلاثيات تدريب وهمية من فيديوهات أحادية العدسة لتمكين إعادة تصوير الفيديو بدقة عالية واتساق زمني مع تحكم دقيق في الكاميرا باستخدام محول الانتشار (diffusion transformer).

Avinash Paliwal, Adithya Iyer, Shivin Yadav, Muhammad Ali Afridi, Midhun Harikumar2026-04-24