💻 computer science

Learning Global Motion with Compact Gaussians for Feed-Forward 4D Reconstruction

إن C4G هو إطار عمل لإعادة البناء رباعي الأبعاد بنظام التغذية الأمامية، يستخدم رموز استعلام غاوسية قابلة للتعلم مشروطة بالطابع الزمني لتحقيق نمذجة حركة متماسكة عالمياً وتوليد مشاهد من زوايا رؤية جديدة عالية الجودة من فيديو أحادي العدسة دون الحاجة إلى تحسين لكل مشهد أو معرفة بوضعيات الكاميرا.

Mungyeom Kim, Minkyeong Jeon, Honggyu An, Jaewoo Jung, Hyuna Ko, Jisang Han, Hyeonseo Yu, Donghwan Shin, Sunghwan Hong (…)2026-06-01
🤖 machine learning

KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems

تقترح الورقة البحثية KLIP، وهو مقياس جديد للكشف عن البيانات خارج التوزيع للمشكلات العكسية يستفيد من تباعد كولباك - ليبلر بين التوزيعات المسبقة للانتشار والتوزيعات اللاحقة لتحديد وتوطين التحولات الطفيفة في التوزيع دون الحاجة إلى بيانات معايرة أو معرفة بالتوزيع المزاح.

Alireza Kheirandish, Jihoon Hong, Sara Fridovich-Keil2026-06-01
💻 computer science

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

تقدم الورقة البحثية SOCO، وهو معيار شامل يحتوي على أكثر من مليون زوج من المراسلات المشروحة عبر 100 فئة وأوصاف لغوية، لتقييم وكشف نقاط القوة والقصور في نماذج الرؤية التأسيسية ونماذج الرؤية واللغة الكبيرة في الفهم الدلالي الهيكلي على مستوى الأجزاء بشكل منهجي.

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski2026-06-01
💻 computer science

Linear Scaling Video VLMs for Long Video Understanding

تقدم الورقة البحثية StateKV، وهي طريقة أثناء الاستدلال تُمكّن نماذج الرؤية واللغة للفيديو مسبقة التدريب من تحقيق عملية ملء مسبق للفيديو بزمن خطي باستخدام حالات متكررة ذات سعة ثابتة، مما يحسن القابلية للتوسع والدقة بشكل كبير مقارنة بالتقريبات المتدفقة الحالية دون الحاجة إلى تغييرات هيكلية أو ضبط دقيق.

Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles2026-06-01
💻 computer science

Representation Forcing for Bottleneck-Free Unified Multimodal Models

تقدم هذه الورقة تقنية "فرض التمثيل" (Representation Forcing - RF)، وهي تقنية تمكن النماذج متعددة الوسائط الموحدة والخالية من الاختناقات من التنبؤ بالتمثيلات المرئية أصلاً كرموز وسيطة لتوجيه الانتشار البكسلي، مما يلغي الحاجة إلى مشفرات التلقائي التبايني (VAEs) الخارجية مع تحقيق أداء رائد في كل من توليد الصور وفهمها.

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang (…)2026-06-01
💻 computer science

Gaga: Group Any Gaussians via 3D-aware Memory Bank

تُعد Gaga إطار عمل مبتكر يعيد بناء وتقسيم المشاهد ثلاثية الأبعاد ذات العالم المفتوح من صور مأخوذة من عينات قليلة عبر الاستفادة من بنك ذاكرة مدرك للثلاثي الأبعاد لربط أقنعة التقسيم ثنائية الأبعاد (zero-shot) باستمرار عبر أوضاع كاميرا متنوعة، متفوقاً بذلك على الأساليب الحالية في المتانة وتعدد الاستخدامات.

Weijie Lyu, Xueting Li, Abhijit Kundu, Yi-Hsuan Tsai, Ming-Hsuan Yang2026-05-29
🤖 machine learning

A Composable Multimodal Framework for cine CMR-Text-Driven Prediction of Heart Failure Outcomes

تقترح هذه الورقة وتقيّم إطار عمل متعدد الوسائط وقابلاً للتركيب يدمج التصوير بالرنين المغناطيسي القلبي السينمائي، والمقاييس السريرية المهيكلة، والسجلات النصية غير المهيكلة لتحقيق دقة فائقة في التنبؤ بنتائج فشل القلب وتحسين خطط العلاج الشخصية.

Jianzhou Chen, Jinyang Sun, Xiumei Wang, Xi Chen, Heyu Chu, Guo Song, Yuji Luo, Xingping Zhou, Rong Gu2026-05-29
💻 computer science

Soften the Mask: Adaptive Temporal Soft Mask for Efficient Dynamic Facial Expression Recognition

تقدم هذه الورقة AdaTosk، وهو مشفر تلقائي زمني ذو قناع ناعم خاضع للإشراف ومبتكر، يعمل على تعزيز كفاءة وأداء التعرف الديناميكي على تعبيرات الوجه من خلال الجمع بين فرع إعادة بناء ذاتي التوجيه وفرع تصنيف يستخدم أقنعة زمنية ناعمة تكيفية لتصفية الدلالات الزائدة وإبراز لحظات التعبير الحرجة.

Meng-zhu Li, Quanxing Zha, Hongjun Wu2026-05-29
💻 computer science

Domain-Agnostic Feature Modulation for Semi-Supervised Domain Generalization

تتناول هذه الورقة البحثية المهمة الصعبة المتمثلة في تعميم النطاق شبه الموجه والمستقل عن تسميات النطاق، وذلك عبر اقتراح استراتيجية تعديل الميزات لإنشاء تمثيلات قوية وثابتة عبر النطاقات، ودالة ديناميكية لتقليص حجم الخسارة للتخفيف من ضجيج النطاق وتحسين دقة التسميات المستعارة، مما يحقق مكاسب كبيرة في الأداء على المعايير الرئيسية دون الاعتماد على تسميات النطاق.

Venuri Amarasinghe (University of Moratuwa), Kalinga Bandara (University of Moratuwa), Isun Randila (University of Morat (…)2026-05-29
🤖 AI

EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance

يُعد EPiC إطار عمل فعال للتحكم في الكاميرا يلغي الحاجة إلى تقدير السحابة النقطية والوضعية المعرضين للخطأ من خلال إنشاء فيديوهات مرجعية دقيقة عبر قناع رؤية الإطار الأول، مما يتيح توليد فيديو موجه بالكاميرا يتسم بالمتانة وخفة المعلمات مع أداء يضاهي أحدث المستويات التقنية.

Zun Wang, Jaemin Cho, Jialu Li, Han Lin, Jaehong Yoon, Yue Zhang, Mohit Bansal2026-05-29