💻 computer science

GaINeR: Geometry-Aware Implicit Network Representation

يُعد GAINeR إطار عمل مبتكر يعزز التمثيلات العصبية الضمنية من خلال دمج توزيعات غاوسية قابلة للتدريب لتمكين النمذجة المستمرة للصور ببنية هندسية صريحة، مما يدعم التحرير المحلي المرن، والمحاكاة القائمة على الفيزياء، والرفع ثلاثي الأبعاد الموجه بالعمق، مع تحقيق جودة إعادة بناء هي الأفضل في فئتها.

Weronika Jakubowska, Mikołaj Zieliński, Rafał Tobiasz, Krzysztof Byrski, Maciej Zięba, Dominik Belter, Przemysław Spurek2026-03-26
💻 computer science

FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention

يُعد FlashVGGT محول هندسة بصرية فعال وقابل للتوسع يستبدل التعقيد التربيعي للانتباه الذاتي الكامل بآلية انتباه تقاطعي قائمة على الوصف، مما يتيح إعادة بناء ثلاثية الأبعاد عالية الدقة على تسلسلات صور طويلة مع تقليل وقت الاستدلال بشكل كبير.

Zipeng Wang, Dan Xu2026-03-26
💻 computer science

From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature

تقدم الورقة البحثية Panel2Patch، وهو مسار بيانات واستراتيجية تدريب مسبق مدركة للدرجة (granularity-aware) تستخرج أزواج رؤية-لغة متعددة المستويات وهرمية من الأشكال العلمية الطبية الحيوية للحفاظ على الدلالات المحلية دقيقة التفاصيل، مما يحقق أداءً فائقًا للنموذج باستخدام بيانات تدريب مسبق أقل بكثير مقارنة بالنهج التقليدي القائم على مستوى الشكل الكلي.

Kun Yuan, Min Woo Sun, Zhen Chen, Alejandro Lozano, Xiangteng He, Shi Li, Nassir Navab, Xiaoxiao Sun, Nicolas Padoy, Ser (…)2026-03-26
🤖 machine learning

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

تقدم هذه الورقة البحثية إطار العمل DIG، وهو إطار عمل لا يتطلب تدريباً يعزز فهم الفيديو طويل المدى من خلال التمييز بين الاستعلامات العالمية والمحلية لتطبيق أخذ عينات موحد فعال للأولى واختيار متخصص واعٍ بالاستعلام للثانية، مما يؤدي إلى التفوق على النماذج المرجعية الحالية مع تقليل العبء الحسابي.

Jialuo Li, Bin Li, Jiahao Li, Yan Lu2026-03-26
💻 computer science

AGORA: Adversarial Generation Of Real-time Animatable 3D Gaussian Head Avatars

يُعد NOWA إطار عمل مبتكر يجمع بين تقنية Gaussian Splatting ثلاثية الأبعاد وشبكة خصومة توليدية واستراتيجية تدريب ثنائية المُميز، لإنتاج صور رمزية ثلاثية الأبعاد للرأس قابلة للتحريك وعالية الدقة في الوقت الفعلي، محققاً أداءً رائداً بسرعة رندر تصل إلى 560 إطاراً في الثانية على وحدات معالجة الرسومات و60 إطاراً في الثانية على الأجهزة المحمولة.

Ramazan Fazylov, Sergey Zagoruyko, Aleksandr Parkin, Stamatis Lefkimmiatis, Ivan Laptev2026-03-26
⚡ electrical engineering

EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing

يقدم EditMGT أول إطار عمل لتحرير الصور يعتمد على المحولات التوليدية المقنعة (Masked Generative Transformer)، والذي يستفيد من فك التشفير الموضعي وأخذ عينات الحفاظ على المنطقة لتحقيق تعديلات دقيقة وعالية الجودة وبسرعات استدلال أسرع بكثير مقارنة بنماذج الانتشار، وكل ذلك دون الحاجة إلى معاملات إضافية.

Wei Chow, Linfeng Li, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li (…)2026-03-26
💻 computer science

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

تقدم هذه الورقة البحثية توليد الفيديو المرتكز (AVG)، وهو مسار معياري يفصل بين بناء المشهد والتركيب الزمني باستخدام نموذج لغوي كبير لتحسين المطالبات، ونموذج نص-إلى-صورة لإنشاء إطار مرجعي صحيح دلاليًا، ونموذج فيديو متخصص لتحريك المشهد، مما يحقق أداءً رائدًا في معايير التركيب والزمن مع تقليل خطوات أخذ العينات بشكل كبير.

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi2026-03-26
💻 computer science

Prime and Reach: Synthesising Body Motion for Gaze-Primed Object Reach

تقدم هذه الورقة البحثية مجموعة بيانات جديدة مكونة من 23.7 ألف تسلسل حركة محفزة بنظرات العين، ونموذج انتشار مشروط بالنص يولد حركات كاملة الجسم واقعية، حيث ينجح في التقاط السلوك البشري الطبيعي المتمثل في رصد كائن ما قبل الوصول إليه.

Masashi Hatano, Saptarshi Sinha, Jacob Chalk, Wei-Hong Li, Hideo Saito, Dima Damen2026-03-26
💻 computer science

Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps

تُعد Pro-Pose طريقة مبتكرة تُحوّل الصور الشخصية كاملة الجسم غير المزدوجة والملتقطة في ظروف طبيعية إلى نماذج رمزية (avatters) عالية الدقة وقابلة للتحكم بملابس بسيطة ومعيارية، وذلك عبر الاستفادة من خرائط UV الكنسية والضبط الدقيق متعدد الصور للحفاظ على الهوية مع تمكين إعادة وضعيات الجسم بقوة لتطبيقات لاحقة مثل تجربة الملابس الافتراضية.

Sandeep Mishra, Yasamin Jafarian, Andreas Lugmayr, Yingwei Li, Varsha Ramakrishnan, Srivatsan Varadharajan, Alan C. Bovi (…)2026-03-26
💻 computer science

Understanding Pure Textual Reasoning for Blind Image Quality Assessment

تستقصي هذه الورقة دور الاستدلال النصي في تقييم جودة الصور الأعمى من خلال مقارنة نماذج تسلسل الأفكار، والاتساق الذاتي، والمشفر التلقائي، كاشفةً أنه بينما تعتمد النماذج الحالية بشكل كبير على البيانات المرئية، فإن نهج الاتساق الذاتي يقلص بشكل كبير فجوة الأداء بين التنبؤات القائمة على الصور والتنبؤات القائمة على النصوص فقط.

Yuan Li, Shin'ya Nishida2026-03-26