🤖 AI

Differential Attention-Augmented BiomedCLIP with Asymmetric Focal Optimization for Imbalanced Multi-Label Video Capsule Endoscopy Classification

تقترح هذه الورقة إطار عمل "BiomedCLIP" المعزز بالانتباه التفاضلي، والمُحسّن باستراتيجيات التحسين البؤري غير المتماثل والتنعيم الزمني، لمعالجة عدم التوازن الشديد في الفئات في تصنيف كبسولات الفيديو الطبية متعددة الملصقات، محققةً أداءً تنافسيًا على مجموعة اختبار RARE-VISION مع كفاءة في الاستدلال.

Podakanti Satyajith Chary, Nagarajan Ganapathy2026-03-19
💻 computer science

Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning

تقدم هذه الورقة C-TRAIL، وهي مجموعة بيانات متعددة الوسائط تربط مقاطع فيديو كاميرات السيارات الصينية باللوائح المرورية، وتقترح إطار عمل ثنائي المراحل يجمع بين فهم الفيديو ونظام استدلال قانوني متعدد الوكلاء لتوليد أحكام تلقائية ومفسرة للمسؤولية المرورية.

Jingchun Yang, Jinchang Zhang2026-03-19
💻 computer science

LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition

تُعد LaDe إطار عمل لانتشار كامن موحد يستفيد من موسع مطالبات قائم على نموذج لغوي كبير ومحول مشفر بـ 4D RoPE لإنشاء وسائط رسومية متعددة الطبقات وقابلة للتحرير بالكامل مع أعداد طبقات مرنة، ويدعم مهام إنشاء الطبقات من النص ومهام تفكيك الصور.

Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu2026-03-19
💻 computer science

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

تُعد AHOY طريقة مبتكرة تعيد بناء نماذج ثلاثية الأبعاد كاملة وقابلة للتحريك من نوع "Gaussian" لأفاتار، وذلك من فيديوهات أحادية العدسة في بيئات طبيعية تعاني من حجب شديد، عبر الاستفادة من نماذج الانتشار التي تم ضبطها بدقة لتناسب الهوية لتخيل مناطق الجسم غير المرئية، واستخدام بنية متخصصة لمعالجة التناقضات بين المشاهد المتعددة.

Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll2026-03-19
💻 computer science

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

تقدم هذه الورقة البحثية GMT، وهو إطار عمل محول متعدد الوسائط مشروط بالهدف يقوم بتخليق مسارات تلاعب بالأجسام ذات ست درجات حرية (6-DOF) واقعية وقابلة للتحكم في مشاهد ثلاثية الأبعاد معقدة من خلال الاستفادة المشتركة من الهندسة ثلاثية الأبعاد، والسحب النقطية، والفئات الدلالية، والوضعيات المستهدفة، متفوقاً بذلك على الأساليب الحالية الرائدة في دقة المكان والتحكم في التوجيه.

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang2026-03-19
🤖 machine learning

LoST: Level of Semantics Tokenization for 3D Shapes

تقترح الورقة البحثية طريقة LoST (ترميز مستوى الدلالة)، وهي طريقة مبتكرة ترتب رموز الأشكال ثلاثية الأبعاد حسب البروز الدلالي وتستخدم فقدان محاذاة المسافة البينية العلاقاتية (RIDA) لتحقيق إعادة بناء ذات أداء فائق وتحقيق توليد ذاتي تنبؤي فعال بعدد أقل بكثير من الرموز مقارنة بالنهج القائمة على التسلسل الهرمي الهندسي السابقة.

Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero, Chun-Hao Paul Huang, Duygu Ceylan, Niloy J. Mitra, Xuelin Chen2026-03-19
💻 computer science

The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering

تقدم هذه الورقة إطار عمل خالٍ من التدريب لتحرير الصور المستمر في النماذج التوليدية المشروطة بالنصوص، والذي يحقق تغييرات دلالية سلسة وقابلة للتحكم عبر البناء التلقائي لمطالبات تباينية لاستخلاص ناقلات التوجيه في فضاء تضمين النص، واستخدام بحث النطاق المرن لتحسين مقدار التحرير.

Yigit Ekin, Yossi Gandelsman2026-03-19
💬 NLP

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

يُعد Loc3R-VLM إطار عمل مبتكر يعزز نماذج الرؤية واللغة ثنائية الأبعاد بقدرات فهم ثلاثية الأبعاد قوية من مقاطع الفيديو أحادية العدسة، وذلك عبر الاستفادة من أهداف مشتركة لإعادة بناء المخطط العام ونمذجة الموقف الصريحة، بتوجيه من أولويات وضع الكاميرا خفيفة الوزن لتحقيق أداء رائد في التحديد المكاني القائم على اللغة والاستدلال ثلاثي الأبعاد.

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys2026-03-19
🤖 machine learning

Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

تقدم هذه الورقة تقنية تسجيل الرموز الزماني والمكاني (STTS)، وهي وحدة تدريبية خفيفة الوزن وقابلة للتدريب من الطرف إلى الطرف توحد عملية تقليم رموز الرؤية عبر كل من نماذج ViT ونماذج LLM دون اشتراط النص، محققةً كفاءة بنسبة 62% مع حد أدنى من فقدان الأداء في مهام الرؤية واللغة للفيديو.

Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee2026-03-19
💻 computer science

High-Quality Facial Geometry and Appearance Capture at Home

تقدم هذه الورقة طريقة جديدة وسهلة الاستخدام لالتقاط هندسة ومظهر ثلاثي الأبعاد عالي الجودة وكامل للوجه — بما في ذلك الجلد، والشعر، والعيون، وتجويف الفم — من خلال تسلسل وميض هاتف ذكي واحد في إضاءة خافتة، وذلك باستخدام تمثيل هجين ونماذج إضاءة متقدمة لتحقيق نتائج قابلة لإعادة الإضاءة مناسبة للاستخدام المنزلي اليومي.

Yuxuan Han, Junfeng Lyu, Feng Xu2026-03-18