💻 computer science

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

تقدم هذه الورقة إطار عمل MVAP-G، وهو إطار عمل مبتكر يولد اضطرابات خصامية متعددة الرؤى متسقة في تمريرة أمامية واحدة لتعطيل محول الهندسة البصرية المرتكز (VGGT) بفعالية دون الحاجة إلى عملية تحسين مكلفة لكل مشهد.

Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan2026-08-24
💻 computer science

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

تقترح الورقة البحثية إطار "التعزيز الوكيل والإصلاح الدلالي" (AESR)، وهو إطار عمل خفيف الوزن يجمع بين وحدة تعزيز الأوامر الوكيلية ووحدة إصلاح الدلالات البصرية المدفوعة بنماذج الرؤية واللغة الكبيرة (VLM) للتغلب على انحراف الهوية وفشل اتباع التعليمات في نماذج تحويل النص إلى فيديو مغلقة المصدر، محققةً المركز الأول في تحدي ACM MM 2026 لتوليد الفيديو مع الحفاظ على الهوية.

Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu2026-08-24
🤖 AI

CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models

تقدم هذه الورقة CARD، وهي طريقة تشخيصية تكشف عن فشل نماذج الرؤية واللغة في توجيه تمثيلات المعتقدات الداخلية بفعالية إلى تنبؤات أفعالها، وهو قصور تم تحديده من خلال معيار عالم الشبكة التعاوني الجديد المسمى Relay Chain.

Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling2026-08-24
💻 computer science

M2Depth: Unifying Monocular Depth Foundation Priors with Multi-View Stereo

تقترح الورقة البحثية M2Depth، وهو إطار عمل مبتكر يوحد بين الأوليات التأسيسية للعمق أحادي العدسة وبين الرؤية المجسمة متعددة المناظر من خلال استراتيجية صقل متبادل ثنائية الاتجاه وتحسين حجم التكلفة الموجه بالأوليات، محققاً تفوقاً في اكتمال خرائط العمق، والتعميم، والدقة عبر كل من إعدادات المشاهد الكثيفة والمتفرقة.

Byeonggwon Lee, Sanggi Lee, Siwoo Lee, Khang Truong Giang, Soohwan Song2026-08-24
💻 computer science

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

تقترح هذه الورقة طريقة "الإشراف من المقطع إلى الفيديو" (S2V)، وهي طريقة تدريب فعالة تولد أزواجاً من الأسئلة والأجوبة دقيقة التفاصيل من مقاطع فيديو محددة مكانياً لتعزيز فهم الفيديوهات الطويلة في النماذج اللغوية الكبيرة متعددة الوسائط، محققةً دقة وكفاءة متفوقتين مقارنة بالنهج القائمة على الاستنتاج الحالية مع تجنب التكاليف العالية وزمن الاستجابة الطويل لأطر الضبط الدقيق المعقدة القائمة على التعزيز.

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren2026-08-24
💻 computer science

KoViDoRe: Korean Visual Document Retrieval

تقدم هذه الورقة KoViDoRe، وهو معيار شامل ومجموعة بيانات تدريبية مصاحبة صُممت لمعالجة نقص الموارد لاسترجاع المستندات المرئية الكورية من خلال تقييم وتحسين النماذج متعددة الوسائط على مستندات معقدة متعددة الصفحات ذات تخطيطات متنوعة.

Yongbin Choi, Yongwoo Song, Mujeen Sung2026-08-24
💻 computer science

Multi-Modal Traffic Sign Detection with Semantic Attributes for Autonomous Driving

تقدم هذه الورقة إطار عمل قوي ومتعدد المناطق للكشف عن علامات المرور للقيادة الذاتية، يدمج بيانات ليدار (LiDAR) والكاميرا عبر وحدة دمج مرنة مدركة للشدة ونموذج تتبع ثنائي الحركة للتغلب على تحديات التعميم عبر المناطق، والكشف عن الأجسام الصغيرة بعيدة المدى، والتشوه المنظوري غير الخطي، محققاً نسبة فقدان أجسام بلغت 0.49% عبر مجموعة بيانات عالمية تشمل أكثر من 60 دولة.

Meda Lazar, Sourab Sridhar, Shashwata Gupta, Alexandra Tripcea, Varun Ravi, Senthil Yogamani2026-08-24
💻 computer science

InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter

تقدم الورقة البحثية InfinityEdit، وهو مُكيِّف خفيف الوزن لمولدات الفيديو مسبقة التدريب يتيح تحريراً غير محدود ومبنياً على التعليمات للفيديو المتدفق من خلال ضمان الاستمرارية الزمنية الوفية واستقرار جودة التوليد عبر تسلسل لانهائي من طلبات التحرير.

Yunze Tong, Mushui Liu, Canyu Zhao, Shiyi Zhang, Didi Zhu, Peng Zhang, Wanggui He, Jinlong Liu, Ying Chen, Hao Jiang, Pi (…)2026-08-24
🤖 AI

Explainable Deepfake Detection with Feature-robust Augmentation and Evidence-grounded Explanation Optimization

تقترح هذه الورقة إطار عمل مبتكر للكشف القابل للتفسير عن التزييف العميق يجمع بين التعزيز القوي للميزات والتعلم التبايني الخاضع للإشراف لتعزيز المرونة ضد تدهور الصور، ويستخدم تحسين التفضيل القائم على الأدلة لتوليد تفسيرات دقيقة واقعياً، محققاً المركز الأول في تحدي ACM Multimedia 2026 للكشف عن التزييف العميق القابل للتفسير.

Zhu Xu, Jiaqi Tang, Pokai Chen, Yuxin Peng, Yang Liu2026-08-24
💻 computer science

OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

يُعد OccluRank إطار عمل بسيطاً وقابلاً للتحكم لتوليد الصور من التخطيطات، حيث يحقق تركيباً دقيقاً واعياً بالاحتجاب عبر تعزيز المربعات المحيطة برتبة ترتيبية واحدة واستخدام وحدة تفاعل مثيل مدركة للترتيب، مما يلغي الحاجة إلى شروط هندسية معقدة أو إجراءات استدلال متخصصة.

Wenyang Hong, Yuan Wang, Yanbin Hao, Lanqing Xue, Ke Wang, Xiang Wang, Kuien Liu, Richang Hong2026-08-24