💻 computer science

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

تقترح هذه الورقة إطار عمل للتسريع يراعي التزامن، يستخدم استراتيجية انتباه متفرقة محمية لتقليل تكاليف الاستدلال العالية لنماذج التوليد السمعي البصري من خلال تفريد التفاعلات المتبادلة بين الوسائط الزائدة بشكل انتقائي مع الحفاظ على الرموز الحرجة والأساسية للحفاظ على التزامن السمعي البصري.

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi2026-08-18
💻 computer science

CrossView: Can Vision-Language Models Reason Across Cameras?

تقدم هذه الورقة البحثية CrossView، وهو معيار جديد للأسئلة والأجوبة في مقاطع الفيديو متعددة الكاميرات مصمم لتقييم قدرة نماذج الرؤية واللغة على التفكير عبر وجهات نظر متنوعة ومتزامنة، مما يكشف أن النماذج الحالية تعاني من التحديات الجوهرية لدمج تعدد المشاهد مقارنة بإعدادات الكاميرا الواحدة.

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali2026-08-18
🤖 AI

Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study

تقدم هذه الورقة البحثية مساراً للتحقق الذاتي للإجابة على الأسئلة في نماذج الفيديو اللغوية الكبيرة (Video-LLM)، والذي يعمل بفعالية على كشف وتصفية الاستشهادات الزمنية المهلوسة عبر استبدال طرق التحقق غير المستقرة أو المتملقة بنموذج استدلال لغوي طبيعي مستقر، محققاً معدل ضبط بنسبة 79% للادعاءات المفبركة مع الحفاظ على الادعاءات الحقيقية.

Yogesh Kumar2026-08-18
🤖 AI

From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

تقترح هذه الورقة إطار عمل خفيف الوزن لدمج السياق يعمل على تخصيص نموذج رؤية ولغة عام للأغراض مجمّد عبر الجمع بين رموز المتخصص الضمنية والأدلة الصريحة القائمة على الاسترجاع، محققاً أداءً فائقاً بأقل عدد من المعلمات القابلة للتدريب مقارنة بطرق التكيف الحالية.

Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang2026-08-18
💻 computer science

PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes

يُعد PoseAdapter إطار عمل خفيف الوزن يحقق توليد صور عالي الدقة وقابل للتحكم للمشاهد المعقدة متعددة الكائنات، وذلك من خلال استخدام تمثيل ثنائي التدفق (2.5D) مع ركائز مكانية-زاوية دقيقة وآلية مدركة للسياق للقضاء على تسرب السمات مع الحفاظ على التماسك العالمي.

Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li2026-08-18
🤖 AI

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

يُعد EgoGazeLite متنبئاً خفيف الوزن لتتبع نظرات العين ثنائي المعالجة يعمل على الأجهزة، مما يتيح فهماً لـفيديوهات منظور الشخص الأول بكفاءة عالية في استخدام الرموز (tokens) للنماذج اللغوية الكبيرة متعددة الوسائط من خلال قص الفيديو بدقة بناءً على النظرة المتوقعة، مما يلغي الحاجة إلى أجهزة مخصصة لتتبع حركة العين مع الحفاظ على جودة الوصف والعمل في الوقت الفعلي على الأجهزة الاستهلاكية.

Matteo Stoiber, Niels Buus Lassen2026-08-18
🤖 AI

Hierarchical Adaptive Feature Refinement Network for VHR Remote Sensing Image Segmentation

تقترح الورقة البحثية شبكة HAFR-Net، وهي شبكة هرمية لتكييف صقل الميزات تعمل على تعزيز تقسيم صور الاستشعار عن بعد عالية الدقة (VHR) من خلال توظيف الاندماج الموجه بالتباين، ومهايئات البقايا الترددية، والبديهيات المدركة للارتباك لصقل التمثيلات الهرمية سابقة التدريب تدريجيًا، مما يحقق أداءً هو الأفضل في فئته عبر معايير متعددة.

Shuaishuai Cao, Meng Tang, Shuwei Peng, Xuan Liu, Min Huang, Jie Chen, Jiacheng Niu, Yong Chen, Edore Akpokodje, Hui Lin2026-08-18
💻 computer science

Scalable Black-Box Model Attribution for Images

تقدم هذه الورقة البحثية طريقة RPA (نسب الرقعة الخام)، وهي طريقة "الصندوق الأسود" خفيفة الوزن والمتينة التي تتفوق على الأساليب المعقدة الموجودة في تحديد نماذج الصور التوليدية، مع تقديم قدرات متعددة الاستخدامات للتجميع غير الخاضع للإشراف والتكيف بلقطات قليلة دون الحاجة إلى إعادة التدريب.

Asaf Livne, Amir Jevnisek, Shai Avidan2026-08-18
💻 computer science

WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

تقدم هذه الورقة WorldRover، وهو محرك بيانات قابل للتوسع مبني على محرك Unreal Engine يقوم بتوليد تسلسلات فيديو اصطناعية طويلة المدى وغنية بالتعليقات التوضيحية لبيئات صممها فنانون، مما يوفر بيانات متزامنة من نوع RGB، والعمق المتري، ومسارات الكاميرا، وبيانات وجهات نظر متنوعة لتدريب النماذج على الاستكشاف وإعادة البناء المتماسك للعالم.

Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge2026-08-18