💻 computer science

SuperQuadricOcc: Real-Time Self-Supervised Semantic Occupancy Estimation with Superquadric Volume Rendering

يقدم SuperQuadricOcc أول نموذج لتقدير الإشغال الدلالي في الوقت الفعلي والتعلم الذاتي، والذي يستفيد من نماذج السوبركوادريك (superquadric) ومُصيّر حجمي فعال ومبتكر لتحقيق أداء رائد على مجموعة بيانات Occ3D-nuScenes مع تقليل التكاليف الحسابية والذاكرة بشكل كبير.

Seamie Hayes, Alexandre Boulch, Andrei Bursuc, Reenu Mohandas, Ganesh Sistu, Tim Brophy, Ciaran Eising2026-03-16
🤖 AI

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

تتناول هذه الورقة مشكلة النسيان الكارثي في النماذج اللغوية الكبيرة متعددة الوسائط تحت سيناريوهات تغير الواقع من خلال تقديم مجموعة بيانات MSVQA واقتراح إطار عمل UNIFIER، وهو إطار للتعلم المستمر يستخدم توسيع التمثيل البصري وقيد الاتساق البصري لتحقيق تحسينات كبيرة في الأداء في المهام البصرية عبر السيناريوهات المختلفة.

Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li2026-03-16
💻 computer science

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

تقدم هذه الورقة البحثية AVFakeBench، وهو أول معيار شامل للكشف عن تزييف الصوت والفيديو يضم 12 ألف سؤال متنوع عبر سبعة أنواع من التزييف وأربعة مستويات من التوصيف، مما يكشف عن كل من الإمكانات والقيود الحالية لنماذج اللغات الكبيرة للصوت والفيديو في اكتشاف عمليات التلاعب المعقدة في العالم الحقيقي.

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li2026-03-16
💻 computer science

VIGS-SLAM: Visual Inertial Gaussian Splatting SLAM

يُعد VIGS-SLAM نظاماً قوياً للملاحة ورسم الخرائط البصرية والقصورية في الوقت الفعلي، حيث يستفيد من الإشارات البصرية والقصورية المترابطة بشكل وثيق ضمن إطار تحسين موحد لتحقيق إعادة بناء عالية الدقة باستخدام تقنية Gaussian Splatting ثلاثية الأبعاد، متجاوزاً بذلك قيود الطرق البصرية البحتة في الظروف الصعبة مثل ضبابية الحركة وانخفاض الملمس.

Zihan Zhu, Wei Zhang, Moyang Li, Norbert Haala, Marc Pollefeys, Daniel Barath2026-03-16
🤖 AI

SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling

يُعد SpaceControl طريقةً لا تتطلب تدريباً وتعمل أثناء وقت الاختبار، تتيح تحكماً مكانياً بديهياً ودقيقاً في توليد الأصول ثلاثية الأبعاد من خلال قبول مدخلات هندسية متنوعة والتكامل بسلاسة مع النماذج الحالية لتحقيق دقة هندسية فائقة مع الحفاظ على جودة بصرية عالية.

Elisabetta Fedele, Francis Engelmann, Ian Huang, Or Litany, Marc Pollefeys, Leonidas Guibas2026-03-16
💻 computer science

SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing

يقدم SATGround إطار عمل جديداً مدركاً مكانياً يعزز نماذج الرؤية واللغة للاستشعار عن بعد من خلال دمج وحدة تحديد مواقع مخصصة مع رموز تحكم متخصصة، محققاً أداءً هو الأفضل في حالته في تحديد مواقع الأشياء بدقة داخل صور الأقمار الصناعية المعقدة.

Aysim Toker, Andreea-Maria Oncescu, Roy Miles, Ismail Elezi, Jiankang Deng2026-03-16
💻 computer science

Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation

تقترح الورقة البحثية إطار عمل VALOR، وهو إطار عمل مبتكر يخفف من الهلوسة البصرية في توليد التقارير الطبية من خلال الجمع بين الاستدلال النصي المستند إلى المعلومات السريرية والاستدلال البصري ذاتي الإشراف لإنتاج تقارير إشعاعية دقيقة ومستندة إلى أسس دون الحاجة إلى بيانات تفضيل أو ملصقات إضافية.

Sarosij Bose, Ravi K. Rajendran, Biplob Debnath, Konstantinos Karydis, Amit K. Roy-Chowdhury, Srimat Chakradhar2026-03-16
🤖 AI

AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation

يُعد AnatomiX نموذجاً لغوياً كبيراً جديداً متعدد الوسائط يتكون من مرحلتين، يعمل على تعزيز تفسير الأشعة السينية للصدر بشكل كبير من خلال دمج تحديد البنية التشريحية مع المهام اللاحقة، محققاً تحسينات في الأداء تتجاوز 25% في الاستدلال التشريحي والتأسيس مقارنة بالنهج الحالية.

Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert2026-03-16
💻 computer science

Enhancing Novel View Synthesis via Geometry Grounded Set Diffusion

تقدم الورقة البحثية SetDiff، وهو إطار عمل لانتشار المجموعات القائم على الهندسة، والذي يعزز تركيب المشاهد من زوايا رؤية جديدة القائم على تقنية Gaussian Splatting ثلاثية الأبعاد من خلال دمج أولويات ثلاثية الأبعاد صريحة ومزيج مجموعات موحد لتحقيق معالجة قوية للاحتجاب، وتقليل الهلوسة، وتحقيق دقة ضوئية هي الأفضل في مجالها في سيناريوهات القيادة الذاتية.

Farhad G. Zanjani, Hong Cai, Amirhossein Habibian2026-03-16
💻 computer science

AIMC-Spec: A Benchmark Dataset for Automatic Intrapulse Modulation Classification under Variable Noise Conditions

تقدم هذه الورقة AIMC-Spec، وهي مجموعة بيانات اصطناعية شاملة تضم 30 نوعاً من أنواع التعديل عبر مستويات ضجيج متفاوتة لتقييم وتطوير التصنيف التلقائي لتعديل النبضة الواحدة، مع تقييم أداء خمس بنيات للتعلم العميق لإرساء خط أساس قابل لإعادة الإنتاج للأبحاث المستقبلية.

Sebastian L. Cocks, Salvador Dreo, Brian Ng, Feras Dayoub2026-03-16