💻 computer science

HypeVPR: Exploring Hyperbolic Space for Perspective to Equirectangular Visual Place Recognition

يُعد HypeVPR إطار عمل للتمثيل الهرمي يستفيد من الخصائص الجوهرية للفضاء الزائدي لالتقاط العلاقة الهرمية بين المنظور والمنظر متساوي المستعرض بفعالية، مما يتيح التعرف البصري على الأماكن بمتانة مع تحسين سرعة الاسترجاع وتقليل متطلبات التخزين.

Suhan Woo, Seongwon Lee, Jinwoo Jang, Euntai Kim2026-03-06
💻 computer science

Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology

تقدم هذه الورقة TreeBench، وهو معيار تشخيصي لتقييم الاستدلال البصري المرتكز القابل للتتبع، وتقترح TreeVGR، وهو نموذج تدريب قائم على التعلم التعزيزي يعزز أداء النموذج بشكل كبير من خلال الإشراف المشترك على التحديد والاستدلال.

Haochen Wang, Xiangtai Li, Zilong Huang, Anran Wang, Jiacong Wang, Tao Zhang, Jiani Zheng, Sule Bai, Zijian Kang, Jiashi (…)2026-03-06
💻 computer science

Optimizing Multi-Modality Trackers via Significance-Regularized Tuning

تقترح هذه الورقة إطار عمل جديد للضبط الدقيق المنظم بالأهمية يعمل على تحسين أدوات تتبع تعدد الوسائط من خلال الموازنة ديناميكيًا بين أهمية المعلمات من أجل التعميم والقدرة على التكيف، محققًا بذلك أداءً فائقًا عبر مختلف المعايير مقارنة بالأساليب المتطورة.

Zhiwen Chen, Jinjian Wu, Zhiyu Zhu, Yifan Zhang, Guangming Shi, Junhui Hou2026-03-06
💻 computer science

Continuous Space-Time Video Super-Resolution with 3D Fourier Fields

تقدم هذه الورقة البحثية تقنية "الارتقاء بدقة الفيديو في الفضاء المستمر زمانياً ومكانياً" باستخدام "حقول فوريه للفيديو ثلاثية الأبعاد" (VFF)، وهو نهج عصبي مبتكر يقوم بترميز الفيديو كتمثيل مكاني-زماني مستمر لتحقيق حدة مكانية وتماسك زمني وكفاءة حوسبية فائقة مقارنة بالأساليب الحالية.

Alexander Becker, Julius Erbach, Dominik Narnhofer, Konrad Schindler2026-03-06
💻 computer science

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

يُعد VidGuard-R1 كاشفاً مبتكراً للفيديوهات المولدة بالذكاء الاصطناعي، حيث يستفيد من تحسين السياسة النسبية للمجموعات (GRPO) ونماذج مكافأة متخصصة للتغلب على قيود مجموعات البيانات الثابتة، محققاً أداءً رائداً في وضع "الصفر المعرفة" (zero-shot) مع تقديم تفسيرات بشرية قابلة للتفسير ومستندة إلى القواعد الفيزيائية لأحكامه الجنائية.

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu2026-03-06
💻 computer science

True Self-Supervised Novel View Synthesis is Transferable

تقدم هذه الورقة البحثية XFactor، وهو أول نموذج تعلم ذاتي خالي من الهندسة يحقق تركيباً حقيقياً للمناظر من زوايا جديدة عبر فصل وضعية الكاميرا عن محتوى المشهد من خلال مخطط تعزيز مبتكر، مما يتيح إمكانية نقل الوضعية عبر مشاهد ثلاثية الأبعاد مختلفة دون الاعتماد على انحيازات استقرائية هندسية صريحة.

Thomas W. Mitchel, Hyunwoo Ryu, Vincent Sitzmann2026-03-06
💻 computer science

Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator

يُعد VIST3A إطار عمل مبتكر يدمج بسلاسة بين مولدات الفيديو من النص إلى الفيديو مسبقة التدريب وشبكات إعادة البناء ثلاثية الأبعاد ذات التغذية الأمامية من خلال رتق النماذج والضبط الدقيق المباشر للمكافأة، مما يتيح توليد نماذج عالية الجودة من النص إلى ثلاثي الأبعاد ومن النص إلى خريطة النقاط يتفوق على النهج القائم على "Gaussian splat" الحالي.

Hyojun Go, Dominik Narnhofer, Goutam Bhat, Prune Truong, Federico Tombari, Konrad Schindler2026-03-06
💻 computer science

DRBD-Mamba for Robust and Efficient Brain Tumor Segmentation with Analytical Insights

تقدم هذه الورقة البحثية نموذج DRBD-Mamba، وهو نموذج فعال لتجزئة أورام الدماغ ثلاثية الأبعاد يستفيد من بنية "ماما" (Mamba) ثنائية الاتجاه وثنائية الدقة مع منحنيات ملء الفراغ والدمج المبوّب لتحقيق دقة ومتانة فائقتين عبر مختلف تقسيمات بيانات BraTS2023، مع تقليل العبء الحسابي بشكل كبير مقارنة بالطرق الحالية المتطورة.

Danish Ali, Ajmal Mian, Naveed Akhtar, Ghulam Mubashar Hassan2026-03-06
💻 computer science

Pursuing Minimal Sufficiency in Spatial Reasoning

تقدم الورقة البحثية إطار عمل MSSR، وهو إطار عمل ثنائي الوكلاء يعزز القدرة على الاستدلال المكاني للنماذج اللغوية البصرية من خلال التقييم البرمجي لمجموعة كافية دنيا من نتائج الإدراك ثلاثي الأبعاد المستمدة من نماذج خبيرة للتغلب على الاختناقات الناتجة عن عدم كفاية الفهم ثلاثي الأبعاد والمعلومات الزائدة، مما يحقق أداءً هو الأفضل في فئته على الاختبارات المعيارية الصعبة.

Yejie Guo, Yunzhong Hou, Wufei Ma, Meng Tang, Ming-Hsuan Yang2026-03-06
💻 computer science

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

تقدم الورقة البحثية نموذج "Grasp Any Region" (GAR)، وهو نموذج لغوي كبير متعدد الوسائط يستفيد من إعادة تشغيل الميزات المتوافقة مع منطقة الاهتمام (RoI-aligned feature replay) لدمج السياق العالمي من أجل فهم دقيق وتفاعلي على مستوى المنطقة واستدلال تركيبي، محققاً أداءً هو الأفضل في فئته على كل من معايير الصور والفيديو.

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Hua (…)2026-03-06