💻 computer science

S-VGGT: Structure-Aware Subscene Decomposition for Scalable 3D Foundation Models

يُعد S-VGGT نهجاً مبتكراً يعزز قابلية التوسع لنماذج التأسيس ثلاثية الأبعاد ذات التغذية الأمامية، وذلك عبر تفكيك بيانات الالتقاط الكثيفة إلى مشاهد فرعية متوازنة ذات أطر مرجعية مشتركة، مما يؤدي إلى إلغاء تكاليف الانتباه العالمي وتمكين الجمع المتعامد مع طرق تسريع مستوى الرموز لتحقيق سرعات هائلة دون التضحية بدقة إعادة البناء.

Xinze Li, Pengxu Chen, Yiyuan Wang, Weifeng Su, Wentao Cheng2026-03-19
💻 computer science

VectorWorld: Efficient Streaming World Model via Diffusion Flow on Vector Graphs

يُعد VectorWorld نموذج عالم تدفقي فعال يستفيد من مشفر تلقائي متباين (VAE) بوابي مدرك للحركة، وإكمال مقنع بخطوة واحدة خالٍ من الحلول، وسياسة شخصية غير لاعبة متوافقة مع الفيزياء، لتمكين عمليات محاكاة مغلقة الحلقة، مستقرة، وفي الوقت الفعلي، وطويلة الأمد للقيادة الذاتية من خلال معالجة عدم تطابق التهيئة، وقيود زمن الاستجابة، وعدم القابلية للتحقق من الحركية.

Chaokang Jiang, Desen Zhou, Jiuming Liu, Kevin Li Sun2026-03-19
🤖 AI

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

تقدم هذه الورقة FINER، وهو إطار عمل ومعايير مصممة لكشف وتحليل الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط الناتجة عن الاستعلامات السلبية دقيقة التفاصيل، وتقترح FINER-Tuning للتخفيف بشكل كبير من هذه الأخطاء مع تعزيز الأداء العام للنموذج.

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz2026-03-19
💻 computer science

Few-Step Diffusion Sampling Through Instance-Aware Discretizations

تقترح هذه الورقة إطار عمل للتقطيع (discretization) مدركاً للحالات (instance-aware)، يتعلم التكيف مع تخصيصات الخطوات الزمنية بناءً على أولويات تعتمد على المدخلات، مما يتغلب على قيود الجداول الزمنية المشتركة عالمياً ويحسن جودة التوليد باستمرار عبر مختلف نماذج الانتشار (diffusion) ومطابقة التدفق (flow matching) مع تكلفة استدلال مهملة.

Liangyu Yuan, Ruoyu Wang, Tong Zhao, Dingwen Fu, Mingkun Lei, Beier Zhu, Chi Zhang2026-03-19
🤖 AI

WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models

تقدم هذه الورقة WeatherReasonSeg، وهو معيار مرجعي شامل يتكون من مجموعات بيانات اصطناعية وواقعية مع استعلامات متعددة الأبعاد لتقييم وتحليل تدهور قدرات التجزئة الاستدلالية لنماذج الرؤية واللغة تحت ظروف جوية سيئة متنوعة.

Wanjun Du, Zifeng Yuan, Tingting Chen, Fucai Ke, Beibei Lin, Shunli Zhang2026-03-19
💻 computer science

CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image

يُعد CrowdGaussian إطار عمل موحداً يعيد بناء حشود بشرية ثلاثية الأبعاد عالية الدقة وواقعية من صور فردية، وذلك عبر توظيف مسار تكيف ذاتي التوجيه للتعامل مع حالات الاحتجاب الواسعة واستراتيجية تعلم ذاتي المعايرة لتحسين تمثيلات "Gaussian Splatting" ثلاثية الأبعاد لمتعدد الأشخاص.

Yizheng Song, Yiyu Zhuang, Qipeng Xu, Haixiang Wang, Jiahe Zhu, Jing Tian, Siyu Zhu, Hao Zhu2026-03-19
💻 computer science

Steering Video Diffusion Transformers with Massive Activations

تقدم هذه الورقة البحثية "توجيه التنشيط الهيكلي" (STAS)، وهي طريقة لا تتطلب تدريباً تعمل على تعزيز جودة توليد الفيديو والتماسك الزمني في نماذج المحولات الانتشارية (diffusion transformers) من خلال استغلال وتوجيه الهيكل الهرمي المنظم لـ "التنشيطات الضخمة" (Massive Activations) النادرة وعالية المقدار الموجودة عند رموز الإطار الأول والرموز الحدودية.

Xianhang Cheng, Yujian Zheng, Zhenyu Xie, Tingting Liao, Hao Li2026-03-19
💻 computer science

Video Understanding: From Geometry and Semantics to Unified Models

تقدم هذه الدراسة استعراضاً هيكلياً لفهم الفيديو من خلال تنظيم الأدبيات الحالية إلى منظورات الهندسة منخفضة المستوى، والدلالات عالية المستوى، والنمذجة الموحدة، مع تسليط الضوء على تحول المجال نحو النماذج التأسيسية الموحدة والقابلة للتوسع وتحديد التحديات المستقبلية.

Zhaochong An, Zirui Li, Mingqiao Ye, Feng Qiao, Jiaang Li, Zongwei Wu, Vishal Thengane, Chengzu Li, Lei Li, Luc Van Gool (…)2026-03-19
💻 computer science

Revisiting foundation models for cell instance segmentation

تقيم هذه الورقة البحثية بشكل شامل نماذج التأسيس المختلفة لتجزئة مثيلات الخلايا عبر مجموعات بيانات مجهرية متنوعة، وتُقدم استراتيجية جديدة للتوليد التلقائي للمطالبات (APG) تعزز أداء نموذج μ\muSAM بشكل كبير، مما يقدم رؤى رئيسية لتكييف نماذج التجزئة العامة مع مهام المجهر.

Anwai Archit, Constantin Pape2026-03-19
💻 computer science

VISER: Visually-Informed System for Enhanced Robustness in Open-Set Iris Presentation Attack Detection

تقدم هذه الورقة نظام VISER، الذي يثبت أن خرائط الحرارة لتتبع حركة العين منزوعة الضجيج توفر تعميماً فائقاً للكشف عن هجمات عرض قزحية العين مفتوحة المجموعة مقارنة بالتوضيحات اليدوية، وأقنعة التجزئة، وتضمينات DINOv2، مع إطلاق الكود والنماذج أيضاً لدعم قابلية إعادة الإنتاج.

Byron Dowling, Eleanor Frederick, Jacob Piland, Adam Czajka2026-03-19