💻 computer science

Omni Survey for Multimodality Analysis in Visual Object Tracking

تقدم هذه الورقة مسحاً شاملاً لتتبع الأجسام البصرية متعدد الوسائط (MMVOT) يغطي بشكل منهجي وسائط البيانات، وتحديات الجمع، وتصنيف الأساليب بناءً على تكامل فرع RGB والفرع المساعد X، ومعايير التقييم، مع تحليل نقدي لانحيازات مجموعات البيانات والتشكيك في التفوق المتأصل لدمج الوسائط المتعددة على النهج أحادي الوسائط.

Zhangyong Tang, Tianyang Xu, Xuefeng Zhu, Hui Li, Shaochuan Zhao, Tao Zhou, Chunyang Cheng, Xiaojun Wu, Josef Kittler2026-03-18
💻 computer science

A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

تقدم هذه الورقة البحثية CrossHOI-Bench، وهو معيار موحد متعدد الخيارات مصمم للتغلب على قيود طرق تقييم التفاعل بين الإنسان والأشياء (HOI) الحالية، كاشفاً أنه بينما تحقق نماذج الرؤية واللغة الكبيرة أداءً تنافسياً في التعلم الصفري، إلا أنها تفتقر إلى قدرات الاستدلال متعدد الأفعال والتعيين الدقيق للعلاقة بين الشخص والفعل التي تتميز بها طرق الـ HOI المتخصصة.

Qinqian Lei, Bo Wang, Robby T. Tan2026-03-18
⚡ electrical engineering

CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models

يُعد CardioComposer إطار عمل قابلاً للبرمجة عند وقت الاستدلال، يستفيد من الهندسة القابلة للتفاضل والبدائيات الإهليلجية لتمكين التحكم التركيبي المنفصل في الحجم والشكل والموقع للهياكل التشريحية القلبية الوعائية ثلاثية الأبعاد مع الحفاظ على واقعية التوليد.

Karim Kadry, Shoaib Goraya, Ajay Manicka, Abdalla Abdelwahed, Naravich Chutisilp, Farhad Nezami, Elazer Edelman2026-03-18
🔬 optics

Position-Blind Ptychography: Viability of image reconstruction via data-driven variational inference

تتقصى هذه الورقة مدى جدوى حل مشكلة التفتيت الضوئي (ptychography) المعقدة غير المعتمدة على الموقع — حيث يجب استعادة كل من الصورة ومواقع المسح غير المعروفة في آن واحد — من خلال إثبات أن الاستدلال التبايني المقترن بنماذج الانتشار القائمة على الدرجة (score-based diffusion models) يمكن أن يحقق عمليات إعادة بناء صور ثنائية الأبعاد موثوقة حتى في ظل وجود الضجيج، شريطة استخدام هياكل إضاءة مناسبة ونماذج مسبقة قوية.

Simon Welker, Lorenz Kuger, Tim Roith, Berthy Feng, Martin Burger, Timo Gerkmann, Henry Chapman2026-03-18
💻 computer science

VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors

تقدم هذه الورقة VLOD-TTA، وهي طريقة للتكيف في وقت الاختبار ذات عبء حسابي منخفض لكواشف الكائنات القائمة على الرؤية واللغة، تستفيد من تداخل المقترحات الكثيف والمطالبات المشروطة بالصورة للتخفيف بفعالية من تدهور الأداء تحت تأثير تغير التوزيع، متفوقة بذلك على النماذج المرجعية الحالية عبر مجالات متنوعة.

Atif Belal, Heitor R. Medeiros, Marco Pedersoli, Eric Granger2026-03-18
🤖 AI

Representing Beauty: Towards a Participatory but Objective Latent Aesthetics

تجادل هذه الورقة بأن نماذج التعلم العميق تتقارب نحو تمثيلات جمالية متشابهة عبر بيانات تدريب متنوعة، مما يشير إلى أن الجمال يمتلك أساساً واقعياً قائماً على كل من المادة الفيزيائية والثقافية، وهو ما يتيح إمكانية التعاون الإبداعي الهادف بين الإنسان والآلة حيث تقدم الآلات رؤى إبداعية مبتكرة بدلاً من مجرد محاكاة المخرجات البشرية.

Alexander Michael Rusnak2026-03-18
💻 computer science

VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?

تقدم هذه الورقة VideoVerse، وهو معيار شامل مصمم لتقييم قدرات نموذج العالم لنماذج توليد الفيديو من النص عبر تقييم فهمها للسببية الزمنية على مستوى الأحداث والمعرفة بالعالم من خلال مسار تقييم منهجي قائم على الأسئلة والأجوبة ومتوافق مع البشر.

Zeqing Wang, Xinyu Wei, Bairui Li, Zhen Guo, Jinrui Zhang, Hongyang Wei, Keze Wang, Lei Zhang2026-03-18
💻 computer science

LTGS: Long-Term Gaussian Scene Chronology From Sparse View Updates

تقترح هذه الورقة إطار عمل LTGS، وهو إطار عمل مبتكر يستفيد من نماذج غاوس القابلة لإعادة الاستخدام والتحسين بلقطات قليلة لنمذجة التسلسل الزمني للمشاهد ثلاثية الأبعاد طويلة المدى بكفاءة والتعامل مع التغيرات البيئية المتكررة الناتجة عن عمليات الالتقاط العفوية المتفرقة وغير المنظمة.

Minkwan Kim, Seungmin Lee, Junho Kim, Young Min Kim2026-03-18
🔬 physics

Distributional Consistency Loss: Beyond Pointwise Data Terms in Inverse Problems

تقدم هذه الورقة فقدان الاتساق التوزيعي (DC loss)، وهو هدف جديد لسلامة البيانات يستبدل المطابقة النقطية التقليدية بمعايرة على مستوى التوزيع لمنع الإفراط في التخصيص للضجيج وتحسين جودة إعادة البناء في المسائل العكسية غير الخاضعة للإشراف دون الحاجة إلى التوقف المبكر أو بيانات الحقيقة الأرضية.

George Webber, Andrew J. Reader2026-03-18
🤖 AI

MARIS: Marine Open-Vocabulary Instance Segmentation with Geometric Enhancement and Semantic Alignment

تقدم هذه الورقة MARIS، وهو أول معيار واسع النطاق ودقيق لتجزئة الكائنات مفتوحة المفردات تحت الماء، وتقترح إطار عمل موحداً يتميز بوحدة تعزيز الأولوية الهندسية وآلية حقن المحاذاة الدلالية للتغلب على التدهور البصري وعدم المحاذاة الدلالية في البيئات البحرية.

Bingyu Li, Feiyu Wang, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li2026-03-18