💻 computer science

Mask-aware inference with State-Space Models

تقدم هذه الورقة "Partial Vision Mamba" (PVM)، وهو مكون معماري مبتكر يعمل على تكييف نماذج فضاء الحالة مثل "Mamba" للتعامل مع البيانات غير الصالحة ذات الأشكال التعسفية من خلال عمليات مدركة للقناع، مما يثبت فعاليته عبر مهام إكمال العمق، وترميم الصور، والتصنيف.

Ignasi Mas, Ramon Morros, Javier-Ruiz Hidalgo, Ivan Huerta2026-03-06
💻 computer science

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

تقدم الورقة البحثية PinPoint، وهو معيار مرجعي شامل من العالم الحقيقي لاسترجاع الصور المركبة يتميز بحقائق أرضية متعددة الإجابات، وسلبيات صعبة صريحة، واستعلامات متعددة الصور للكشف عن أوجه القصور الكبيرة في الأساليب الحالية، إلى جانب اقتراح حل لإعادة الترتيب يعتمد على نماذج اللغات الكبيرة متعددة الوسائط (MLLM) بدون تدريب لمعالجة هذه الفجوات.

Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk2026-03-06
💻 computer science

SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D

تقدم الورقة البحثية SGR3، وهو إطار عمل لتوليد المخططات المشهدية ثلاثية الأبعاد خالي من التدريب، يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط والتوليد المعزز بالاسترجاع مع آلية تشابه على مستوى الرقعة موزونة لتحقيق أداء تنافسي دون الحاجة إلى إعادة بناء ثلاثية الأبعاد صريحة أو بيانات متعددة الوسائط.

Zirui Wang, Ruiping Liu, Yufan Chen, Junwei Zheng, Weijia Fan, Kunyu Peng, Di Wen, Jiale Wei, Jiaming Zhang, Rainer Stie (…)2026-03-06
💻 computer science

Using Vision + Language Models to Predict Item Difficulty

تُظهر هذه الدراسة أن النهج متعدد الوسائط الذي يجمع بين نماذج الرؤية واللغة (GPT-4.1-nano) لتحليل كل من صور التصورات والسمات النصية يتفوق بشكل كبير على الأساليب أحادية الوسائط في التنبؤ بصعوبة بنود اختبار الثقافة البياناتية للبالغين في الولايات المتحدة، محققاً متوسط خطأ مطلق قدره 0.224.

Samin Khan2026-03-06
🔬 physics

sFRC for assessing hallucinations in medical image restoration

تقترح هذه الورقة sFRC، وهي طريقة مبتكرة تجري تحليل ارتباط الحلقة فوريه (Fourier Ring Correlation) عبر رقع صغيرة للكشف عن الهلوسة في عمليات استعادة الصور الطبية القائمة على التعلم العميق وقياسها بدقة عبر مختلف مشكلات التصوير ناقص العينات.

Prabhat Kc, Rongping Zeng, Nirmal Soni, Aldo Badano2026-03-06
💻 computer science

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

تقدم هذه الورقة PulseFocus، وهو أسلوب استنتاجي لا يتطلب تدريباً يخفف من أنماط الانتباه المنتشرة والانحيازات الموضعية في نماذج الرؤية واللغة (VLMs) الاستدلالية عن طريق هيكلة توليد سلسلة الأفكب (chain-of-thought) إلى كتل تخطيط وتركيز متداخلة، مما يحسن الأداء بشكل كبير في اختبارات القياس متعددة الصور.

Chenjun Li2026-03-06
💻 computer science

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

يُقيّم هذا التعليق للمشهد العام عائلة GPT-5 مقابل GPT-4o، كاشفاً عن تحسينات جوهرية في الاستدلال النصي على مستوى الخبراء والتركيب متعدد الوسائط التي تقترب من الأداء المتطور في مهام مثل تصوير الثدي بالأشعة، مع تسليط الضوء على أن النماذج العامة لا تزال تتخلف عن الأنظمة المتخصصة في المجالات الحرجة للإدراك مثل الأشعة العصبية.

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang2026-03-06
💻 computer science

LAW & ORDER: Adaptive Spatial Weighting for Medical Diffusion and Segmentation

تقدم هذه الورقة البحثية "LAW & ORDER"، وهو إطار عمل ثنائي المهايئ يستخدم التوزين التكيفي القابل للتعلم لاستقرار التوليد الصوري الطبي القائم على الانتشار، والكشف الأمثل للمناطق لتعزيز كفاءة التجزئة، مما يعالج بشكل جماعي عدم التوازن المكاني لتحسين جودة التوليد ودقة التجزئة بشكل كبير مع الحفاظ على بنية نموذج خفيفة الوزن.

Anugunj Naman, Ayushman Singh, Gaibo Zhang, Yaguang Zhang2026-03-06
💻 computer science

Comparative Evaluation of Traditional Methods and Deep Learning for Brain Glioma Imaging. Review Paper

تقيم هذه الورقة المراجعة الأساليب التقليدية وأساليب التعلم العميق لتجزئة وتصنيف الورم الدبقي في الدماغ، وتخلص إلى أن بنيات الشبكات العصبية الالتفافية تتفوق على التقنيات التقليدية في تحليل ما بعد التصوير بالرنين المغناطيسي لتعزيز تخطيط العلاج ونتائج المرضى.

Kiranmayee Janardhan, Vinay Martin DSa Prabhu, T. Christy Bobby2026-03-06
💻 computer science

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

تقدم هذه الورقة MASQuant، وهو إطار عمل جديد للكمّنة ما بعد التدريب للنماذج اللغوية الكبيرة متعددة الوسائط يتغلب على تحديات عدم توافق التنعيم والتباين الحسابي عبر الوسائط من خلال التنعيم المدرك للوسائط والتعويض عبر الوسائط، محققاً أداءً هو الأفضل في فئته عبر البنى ثنائية وثلاثية الوسائط.

Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao2026-03-06