💻 computer science

SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D

تقدم الورقة البحثية SGR3، وهو إطار عمل لتوليد المخططات المشهدية ثلاثية الأبعاد خالي من التدريب، يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط والتوليد المعزز بالاسترجاع مع آلية تشابه على مستوى الرقعة موزونة لتحقيق أداء تنافسي دون الحاجة إلى إعادة بناء ثلاثية الأبعاد صريحة أو بيانات متعددة الوسائط.

Zirui Wang, Ruiping Liu, Yufan Chen, Junwei Zheng, Weijia Fan, Kunyu Peng, Di Wen, Jiale Wei, Jiaming Zhang, Rainer Stie (…)2026-03-06
💻 computer science

Using Vision + Language Models to Predict Item Difficulty

تُظهر هذه الدراسة أن النهج متعدد الوسائط الذي يجمع بين نماذج الرؤية واللغة (GPT-4.1-nano) لتحليل كل من صور التصورات والسمات النصية يتفوق بشكل كبير على الأساليب أحادية الوسائط في التنبؤ بصعوبة بنود اختبار الثقافة البياناتية للبالغين في الولايات المتحدة، محققاً متوسط خطأ مطلق قدره 0.224.

Samin Khan2026-03-06
🔬 physics

sFRC for assessing hallucinations in medical image restoration

تقترح هذه الورقة sFRC، وهي طريقة مبتكرة تجري تحليل ارتباط الحلقة فوريه (Fourier Ring Correlation) عبر رقع صغيرة للكشف عن الهلوسة في عمليات استعادة الصور الطبية القائمة على التعلم العميق وقياسها بدقة عبر مختلف مشكلات التصوير ناقص العينات.

Prabhat Kc, Rongping Zeng, Nirmal Soni, Aldo Badano2026-03-06
💻 computer science

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

تقدم هذه الورقة PulseFocus، وهو أسلوب استنتاجي لا يتطلب تدريباً يخفف من أنماط الانتباه المنتشرة والانحيازات الموضعية في نماذج الرؤية واللغة (VLMs) الاستدلالية عن طريق هيكلة توليد سلسلة الأفكب (chain-of-thought) إلى كتل تخطيط وتركيز متداخلة، مما يحسن الأداء بشكل كبير في اختبارات القياس متعددة الصور.

Chenjun Li2026-03-06
💻 computer science

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

يُقيّم هذا التعليق للمشهد العام عائلة GPT-5 مقابل GPT-4o، كاشفاً عن تحسينات جوهرية في الاستدلال النصي على مستوى الخبراء والتركيب متعدد الوسائط التي تقترب من الأداء المتطور في مهام مثل تصوير الثدي بالأشعة، مع تسليط الضوء على أن النماذج العامة لا تزال تتخلف عن الأنظمة المتخصصة في المجالات الحرجة للإدراك مثل الأشعة العصبية.

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang2026-03-06
💻 computer science

LAW & ORDER: Adaptive Spatial Weighting for Medical Diffusion and Segmentation

تقدم هذه الورقة البحثية "LAW & ORDER"، وهو إطار عمل ثنائي المهايئ يستخدم التوزين التكيفي القابل للتعلم لاستقرار التوليد الصوري الطبي القائم على الانتشار، والكشف الأمثل للمناطق لتعزيز كفاءة التجزئة، مما يعالج بشكل جماعي عدم التوازن المكاني لتحسين جودة التوليد ودقة التجزئة بشكل كبير مع الحفاظ على بنية نموذج خفيفة الوزن.

Anugunj Naman, Ayushman Singh, Gaibo Zhang, Yaguang Zhang2026-03-06
💻 computer science

Comparative Evaluation of Traditional Methods and Deep Learning for Brain Glioma Imaging. Review Paper

تقيم هذه الورقة المراجعة الأساليب التقليدية وأساليب التعلم العميق لتجزئة وتصنيف الورم الدبقي في الدماغ، وتخلص إلى أن بنيات الشبكات العصبية الالتفافية تتفوق على التقنيات التقليدية في تحليل ما بعد التصوير بالرنين المغناطيسي لتعزيز تخطيط العلاج ونتائج المرضى.

Kiranmayee Janardhan, Vinay Martin DSa Prabhu, T. Christy Bobby2026-03-06
💻 computer science

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

تقدم هذه الورقة MASQuant، وهو إطار عمل جديد للكمّنة ما بعد التدريب للنماذج اللغوية الكبيرة متعددة الوسائط يتغلب على تحديات عدم توافق التنعيم والتباين الحسابي عبر الوسائط من خلال التنعيم المدرك للوسائط والتعويض عبر الوسائط، محققاً أداءً هو الأفضل في فئته عبر البنى ثنائية وثلاثية الوسائط.

Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao2026-03-06
💻 computer science

Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation

تقترح هذه الورقة البحثية "إعادة البناء التبايني للانتشار" (DCR)، وهي طريقة تعمل على حقن إشارات تباينية مستمدة من الصور المعاد بناؤها في عملية الانتشار لحل صراعات التدرج وتحسين القدرات التمييزية والإدراكية للتفاصيل بشكل مشترك، مما يتغلب على قيود المشفر البصري لنموذج CLIP من أجل تمثيل بصري متوازن.

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Xilin Zhao, Qingming Huang2026-03-06
💻 computer science

Revisiting Shape from Polarization in the Era of Vision Foundation Models

تُثبت هذه الورقة أنه من خلال معالجة الفجوات بين المجالات عبر مجموعة بيانات عالية الجودة لأجسام ممسوحة ضوئياً ثلاثية الأبعاد، ومسبقات DINOv3، وتعزيز مدرك للحساسات، يمكن لنموذج خفيف الوزن يعتمد على الاستقطاب وتم تدريبه على مجموعة بيانات صغيرة أن يتفوق بشكل كبير على كل من أساليب "الشكل من الاستقطاب" (Shape from Polarization) الحديثة ونماذج الرؤية التأسيسية واسعة النطاق التي تعتمد على RGB فقط في تقدير المتجهات العمودية للأسطح بلقطة واحدة.

Chenhao Li, Taishi Ono, Takeshi Uemori, Yusuke Moriuchi2026-03-06