💻 computer science

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

تقدم هذه الورقة البحثية "Flat-Pack Bench"، وهو معيار مرجعي جديد مصمم لتقييم قدرات الاستدلال المكاني-الزماني الدقيقة للنماذج اللغوية البصرية الكبيرة من خلال مهام تجميع الأثاث، مما يكشف أن النماذج الحالية الرائدة تواجه صعوبة كبيرة في الترتيب الزمني، وتحديد الحالة، وتزاوج الأجزاء، والتتبع.

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath H (…)2026-05-22
💬 NLP

BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

تقدم الورقة البحثية BEiTScore، وهو مقياس لتقييم وصف الصور لا يعتمد على مرجع، يستفيد من نموذج مشفر متقاطع خفيف الوزن تم تدريبه باستخدام بيانات معززة بنماذج لغوية كبيرة تنافسية لتحقيق أداء رائد في الحساسية والتعميم التركيبي مع الحفاظ على الكفاءة الحسابية.

Gonçalo Gomes, Bruno Martins, Chrysoula Zerva2026-05-22
💻 computer science

SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching

يقدم هذا البحث SceneGraphGrounder، وهو إطار عمل لربط المشاهد ثلاثية الأبعاد بصرياً بنمط "الصفر من التدريب" (zero-shot)، يستفيد من التلقين بالعلامات البصرية لبناء مخطط مشهد ثلاثي الأبعاد مستمر من مشاهد ثنائية الأبعاد، مما يتيح تحديد مواقع الأشياء بدقة وقابلية للتفسير من خلال مطابقة المخططات الهيكلية دون الحاجة إلى تدريب مخصص للمهمة.

Xuefei Sun, Xujia Zhang, Brendan Crowe, Doncey Albin, Christoffer Heckman2026-05-22
⚡ electrical engineering

An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation

تقدم هذه الورقة نموذجاً تأسيسياً مفتوح المصدر ومتعدد المراكز لتجزئة أورام الجسم بالكامل عبر التصوير المقطعي بالإصدار البوزيتروني المعتمد على الفلوروديوكسي غلوكوز (FDG PET/CT)، والذي يستخدم دمجاً مبكراً متعدد الأنماط وهدف ترميز تلقائي مقنع متخصص لتحقيق أداء عالٍ بأقل قدر من البيانات المصنفة، مما يقلل من الاعتماد على التوصيفات اليدوية المكثفة في مجال الأورام السريرية.

Xiaofeng Liu, Qianru Zhang, Thibault Marin, Menghua Xia, Chi Liu, Georges El Fakhri, Jinsong Ouyang2026-05-22
💻 computer science

Two-Stage Multimodal Framework for Emotion Mimicry Intensity Prediction

تقدم هذه الورقة إطار عمل متعدد الوسائط مكون من مرحلتين يقوم بتدريب مشفرات النص والصوت والرؤية والحركة بشكل مستقل قبل دمجها عبر منظم انحدار خفيف الوزن للتنبؤ بستة أبعاد مستمرة لشدة العاطفة، محققة المركز الثالث في تحدي Hume-ABAW10 لمحاكاة شدة العاطفة بمعامل ارتباط بيرسون قدره 0.57 لمجموعة الاختبار.

Dinithi Dissanayake, Shaveen Silva, Ovindu Atukorala, Prasanth Sasikumar, Suranga Nanayakkara2026-05-22
💻 computer science

Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

يُعد Thermo-VL نموذجاً جديداً للرؤية واللغة يعزز الإدراك في ظروف الإضاءة المنخفضة من خلال دمج مشفر حراري قابل للتدريب ووحدة دمج ثنائية الانتباه موجهة نصياً في هيكل Molmo-7B المجمد، مما يتيح استدلالاً قوياً عبر الأطياف المتعددة من خلال مجموعة بيانات ومعيار قياس مستحدثين للبيانات المرئية (RGB-حرارية).

Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape, Vishal M. Patel2026-05-22
💻 computer science

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

إنَّ MAVEN هو مسار وكلاء متعدد المراحل يقوم تلقائياً بتوليد بيانات استدلال فيديو عالية الجودة ومنظمة مع تتبعات "سلسلة الأفكار" (Chain-of-Thought) من خلال صقل هرمي وتكيف مع النطاق، مما يعزز بشكل كبير أداء نماذج الرؤية واللغة (Vision Language Models) التي تم ضبطها بدقة على اختبارات قياس الاستدلال في الأحداث المعقدة.

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali2026-05-22
💻 computer science

Visual-Advantage On-Policy Distillation for Vision-Language Models

تقدم هذه الورقة البحثية طريقة "التقطير داخل السياسة ذو الميزة البصرية" (VA-OPD)، وهي طريقة تدريب مبتكرة لنماذج الرؤية واللغة تستفيد من إشارات الميزة البصرية على مستوى الرمز للتمييز بين الرموز الحرجة بصرياً وإعطائها الأولوية أثناء عملية التقطير، مما يؤدي إلى تحسين الأداء بشكل كبير في معايير الاستدلال الرياضي والفهم البصري عبر مختلف أحجام النماذج المعلمة.

Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu (…)2026-05-22
💻 computer science

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

تكشف هذه الورقة أن النماذج اللغوية الكبيرة متعددة الوسائط تمتلك قدرات كامنة في الربط الزمني ضمن انتباه مرحلة التعبئة المسبقة (prefill attention) لكنها تفشل في استغلالها أثناء التوليد، مما دفع إلى ابتكار إطار عمل للاستدلال بدون تدريب يستخلص إشارات الانتباه هذه لتقييد السياق البصري وتحسين أداء الربط الزمني للفيديو بشكل كبير.

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo2026-05-22
⚡ electrical engineering

Entropy-Guided Self-Supervised Learning for Medical Image Classification

تقترح هذه الورقة إطار عمل تآزري للتعلم العميق يجمع بين نماذج ConvNeXt-Tiny المدربة مسبقاً على ImageNet وتلك المدربة مسبقاً باستخدام المشفر التلقائي المقنع الموجه بالإنتروبيا في نموذج واحد (ensemble)، محققاً أداءً هو الأفضل حالياً في تصنيف الصور الطبية من خلال معالجة التحديات مثل محدودية البيانات المشروحة والتباين العالي داخل الفئة الواحدة عبر مجموعات البيانات المتنوعة بفعالية.

Joao Florindo, Viviane Moura2026-05-22