💻 computer science

Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning

يقدم Spa3R إطار عمل ذاتي الإشراف يتعلم تمثيلات مكانية موحدة وثابتة تجاه زوايا الرؤية من صور متعددة المشاهد غير محددة الوضعية عبر نمذجة المجال المكاني التنبؤية، مما يمكّن نموذج الرؤية واللغة من تحقيق أداء رائد في الاستدلال البصري ثلاثي الأبعاد دون الاعتماد على بيانات ثلاثية الأبعاد صريحة.

Haoyi Jiang, Liu Liu, Xinjie Wang, Yonghao He, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang2026-08-14
💻 computer science

CRC-HGD: A Histopathological Image Dataset for Grading Colorectal Cancer

تقدم هذه الورقة البحثية CRC-HGD، وهي مجموعة بيانات للأنسجة المرضية متاحة للعموم وتضم 1,914 صورة لسرطانة القولون الغدية مصبوغة بصبغة الهيماتوكسيلين والإيوسين من 214 مريضاً عبر ثلاثة درجات تمايز وأربعة مستويات تكبير، صُممت لتسهيل التدرج الآلي للسرطان باستخدام الذكاء الاصطناعي.

Elham Amjadi, Amin Bahreini, Sayed Mohammad Hasan Emami, Sayyed Mohammadreza Hakimian, Alireza Fahim, Hojjatollah Rahimi (…)2026-08-14
💻 computer science

Vision-Language Models are Fragile Multilingual Associators

تقدم هذه الورقة المعيار المرجعي M2^2BIND لتوضيح أن نماذج الرؤية واللغة تظهر ترابط مفاهيم هشاً يعتمد على اللغة، وينهار بشكل كبير في الإعدادات متعددة اللغات عبر العائلات والخطوط المختلفة، مما يتحدى افتراض اتساق الأداء عبر اللغات المتنوعة.

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Shivakumara Palaiahnakote, Angelo Cangelosi, Umapada Pal2026-08-14
💻 computer science

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

تقيم هذه الدراسة نماذج الرؤية واللغة مفتوحة المصدر لتقييم مخاطر التقارب من صور الروبوتات ذات المنظور الشخصي، وتجد أنه في حين أن الضبط الدقيق لا يقدم سوى مكاسب إجمالية متواضعة، فإن التلقين المتقدم يحسن بشكل كبير اكتشاف الخطورة العالية في نماذج معينة مثل Qwen-VL، رغم أن التصنيفات الصحيحة للسلامة لا ترتبط بالضرورة بالتأسيس المكاني الدقيق.

Vladyslava Rudas, Dmytro Kuzmenko2026-08-14
💻 computer science

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

يُعد MASCOT إطار عمل مبتكر لاسترجاع الصور من النصوص يعالج أوجه القصور في طرق إعادة الترتيب القائمة على المتشعبات في مهام نقص التنوع، وذلك من خلال صياغة التنوع متعدد السمات كمسألة تخصيص موارد، مما يحافظ بشكل كبير على استدعاء الرتب المبكرة تحت قيود مركبة مثل الجغرافيا والزمن.

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan2026-08-14
💻 computer science

PseudoMapLabeler: Confidence-Aware Pseudo-Label Generation for Semi-Supervised Online Mapping

تقترح الورقة البحثية PseudoMapLabeler، وهو إطار عمل للتعلم شبه المشرف بنظام المعلم-الطالب القائم على الوعي بالثقة، والذي يستخدم تقيماً للموثوقية مبنياً على توزيع "بيتا" والقص المكاني لتوليد تسميات مستعارة عالية الجودة من البيانات غير الموسومة، مما يحسن بشكل كبير أداء بناء خرائط HD عبر الإنترنت في ظل أنظمة نقص التسمية.

Chikao Tsuchiya, Dhaval Bhanderi, David Ilstrup, Hsinmin Cheng, Christopher Ostafew2026-08-14
🤖 machine learning

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

يقدم البحث WidgetGen، وهو إطار عمل خفيف الوزن يعتمد على الأدوات (tool-grounded) يعمل على تحسين المقايضة بين الدقة والكفاءة في عملية توليد الكود من لقطات الشاشة عبر الربط الانتقائي لأدلة النصوص والألوان المرئية لإنتاج JSX مباشرة، متفوقاً بذلك على كل من التلقين المباشر ومسارات العمل المهيكلة، مع تمكين أيضاً من الضبط الدقيق الفعال للنماذج ذات الأوزان المفتوحة.

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi2026-08-14
💻 computer science

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

تقدم هذه الورقة البحثية FUSE، وهو إطار عمل مبتكر للتأصيل الوظيفي النشط للإمكانات (functional affordance grounding) يُمكّن الوكلاء المتجسدين من تحديد وتأصيل الأشياء مكانياً بناءً على وظيفتها بكفاءة، وذلك عبر الحصول التكيفي على الأدلة الدلالية-الهندسية من خلال استراتيجية استكشاف مدفوعة بعدم اليقين ومخطط مُدرك مُتكيّف، وهو ما تم التحقق من صحته عبر معيار مرجعي جديد قائم على Habitat.

Zhou Chen, Sathyanarayanan N. Aakur2026-08-14
💻 computer science

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

يُعد Mr3D-VL نموذجاً تأسيسياً لغوياً-بصرياً بـ 4 مليارات معلمة، صُمم للتغلب على قيود الذكاء الاصطناي الحالي في التصوير بالرنين المغناطيسي ثلاثي الأبعاد متعدد المعلمات عبر دمج الترميز ثلاثي الأبعاد غير الخاضع للإشراف مع تضمينات موضعية دورانية رباعية الأبعاد لتمكين التفكير الفائق عبر الوسائط، والمحاذاة المكانية، والقابلية للتفسير السريري لتشخيص أورام الدماغ.

Zhi Qiao, Xintong Wu, Yichu He, Feng Shi2026-08-14
💻 computer science

Class Geometry as Supervision for Sample-Efficient Open-World Detection

تقترح هذه الورقة إطار عمل "إشراف هندسة الفئات" (CGS)، الذي يعزز كفاءة العينات والأداء في اكتشاف الكائنات في العالم المفتوح من خلال تقييد التمثيلات الطبقية المتعلمة للحفاظ على الاختلافات البصرية أو الدلالية، مما يحسن إدراج الفئات الجديدة واستدعاء الكائنات غير المعروفة حتى في حالات ندرة البيانات.

Akash Rao, Zhou Chen, Revanth Reddy Palem, Udhav Ramachandran, Ruth Scimeca, Sathyanarayanan N. Aakur2026-08-14