🤖 AI

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

تقدم الورقة البحثية ViSRA، وهو وكيل يعتمد على الفيديو ومتوافق مع البشر ولا يتطلب تدريباً، يستفيد من المعلومات المكانية الصريحة من النماذج الخبيرة لتعزيز قدرات الاستدلال المكاني ثلاثي الأبعاد للنماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير دون الحاجة إلى ما بعد التدريب أو تنسيق مجموعات البيانات يدوياً.

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma2026-05-12
🤖 AI

Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality

تُظهر هذه الدراسة أن توسيع نطاق نماذج الرؤية الحاسوبية لا يعزز باستمرار جودة تفسيراتها القائمة على التحديد المكاني، حيث غالبًا ما تؤدي البنيات الأصغر أداءً يضاهي أو يتفوق على البنيات الأكبر، مما يسلط الضوء على الحاجة إلى تقييم القدرة على التفسير صراحةً جنبًا إلى جنب مع دقة التنبؤ في التطبيقات الحرجة للسلامة.

Mateusz Cedro, Marcin Chlebus2026-05-12
🤖 AI

MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning

تقدم هذه الورقة MTA-RL، وهو إطار عمل مبتكر يعزز القيادة الذاتية الحضرية القوية من خلال دمج بيانات RGB وLiDAR عبر محول متعدد الوسائط (Multi-modal Transformer) لتوليد تمثيلات إمكانات ثلاثية الأبعاد (3D affordance) صريحة، والتي تعمل كفضاء ملاحظة مدمج لسياسة التعلم المعزز لتحقيق أداء متفوق، وكفاءة في أخذ العينات، وتعميم صفري مقارنة بالنماذج المرجعية الحالية.

Guangli Chen, Dianzhao Li, Wenjian Zhong, Bangquan Xie, Ostap Okhrin2026-05-12
🤖 AI

DynGhost: Temporally-Modelled Transformer for Dynamic Ghost Imaging with Quantum Detectors

تُعد DynGhost بنية قائمة على المحولات (transformer) تستفيد من كتل الانتباه المكاني والزماني المتناوبة إلى جانب إطار تدريب واعٍ بالكم لتجاوز قيود الطرق الحالية في التصوير الشبح الديناميكي، محققةً أداء إعادة بناء فائقاً في ظل ظروف واقعية تعاني من نقص الفوتونات وضجيج بواسون.

Vittorio Palladino, Ahmet Enis Cetin2026-05-12
🤖 AI

Phoenix-VL 1.5 Medium Technical Report

إنّ Phoenix-VL 1.5 Medium هو نموذج تأسيسي متعدد الوسائط واللغات بطبيعته، يمتلك 123 مليار معلمة، وقد تم تكييفه خصيصاً مع سياق سنغافورة من خلال تدريب مسبق ومواءمة محلية مكثفة، محققاً أداءً هو الأفضل في فئته على المعايير المرجعية الإقليمية مع الحفاظ على التنافسية العالمية في الذكاء العام.

Team Phoenix, :, Arka Ray, Askar Ali Mohamed Jawad, Biondi Lee, Elijah Seah, Eva Lim, Fiona Teo, Grace Toh, Guang Xiang (…)2026-05-12
🤖 AI

AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

يُعد AnomalyClaw وكيلًا للكشف عن الشذوذ البصري لا يتطلب تدريبًا، يعمل على تعزيز موثوقية نماذج الرؤية واللغة عبر مجالات متنوعة من خلال تحويل الحكم على الشذوذ إلى عملية تفنيد متعددة الجولات وموجهة بالأدوات، تقوم بالتحقق بشكل منهجي من المرشحين مقابل مراجع العينات الطبيعية.

Xi Jiang, Yinjie Zhao, Zesheng Yang, Feng Zheng2026-05-12
🤖 machine learning

Beyond Spatial Compression: Interface-Centric Generative States for Open-World 3D Structure

تقترح هذه الورقة "حالات توليدية متمحورة حول الواجهة" من خلال أداة الترميز C2LT-3D، والتي تنقل التمثيل ثلاثي الأبعاد من مجرد ضغط مكاني سلبي إلى حالة تشغيلية تكشف صراحةً عن الهندسة، وملكية المكونات، وصلاحية الاتصال لتمكين الاستدلال الهيكلي والإصلاح القوي في الأصول ثلاثية الأبعاد ذات العوالم المفتوحة.

Xiang Chen, Alexander Binder2026-05-12
📊 statistics

Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data

تقترح هذه الورقة إطار عمل جديداً متعدد الوسائط للتعرف على التوزيعات ذات الذيول الطويلة، يقوم بدمج مصادر البيانات غير المتجانسة ديناميكياً باستخدام أوزان موجهة بالثقة للتغلب على عدم توازن الفئات والتفوق على الأساليب الحالية أحادية الوسائط.

Heegeon Yoon, Heeyoung Kim2026-05-12
🤖 AI

DuetFair: Coupling Inter- and Intra-Subgroup Robustness for Fair Medical Image Segmentation

تقترح الورقة البحثية DuetFair، وهو إطار عمل ثنائي المحاور يتميز بخوارزمية FairDRO التي تجمع بين خليط الخبراء المدرك للتوزيع والتحسين المتين للتوزيع المشروط بالمجموعات الفرعية لمعالجة التفاوتات بين المجموعات الفرعية والإخفاقات الخفية داخل المجموعات الفرعية في آن واحد في تقسيم الصور الطبية، محققةً عدالة فائقة وأداءً أفضل في الحالات الأسوأ عبر العديد من المعايير.

Yiqi Tian, Sangjoon Park, Bo Zeng, Pengfei Jin, Yujin Oh, Quanzheng Li2026-05-12
🤖 machine learning

EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving

يقدم EnergyLens نموذج طاقة ذا صيغة مغلقة، قابل للتفسير، ومكون من اثني عشر معاملًا، تم استخلاصه عبر الانحدار الرمزي، يتنبأ بدقة بطاقة الاستدلال عبر مختلف النماذج اللغوية الكبيرة متعددة الوسائط والأجهزة مع حد أدنى من بيانات التوصيف، متفوقًا بذلك على النماذج المرجعية "الصندوق الأسود" والنماذج التحليلية في اختيار التكوينات والاستقراء.

Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan2026-05-12