🧬 biology

TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots

إن TeamPath هو نظام ذكاء اصطناعي مدعوم بالتعلم التعزيزي يستفيد من مجموعات بيانات علم الأمراض النسيجية متعددة الوسائط واسعة النطاق والحلول المعززة بالموجّه ليعمل كمساعد طيار قائم على الاستنتاج للتشخيص المرضي بمستوى الخبراء، وتلخيص المعلومات، والتوليد عبر الوسائط المتعددة، مما يظهر كفاءة ودقة محسنتين عند التعاون مع أطباء المسالك البولية.

Tianyu Liu, Weihao Xuan, Hao Wu, Peter Humphrey, Marcello DiStasio, Mohamed Kahila, Alfonso Garcia Tan, Heli Qi, Rui Yan (…)2026-04-08
💻 computer science

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

تقدم هذه الورقة TRANSPORTER، وهو نهج مستقل عن النموذج ينقل الدلالات البصرية من فضاءات نماذج الرؤية واللغة (VLM) إلى النماذج التوليدية عبر اقتران النقل الأمثل، مما يتيح إنشاء فيديوهات عالية الدقة تصور وتفسر القواعد الكامنة التي تحرك تنبؤات نماذج الرؤية واللغة.

Alexandros Stergiou2026-04-08
⚡ electrical engineering

In search of truth: Evaluating concordance of AI-based anatomy segmentation models

تقدم هذه الورقة إطار عمل عملي لتقييم التوافق بين نماذج تقسيم التشريح القائمة على الذكاء الاصطناعي في مجموعات البيانات التي تفتقر إلى الحقيقة الأرضية، وذلك من خلال توحيد المخرات في تمثيل قياسي وتوفير أدوات تصور تفاعلية، مما يثبت فائدتها في مقارنة ستة نماذج مفتوحة المصدر على صور الأشعة المقطعية من مجموعة بيانات (NLST) لتحديد التباينات وتحديد حالات عدم الاتفاق بين النماذج ذات الأولوية للمراجعة من قبل الخبراء.

Lena Giebeler, Deepa Krishnaswamy, David Clunie, Jakob Wasserthal, Lalith Kumar Shiyam Sundar, Andres Diaz-Pinto, Klaus (…)2026-04-08✓ Author reviewed
💻 computer science

SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models

تقدم الورقة البحثية SigLino، وهي عائلة فعالة من نماذج الرؤية التأسيسية التجميعية التي تستفيد من التقطير غير المتماثل، وتوازن الرموز في الدفعات، وأخذ العينات الهرمية للبيانات لتقطير المعرفة بفعالية من SigLIP2 وDINOv3 إلى نماذج طالب كثيفة ونماذج خليط من الخبراء (Mixture-of-Experts)، مما يؤدي إلى أداء فائق لنماذج Grounding-VLMs ذات الاندماج المبكر مقارنة بالنماذج المدربة من الصفر.

Sofian Chaybouti, Sanath Narayan, Yasser Dahou, Phúc H. Lê Khac, Ankit Singh, Ngoc Dung Huynh, Wamiq Reyaz Para, Hilde K (…)2026-04-08
💻 computer science

MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning

تقدم هذه الورقة البحثية MINERVA-Cultural، وهو معيار متعدد اللغات يتسم بالتحدي ويتميز بتعليقات توضيحية من صنع البشر عبر 18 موقعاً محلياً عالمياً لتقييم وكشف القيود الكبيرة في الاستدلال الثقافي والبصري لنماذج اللغة والفيديو الحالية ذات الحالة الراهنة.

Darshan Singh, Arsha Nagrani, Kawshik Manikantan, Harman Singh, Dinesh Tewari, Tobias Weyand, Cordelia Schmid, Anelia An (…)2026-04-08
🤖 AI

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

تحدد هذه الورقة البحثية الاختصارات القائمة على الأشياء كنمط فشل رئيسي في التعرف على الأفعال التكوينية من نوع "التعلم الصفري"، وتقترح RCORE، وهي طريقة تستخدم تنظيم أولوية التواجد المشترك وتنظيم الترتيب الزمني للتخفيف من الاعتماد على التواجدات المشتركة في التدريب وتحسين التعميم على تركيبات (فعل-اسم) غير المرئية.

Geo Ahn, Inwoong Lee, Taeoh Kim, Minho Shim, Dongyoon Wee, Jinwoo Choi2026-04-08
💻 computer science

PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstruction

تقدم الورقة البحثية PPISP، وهو وحدة تصحيح وتحكم فيزيائية واقعية تعمل على فك الارتباط بين التباينات الضوئية المرتبطة بالخصائص الجوهرية للكاميرا والتباينات المرتبطة بعملية الالتقاط، وذلك لتحقيق إعادة بناء لمجال الإشعاع ثلاثي الأبعاد قابل للتعميم وبأداء متفوق، مع توليد مناظر جديدة واقعية.

Isaac Deutsch, Nicolas Moënne-Loccoz, Gavriel State, Zan Gojcic2026-04-08
💬 NLP

From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models

تقدم هذه الورقة البحثية UReason، وهو معيار مرجعي يوضح أنه على الرغم من البنية الموحدة للنماذج متعددة الوسائط الحالية، إلا أن تمثيلاتها عبر الوسائط تظل غير متوافقة، كما يتضح من النتيجة المفاجئة بأن التوليد غير المرتبط بالسياق يتفوق على التوليد الموجه بالاستدلال في مهام تركيب الصور.

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirk (…)2026-04-08
💻 computer science

A global dataset of continuous urban dashcam driving

تقدم الورقة البحثية CROWD، وهي مجموعة بيانات متنوعة عالمياً ومنسقة يدوياً تضم أكثر من 20,000 ساعة من لقطات كاميرا السيارة (dashcam) الحضرية المستمرة وغير المحررة من 238 دولة، والمصممة لدعم أبحاث القيادة القوية عبر المجالات المختلفة من خلال توفير مقاطع قيادة روتينية مع تسميات يدوية لوقت اليوم والمركبة إلى جانب تعليقات توضيحية لتتبع وكشف الأشياء تم إنشاؤها آلياً.

Md Shadab Alam, Olena Bazilinska, Pavlo Bazilinskyy2026-04-08
💻 computer science

Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation

يُعد Firebolt-VL نموذجاً رؤياً-لغوياً فعالاً يستبدل مفكك الـ Transformer التقليدي بنموذج تأسيسي سائل، ويقدم وحدة ارتباط شبكي للرموز لتحقيق استدلال زمني خطي مع تعزيز التأسيس البصري دقيق التفاصيل من خلال التعديل عبر فضاء الحالة.

Quoc-Huy Trinh, Mustapha Abdullahi, Bo Zhao, Debesh Jha2026-04-08