💻 computer science

WorldKV: Efficient World Memory with World Retrieval and Compression

يُعد WorldKV إطار عمل لا يتطلب تدريباً يُمكّن من توليد فيديو تلقائي الترتيب بشكل متسق وفي الوقت الفعلي عبر الجمع بين الاسترجاع الانتقائي لقطع ذاكرة التخزين المؤقت (KV-cache) المُطرودة مع ضغط الرموز للحفاظ على ذاكرة العالم طويلة المدى، مع مضاعفة معدل الإنتاجية مقارنة بنهج الـ KV الكامل.

Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim2026-05-22
💻 computer science

Synthetic Data Alone is Enough? Rethinking Data Scarcity in Pediatric Rare Disease Recognition

تُثبت هذه الورقة أن تدريب نماذج الرؤية الحاسوبية حصرياً على صور وجوه اصطناعية عالية الدقة كافٍ لتحقيق أداء يضاهي النماذج المرجعية القائمة على البيانات الحقيقية للتعرف على الأمراض النادرة لدى الأطفال، مما يقدم حلاً يحافظ على الخصوصية للتغلب على الندرة الشديدة في البيانات في الإعدادات السريرية.

Ganlin Feng, Yuxi Long, Erin Lou, Lianghong Chen, Zihao Jing, Pingzhao Hu, Wei Xu2026-05-22
💻 computer science

Cambrian-P: Pose-Grounded Video Understanding

تقدم الورقة البحثية Cambrian-P، وهو نموذج لغوي كبير متعدد الوسائط للفيديو يدمج وضعية كاميرا كل إطار كإشارة إشرافية خفيفة الوزن لتعزيز الاستدلال المكاني والفهم العام للفيديو بشكل كبير من خلال نمذجة المشهد ثلاثي الأبعاد المستمر بدلاً من معاملة الإطارات كلقطات ثنائية الأبعاد معزولة.

Jihan Yang, Zifan Zhao, Xichen Pan, Shusheng Yang, Junyi Zhang, Bingyi Kang, Hu Xu, Saining Xie2026-05-22
💻 computer science

Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

تحدد هذه الورقة البحثية "العمى عن الحركة الاتجاهية" في النماذج اللغوية المرئية الكبيرة (Video-LLMs)، حيث تفشل النماذج في تفسير اتجاهات الحركة الموقعة بشكل صحيح رغم احتفاظها بالإشارات البصرية الأساسية، وتقترح DeltaDirect، وهو هدف على مستوى جهاز الإسقاط (projector-level) قائم على التشخيص، يعمل على تحسين دقة اتجاه الحركة بشكل كبير من خلال الضبط الدقيق للتعليمات المتخصص على مجموعة بيانات MoDirect المقدمة.

Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi2026-05-22
🧬 biology

Task-conditioned probing of instruction-tuned multimodal LLMs: Region-specific brain alignment patterns under naturalistic stimuli

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة متعددة الوسائط والمنضبطة بالتعليمات تُبدي محاذاة أقوى وأكثر تخصصاً في المهام مع نشاط الدماغ البشري أثناء مشاهدة الأفلام الطبيعية مقارنة بالنماذج غير المنضبطة بالتعليمات ونماذج التعلم بالسياق، مما يشير إلى أن الضبط بالتعليمات ينظم التمثيلات حول المتطلبات الوظيفية للمهام بدلاً من الدلالات السطحية.

Subba Reddy Oota, Khushbu Pahwa, Prachi Jindal, Satya Sai Srinath Namburi, Maneesh Singh, Tanmoy Chakraborty, Bapi S. Ra (…)2026-05-21
💻 computer science

The Cow of Rembrandt - Analyzing Artistic Prompt Interpretation in Text-to-Image Models

تتقصى هذه الورقة البحثية كيف تمثل نماذج الانتشار من نوع "ترانسفورمر" لتحويل النص إلى صورة مفاهيم المحتوى والأسلوب في المطالبات الفنية وتفصل بينهما داخلياً دون إشراف صريح، كاشفةً من خلال تحليل الانتباه المتقاطع أن هذه النماذج غالباً ما تظهر قدرة ناشئة على عزو المناطق المتعلقة بالأجسام إلى رموز المحتوى ومناطق الملمس أو الخلفية إلى رموز الأسلوب.

Alfio Ferrara, Sergio Picascia, Elisabetta Rocchetti2026-05-21
💻 computer science

Online 3D Multi-Camera Perception through Robust 2D Tracking and Depth-based Late Aggregation

تقترح هذه الورقة إطار عمل يوسع أنظمة تتبع متعدد الكاميرات ثنائية الأبعاد عبر الإنترنت الحالية إلى الفضاء ثلاثي الأبعاد من خلال الاستفادة من إعادة بناء السحابة النقطية القائمة على العمق وآلية تعزيز ربط البيانات، محققة المركز الثالث في لوحة صدارة تحدي AI City لعام 2025 الخاص بالتتبع متعدد الكاميرات ثلاثي الأبعاد (3D MTMC).

Vu-Minh Le, Thao-Anh Tran, Duc Huy Do, Xuan Canh Do, Huong Ninh, Hai Tran2026-05-21
🤖 AI

Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions

تقترح الورقة البحثية إطار عمل STEP، وهو إطار هجين لتقليل الرموز يجمع بين دمج الرقع الفائقة الديناميكي والتقليم عبر الخروج المبكر بواسطة سياسة شبكة عصبية تلافيفية خفيفة الوزن، مما يحسن بشكل كبير من الكفاءة الحسابية وإنتاجية نماذج "Vision Transformers" في مهام التجزئة الدلالية عالية الدقة مع حد أدنى من فقدان الدقة.

Michal Szczepanski, Martyna Poreba, Karim Haroun2026-05-21
💬 NLP

The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping

تقدم هذه الورقة تحدي الأيقونية البصرية (Visual Iconicity Challenge)، وهو معيار مرجعي جديد قائم على الفيديو يقيم 13 من نماذج الرؤية واللغة الحديثة في قدرتها على ربط أشكال لغة الإشارة الديناميكية بالمعاني، مما يكشف أنه بينما تظهر النماذج الحالية بعض الحساسية تجاه البنى المرتكزة بصرياً، إلا أنها لا تزال تتخلف بشكل كبير عن الأداء البشري في التنبؤ بالأشكال الفونولوجية واستنتاج المعنى من الأيقونية.

Onur Keleş, Aslı Özyürek, Gerardo Ortega, Kadir Gökgöz, Esam Ghaleb2026-05-21