🤖 AI

Latent Video Prediction Learns Better World Models

تقدم هذه الورقة دراسة منهجية تثبت أن نماذج التنبؤ بالفيديو الكامنة، مثل V-JEPA 2.1، تتفوق على النماذج التقليدية القائمة على إعادة البناء والنماذج الخاضعة للإشراف عبر خمسة محاور للمتانة، مما يثبت أنها مرشحات متفوقة لبناء نماذج عالم متينة.

Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam, James Bailey, Naveed Akhtar2026-05-18
🤖 AI

PRISM: Prompt Reliability via Iterative Simulation and Monitoring for Enterprise Conversational AI

يُعد PRISM إطار عمل مغلق الحلقة يعامل هندسة الأوامر البرمجية كمسألة هندسة موثوقية مستمرة من خلال التوليد التلقائي لحالات الاختبار، ومحاكاة المحادثات، وإصلاح الأوامر بشكل تكراري لضمان بقاء وكلاء الذكاء الاصطناعي الحواري للمؤسسات مرنين ضد الانحراف السلوكي للنماذج اللغوية الكبيرة.

Keshava Chaitanya, Jahnavi Gundakaram2026-05-18
🤖 AI

VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

تكشف هذه الورقة أن نماذج الرؤية واللغة الحديثة تعاني في تتبع المسارات البصرية بسبب عدم قدرة جوهري على مقاومة المشتتات المحلية، وهو عنق زجاجة يستمر رغم التوسع، أو تدخلات الاستدلال، أو التعليمات الصريحة.

Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No2026-05-18
💬 NLP

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

تقترح الورقة البحثية ASRU، وهو إطار عمل للتعلم غير المتعدد الوسائط القابل للتحكم يجمع بين توجيه التنشيط والتعلم المعزز لإزالة المعلومات الحساسة عبر الوسائط بفعالية مع تحسين جودة التوليد بشكل كبير والحفاظ على فائدة النموذج.

Jiahui Guang, Yingjie Zhu, Cuiyun Gao, Haiyan Wang, Jing Li, Di Shao, Zhaoquan Gu2026-05-18
🤖 AI

Position: Early-Stage Quality Assurance in Annotation Pipelines Is More Cost-Effective Than Late-Stage Validation

تجادل ورقة الموقف هذه بأن إعطاء الأولوية لضمان الجودة في المراحل المبكرة من مسارات التوسيم أكثر فعالية من حيث التكلفة بشكل كبير من التحقق في المراحل المتأخرة، وتحث مجتمع تعلم الآلة على التعامل مع توقيت ضمان الجودة كمتغير تصميمي حاسم والإبلاغ عنه بشكل منهجي لمعالجة فجوة رئيسية في الأبحاث الحالية.

Sunil Kothari, Sumukha Sharma Thoppanahalli Chandramouli, Naman Khandelwal, Parth Kulshreshtha, Ashi Jain, Kriti Banka (…)2026-05-18
🤖 AI

DiLA: Disentangled Latent Action World Models

يقدم DiLA نموذج عالم مبتكر يحل المفاضلة بين تجريد الأفعال ودقة التوليد من خلال الاستفادة من التآزر بين تعلم الفعل الكامن وفك الارتباط بين المحتوى والبنية لتحقيق توليد فيديو عالي الجودة ومساحات أفعال قابلة للتفسير دون الحاجة إلى بيانات مصنفة.

Tianqiu Zhang, Muyang Lyu, Yufan Zhang, Fang Fang, Si Wu2026-05-18
🤖 AI

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

تقدم هذه الورقة NudgeRL، وهو إطار عمل يعزز التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) من خلال توظيف استكشاف موجه بالاستراتيجية ومدفوع بالتنوع لتحسين قدرات الاستنتاج بكفاءة في اختبارات الرياضيات المرجعية دون الاعتماد على الإشراف من قِبل "أوراكل" المكلف أو التوسع بالقوة الغاشمة.

Chanuk Lee, Sangwoo Park, Minki Kang, Sung Ju Hwang2026-05-18
🤖 AI

Structure Abstraction and Generalization in a Hippocampal-Entorhinal Inspired World Model

تقترح هذه الورقة نموذجاً هرمياً مستوحىً من الدماغ يحاكي الدائرة الحصينية-المسالية لاستخراج البنى العلاقاتية المجردة وبناء نماذج عالم بصري تنبؤية في آن واحد، مما يتيح تعميماً بنيوياً قوياً ونقلاً للمعرفة من خلال التعلم الخاضع للإشراف الذاتي.

Tianqiu Zhang, Muyang Lyu, Xiao Liu, Si Wu2026-05-18
🤖 AI

BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation

يُعد BiomedAP إطار عمل مبتكرًا يعتمد على الرؤية والارتباط المزدوج، يعالج هشاشة نماذج الرؤية واللغة الطبية تجاه تغيرات الأوامر النصية من خلال توظيف دمج عبر وسائط بوابات التنظيم للتحكم الديناميكي في الضجيج، وقيد الارتباط المزدوج لتثبيت المحاذاة الدلالية، مما يحقق تشخيصًا طبيًا قويًا في سياق التعلم القليل من الأمثلة عبر مختلف المعايير.

Huanyang Tong, Kai Liu, Fangjun Kuang, Huiling Chen2026-05-18