💻 computer science

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

يقدم WorldVLN أول نموذج عمل عالمي ذاتي الانحدار للملاحة الجوية بالرؤية واللغة، والذي يتنبأ بانتقالات حالة العالم قصيرة الأفق لفك تشفير إجراءات نقاط المسار القابلة للتنفيذ مباشرة، مستخدماً إطار تدريب جديداً من مرحلتين مع خوارزمية GRPO المدركة للأفعال لتحقيق أداء فائق في الاختبارات المعيارية والنشر الواقعي للدرونز في حالات عدم التعيين (zero-shot).

Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zh (…)2026-05-18
🤖 AI

Deterministic Event-Graph Substrates as World Models for Counterfactual Reasoning

تقدم هذه الورقة ركائز المخطط البياني للأحداث الحتمية، وهي نموذج عالمي شفاف وغير معلمي يمثل الحالة كسجلات ثلاثية (RDF) مضافة فقط، ويُمكّن من الاستدلال المضاد للواقع بدقة من خلال تفرع السجل، مما يُظهر أداءً فائقاً على كل من الأوراكل الرمزية ونماذج اللغات الكبيرة المعلمية في معايير CLEVRER وtwin-EventLog.

Fabio Rovai2026-05-18
💻 computer science

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

يُعد Flash-GRPO إطار تدريب أحادي الخطوة يتغلب على الاختناقات الحسابية وعدم الاستقرار في أساليب تحسين السياسة النسبية للمجموعات (GRPO) الحالية لنماذج الانتشار بالفيديو، وذلك عبر إدخال التجميع متساوي الزمن وتصحيح التدرج الزمني لتحقيق جودة محاذاة رائدة مع تقليل تكاليف التدريب بشكل كبير.

Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wan (…)2026-05-18
💻 computer science

Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation

يُعد Echo-Forcing إطار عمل لذاكرة المشهد لا يتطلب تدريباً، يعمل على تعزيز توليد الفيديو الطويل التفاعلي من خلال فك ارتباط حالات (KV) التاريخية عبر ذاكرة زمنية هرمية، وإطارات استدعاء المشهد، واضمحلال الذاكرة المدرك للاختلاف، وذلك للتعامل بفعالية مع تبديل المطالبات، ومنع نسيان المشهد، وتمكين الاستدعاء بعيد المدى.

Mingqiang Wu, Weilun Feng, Zhefeng Zhang, Haotong Qin, Yuqi Li, Guoxin Fan, Xiaokun Liu, Zhulin An, Libo Huang, Yongjun (…)2026-05-18
💻 computer science

End-to-end plaque counting and virus titration from laboratory plate images with deep learning

تقدم هذه الورقة سير عمل مفتوح المصدر للتعلم العميق من طرف إلى طرف، يستفيد من النماذج القائمة على SAM لأتمتة عد اللويحات الفيروسية وتعييرها من صور أطباق مختبرية متنوعة، محققاً دقة عالية واتفاقاً مع التوصيفات اليدوية للخبراء عبر أنواع متعددة من الفيروسات وتنسيقات الأطباق المختلفة.

Eugenia Moris, Alicia Costábile, Sebastián Rey, Irene Ferreiro, Joaquín Hurtado, Lizandra Lissette Luciano, Matías Villa (…)2026-05-18
💻 computer science

EndoGSim: Physics-Aware 4D Dynamic Endoscopic Scene Simulations via MLLM-Guided Gaussian Splatting

تقترح الورقة البحثية إطار عمل EndoGSim، وهو إطار عمل موحد يستفيد من تقنية "Gaussian Splatting" رباعية الأبعاد الموجهة بنماذج اللغات الكبيرة متعددة الوسائط (MLLM) وطريقة نقطة المادة (MPM) القابلة للتفاضل، لتحقيق إعادة بناء ومحاكاة عالية الدقة وواعية بالفيزياء للمشاهد التنظيرية الديناميكية في الجراحة بمساعدة الروبوت.

Changjing Liu, Yiming Huang, Long Bai, Beilei Cui, Hongliang Ren2026-05-18
🤖 AI

AgriMind: An Ensemble Deep Learning Framework for Multi-Class Plant Disease Classification

يُعد AgriMind إطار عمل للتعلم العميق القائم على التجميع يجمع بين ResNet50 وEfficientNet-B0 وDenseNet121، والذي يحقق دقة بنسبة 99.23% في تصنيف 15 فئة من أمراض النباتات عبر محاصيل الفلفل والبطاطس والطماطم، مما يقلل بشكل كبير من معدلات الخطأ مقارنة بالنماذج الفردية مع الحفاظ على كفاءة خفيفة الوزن مناسبة للنشر المحتمل على الهواتف المحمولة في بنغلاديش.

Salma Hoque Talukdar Koli, Fahima Haque Talukder Jely2026-05-18
💻 computer science

WeatherOcc3D: VLM-Assisted Adverse Weather Aware 3D Semantic Occupancy Prediction

يقترح WeatherOcc3D إطار عمل مبتكر يسخر نموذج الرؤية واللغة (VLM) لتعديل دمج الكاميرا والليدار ديناميكيًا بناءً على تلميحات الطقس اللغوية، مما يعالج بفعالية مشكلات موثوقية المستشعرات في الظروف القاسية ويحسن بشكل كبير أداء التنبؤ بالتواجد الدلالي ثلاثي الأبعاد على مجموعة بيانات nuScenes.

A. Enes Doruk, Abdelaziz Hussein, Hasan F. Ates2026-05-18
💻 computer science

STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics-Physics Dual System

يُعد STABLE إطار عمل ثنائي النظام مبتكرًا يجمع بين نموذج لغوي كبير (LLM) مضبوط بدقة لتوليد التخطيط الدلالي، ونموذج تدفق مدرك للفيزياء للتصحيح الفيزيائي، مما يتيح الإنشاء التدريجي لمشاهد الطاولة الجاهزة للمحاكاة والتي تلتزم بصرامة بتعليمات المهام مع ضمان ترتيبات للأجسام خالية من التصادم ومنطقية فيزيائيًا.

Zhen Luo, Yixuan Yang, Xudong Xu, Jinkun Hao, Zhaoyang Lyu, Feng Zheng, Jiangmiao Pang, Yanwei Fu2026-05-18
💻 computer science

Registers Matter for Pixel-Space Diffusion Transformers

تُظهر هذه الورقة أنه بينما لا تعاني محولات الانتشار (DiTs) من القيم المتطرفة لرموز الرقع (patch-token outliers) المميزة لمحولات الرؤية (Vision Transformers)، إلا أن رموز التسجيل (register tokens) لا تزال تعزز بشكل كبير جودة التوليد وتقارب محولات الانتشار في فضاء البكسل من خلال إنتاج خرائط ميزات أكثر نقاءً، مما أدى إلى اقتراح بنية ثنائية المسار كفؤة في المعلمات تستفيد من هذه الرؤى.

Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk2026-05-18