🤖 machine learning

Generative Visual Code Mobile World Models

تقدم الورقة البحثية gWorld، وهو نموذج جديد لنماذج عالم واجهة المستخدم الرسومية للهواتف المحمولة يستفيد من نموذج لغوي بصري واحد للتنبؤ بحالة الواجهة التالية ككود ويب قابل للتنفيذ بدلاً من البكسلات الخام، مما يحقق رندرة بصرية عالية الدقة وتوليداً دقيقاً للنصوص مع التفوق بشكل كبير على النماذج الحالية الأكبر حجماً في الدقة.

Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin2026-05-26
💻 computer science

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

تقترح الورقة البحثية إطار عمل DySta، وهو إطار عمل فعال لنماذج الرؤية واللغة والعمل (Vision-Language-Action) يقوم بفصل الرموز البصرية الثابتة عن الديناميكية لتقليل طول السياق وتمكين إعادة استخدام ذاكرة التخزين المؤقت لمفاتيح والقيم (KV cache)، مما يؤدي إلى تحسين أداء دمج الإطارات المتعددة وسرعة الاستنتاج بشكل كبير في كل من المهام الروبوتية المحاكية والواقعية.

Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying2026-05-26
💻 computer science

Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention

تقترح الورقة البحثية Light Forcing، وهو أول إطار عمل للانتباه المتناثر المصمم خصيصاً لنماذج الانتشار المرئي ذات التوليد الذاتي، والذي يستخدم النمو المدرك للكتل والانتباه المتناثر الهرمي للتغلب على تدهور الأداء وتحقيق تسريع كبير مع الحفاظ على جودة بصرية عالية.

Chengtao Lv, Yumeng Shi, Yushi Huang, Ruihao Gong, Shen Ren, Wenya Wang2026-05-26
💻 computer science

Two-Pass Zero-Shot Temporal-Spatial Grounding of Rare Traffic Events in Surveillance Video

تقدم هذه الورقة البحثية مسار عمل يعتمد على التعلم الصفري (zero-shot) دون الحاجة إلى ضبط دقيق (no-fine-tuning)، والذي يستفيد من استراتيجية مرور مرحلتين من الخشن إلى الناعم (two-pass coarse-to-fine) وتخصيص أدوار نماذج الرؤية واللغة المتخصصة لتحقيق أفضل النتائج الحالية في التوطين الزماني والمكاني لحوادث المرور النادرة في فيديوهات المراقبة، متفوقاً بذلك على النماذج المرجعية الحالية بنسبة 12.7% في معيار ACCIDENT@CVPR 2026.

Jiantang Huang2026-05-26
🤖 AI

In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models

تبحث هذه الورقة فيما إذا كانت نماذج الرؤية واللغة الكبيرة يمكنها محاكاة الاكتشاف الإبداعي مفتوح النهايات الملحوظ في تجارب "بيك بريدر" (Picbreeder) التي يقودها البشر، حيث وجدت أنه بينما تنتج هذه النماذج مخرجات متميزة، فإن دمج آليات مثل الضجيج الاستكشافي، والتنوع السلوكي، والذاكرة يعد ضروريًا لفهم الفجوة في القدرة التوليدية بشكل أفضل ولتجسيرها محتملاً.

Sam Earle, Kay Arulkumaran, Andrew Dai, Akarsh Kumar, Julian Togelius, Sebastian Risi2026-05-26
🤖 machine learning

Parameter Efficient Multi-Class Intelligent Scheduling for Multimodal Online Distributed Industrial Anomaly Detection

تقترح هذه الورقة البحثية إطار عمل MODIAD، وهو إطار عمل مبتكر للكشف عن الشذوذ الصناعي الموزع عبر الإنترنت متعدد الوسائط، والذي يوظف مشكلة جدولة ذكية متعددة الفئات يتم حلها بواسطة خوارزمية جشعة للربح الهامشي المتسلسل واستراتيجية تكييف منخفضة الرتبة لكل فئة كفؤة في استهلاك الموارد لتحقيق أداء وكفاءة متفوقين في ظل قيود الموارد.

Heqiang Wang, Weihong Yang, Zheyuan Yang, Jia Zhou, Xiaoxiong Zhong, Fangming Liu, Weizhe Zhang2026-05-26
🤖 AI

A World Model of Radiologist Reading for Medical Image Representation Learning

تُعد GazeWorld نموذجاً عالمياً للتصوير الطبي يستفيد من بيانات تتبع حركة عين أخصائي الأشعة للتنبؤ بالتتابعات الذاتية للتمثيلات الصورية الكامنة، محققةً دقة تشخيصية وأداءً في التعلم الصفري من الطراز الرفيع عبر تعلم كيفية قراءة الخبراء للصور بدلاً من مجرد ما يخلصون إليه.

Yiwei Li, Zihao Wu, Huaqin Zhao, Yifan Zhou, Chao Cao, Dajiang Zhu, Tianming Liu, Lin Zhao2026-05-26
🤖 AI

Nano World Models: A Minimalist Implementation of Future Video Prediction

تقدم هذه الورقة "نماذج العالم النانوية" (Nano World Models)، وهي عبارة عن كود برمجي بسيط وقابل لإعادة الإنتاج مبني على تقنية "الانتشار القسري" (diffusion forcing)، يوحد مختلف مكونات التنبؤ بالفيديو لتمكين الدراسات العلمية المنضبطة حول خيارات تصميم نماذج العالم عبر بيئات متنوعة.

Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz2026-05-26
🤖 AI

Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL

تقترح الورقة البحثية إطار عمل Diff-Instruct مع المكافأة المنتشرة (DIDR)، وهو إطار عمل خالٍ من البيانات يعمل على مواءمة مولدات الصور ذات الخطوة الواحدة مع التفضيلات البشرية من خلال نشر التوزيعات المائلة للمكافأة عبر مسار الانتشار، محققاً كفاءة ودقة صور فائقتين مقارنة بالنماذج المرجعية الحالية وحتى المعلمين متعدد الخطوات.

Junyi Wu, Weijian Luo, Haoyang Zheng, Runzhe Zhang, Guang Lin Haoyang Zheng Runzhe Zhang Guang Lin2026-05-26
🤖 AI

Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving

تقترح الورقة البحثية إطار عمل "التفكير-التخيل-التنفيذ" (RIA)، وهو إطار عمل مغلق الحلقة يدمج نموذج لغوي كبير للتعليل مع نموذج عالم مشروط بالفعل لتمكين التحقق من السلامة عبر الإنترنت وتحسين أداء اتخاذ القرار بشكل كبير في القيادة الذاتية.

Zhengqi Sun, Yiwen Sun, Boxuan Liu, Tailai Chen, Tianxu Guo, Jiabin Liu2026-05-26