🤖 AI

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

تقترح الورقة البحثية إطار عمل SAGE-GRPO، وهو إطار للتعلم المعزز مدرك للمتعددات (manifold-aware) يعمل على تقييد الاستكشاف ضمن المتعدد (manifold) الصالح لبيانات الفيديو من خلال تصحيحات الانحناء على المستوى الدقيق ومناطق الثقة المزدوجة على المستوى الكلي، مما يؤدي إلى استقرار التدريب وتحسين جودة توليد الفيديو وتعظيم المكافأة بشكل كبير مقارنة بالطرق الحالية.

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo (…)2026-03-24
⚡ electrical engineering

A Latent Representation Learning Framework for Hyperspectral Image Emulation in Remote Sensing

تقترح هذه الورقة إطار عمل لتعلم التمثيل الكامن يحاكي بكفاءة الصور فائقة الطيف بدقة طيفية عالية وواقعية مكانية، متفوقاً بذلك على النماذج التقليدية ومثبتاً فائدته العملية لتططبيقات الاستشعار عن بعد اللاحقة.

Chedly Ben Azizi, Claire Guilloteau, Gilles Roussel, Matthieu Puigt2026-03-24
🤖 machine learning

The Golden Subspace: Where Efficiency Meets Generalization in Continual Test-Time Adaptation

تقترح الورقة البحثية GOLD، وهي طريقة للتكيف المستمر في وقت الاختبار تعالج المقايضة بين الكفاءة والتعميم من خلال إسقاط الميزات ديناميكيًا على "فضاء فرعي ذهبي" مشتق نظريًا باستخدام تقدير حاصل الضرب الخارجي لمتوسط التدرج لكل عينة ومهايئات خفيفة الوزن لتحقيق أداء فائق مع حد أدنى من تحديثات المعلمات.

Guannan Lai, Da-Wei Zhou, Zhenguo Li, Han-Jia Ye2026-03-24
🤖 AI

SegMaFormer: A Hybrid State-Space and Transformer Model for Efficient Segmentation

تعد SegMaFormer بنية هجينة خفيفة الوزن تجمع استراتيجياً بين طبقات قائمة على نموذج Mamba للمعالجة الفعالة في المراحل المبكرة ووحدات Transformer للتحسين في المراحل اللاحقة، محققةً أداءً تنافسياً في تقسيم الصور الطبية ثلاثية الأبعاد بمعلمات أقل بنسبة تصل إلى 75 ضعفاً مقارنة بالنماذج الرائدة.

Duy D. Nguyen, Phat T. Tran-Truong2026-03-24
🤖 AI

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

تقدم الورقة البحثية 3D-Layout-R1، وهو إطار عمل للاستدلال المهيكل يستفيد من تمثيلات الرسوم البيانية للمشهد لتمكين التحرير المكاني الموجه باللغة مع تحسين كبير في اتساق وتنسيق المخطط مقارنة بالنماذج المرجعية الحالية.

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan2026-03-24
💬 NLP

ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model

تقترح الورقة البحثية "ThinkJEPA"، وهو إطار عمل مبتكر يعزز نماذج العالم الكامنة من خلال دمج فرع JEPA كثيف للتنبؤ بالحركة دقيق التفاصيل مع فرع "مفكر" (thinker) يعتمد على نموذج لغوي بصري (VLM) يتم أخذ عينات منه بشكل موحد لتوفير توجيه دلالي طويل الأمد، مما يتغلب على قيود الاستقراء المحلي وأخذ العينات المتناثر لتحقيق تنبؤ بالمسار أكثر قوة.

Haichao Zhang, Yijiang Li, Shwai He, Tushar Nagarajan, Mingfei Chen, Jianglin Lu, Ang Li, Yun Fu2026-03-24
💬 NLP

WorldCache: Content-Aware Caching for Accelerated Video World Models

يُعد WorldCache إطار عمل للتخزين المؤقت الديناميكي خاليًا من التدريب ومقيدًا بالإدراك، يعمل على تسريع نماذج عالم الفيديو القائمة على محولات الانتشار (Diffusion Transformers) عبر إدخال عتبات متكيفة مع الحركة وتشويه الميزات (feature warping) لتحقيق تسريع في الاستدلال بمقدار 2.3 ضعف مع الحفاظ على 99.4% من جودة النموذج الأساسي والقضاء على آثار الشبحية (ghosting artifacts).

Umair Nawaz, Ahmed Heakl, Ufaq Khan, Abdelrahman Shaker, Salman Khan, Fahad Shahbaz Khan2026-03-24
💻 computer science

EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation

تقدم هذه الورقة البحثية EgoSpot، وهو إطار عمل مبتكر للتحكم متعدد الوسائط بدون استخدام اليدين لروبوت Boston Dynamics Spot، يدمج بين نظرات العين، وإيماءات الرأس، والأوامر الصوتية عبر HoloLens 2 لتمكين التحكم الطبيعي والميسّر في المناورة المتنقلة للمستخدمين ذوي الإعاقات الجسدية، محققاً أداءً يضاهي التحكم التقليدي القائم على عصا التحكم.

Ganlin Zhang, Deheng Zhang, Longteng Duan, Guo Han, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Eric Vollenweider2026-03-23
💻 computer science

A Survey of AI-Generated Video Evaluation

تقدم هذه الدراسة الاستقصائية مجال تقييم الفيديو المُنشأ بواسطة الذكاء الاصطناعي (AIGVE) الناشئ من خلال التحليل المنهجي للمنهجيات القائمة، وتحديد الفجوات الحالية، والدعوة إلى أطر تقييم قوية ومتعددة الأوجه تعالج التعقيدات المكانية والزمانية الفريدة لمحتوى الفيديو المُنشأ بواسطة الذكاء الاصطناعي.

Xiao Liu, Xinhao Xiang, Zizhong Li, Yongheng Wang, Zhuoheng Li, Zhuosheng Liu, Weidi Zhang, Weiqi Ye, Jiawei Zhang2026-03-23
🤖 machine learning

AtGCN: A Graph Convolutional Network For Ataxic Gait Detection

تقدم هذه الورقة البحثية AtGCN، وهي شبكة تلافيفية رسومية خفيفة الوزن تستفيد من التدريب المسبق، وتجزئة دورة المشية، والتلافيف الزمكانية المتخصصة لتحقيق دقة متطورة في اكتشاف وتصنيف مشية الرنح من مجموعات بيانات الفيديو ثنائية الأبعاد صغيرة النطاق.

Karan Bania, Tanmay Verlekar2026-03-23