💻 computer science

ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion

تُعد ERTACache إطار عمل مبدئي للتخزين المؤقت يعمل على تسريع استنتاج نماذج الانتشار من خلال التصحيح المشترك لأخطاء انزياح الميزات وتضخيم الخطوات عبر التنميط المتبقي، والضبط الديناميكي للخطوة الزمنية، والتقريب المغلق للخطأ.

Xurui Peng, Chenqian Yan, Hong Liu, Rui Ma, Fangmin Chen, Xing Wang, Zhihua Wu, Songwei Liu, Mingbao Lin2026-02-11
💻 computer science

VIMD: Monocular Visual-Inertial Motion and Depth Estimation

يُعد VIMD إطار عمل تعليمي معياري يحقق تقديرًا دقيقًا ومتينًا لعمق المتر الواحد أحادي العدسة من خلال الاستفوتادة من تتبع الحركة البصرية-القصورية القائم على MSCKF لتنقيح المقياس لكل بكسل بشكل تكراري بدلاً من الاعتماد على النماذج التآلفية العالمية.

Saimouli Katragadda, Guoquan Huang2026-02-11
💻 computer science

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

يقترح MoWM إطار عمل لخليط من نماذج العالم يعزز تخطيط العمل المجسد من خلال دمج التمثيلات الكامنة المدركة للحركة مع ميزات فضاء البكسل دقيقة التفاصيل لالتقاط كل من الديناميكيات المدمجة والتفاصيل المرئية ذات الصلة بالعمل.

Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li2026-02-11
💻 computer science

Hunyuan-GameCraft-2: Instruction-following Interactive Game World Model

يُعد Hunyuan-GameCraft-2 نموذجاً توليدياً جديداً لعوالم الألعاب يتيح تفاعلاً مرناً مدفوعاً بالتعليمات عبر استخدام آلية حقن مدفوعة بالنصوص لتحويل بيانات الفيديو واسعة النطاق إلى محاكاة تفاعلية متوافقة سببياً يتم التحكم فيها عبر اللغة الطبيعية، أو إشارات لوحة المفاتيح، أو الفأرة.

Junshu Tang, Jiacheng Liu, Jiaqi Li, Longhuang Wu, Haoyu Yang, Penghao Zhao, Siruis Gong, Xiang Yuan, Shuai Shao, Linfen (…)2026-02-11
💻 computer science

Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions

تقدم هذه الورقة إطار عمل PCI (التدخل المشروط بالوصف)، وهو إطار عمل لا يتطلب تدريباً يحلل متى "تستقر" مفاهيم محددة خلال عملية الانتشار عبر قياس نجاح إدراج المفهوم، مما يوفر في النهاية رؤى قابلة للتطبيق لتحسين تحرير الصور القائم على النصوص.

Ada Gorgun, Fawaz Sammani, Nikos Deligiannis, Bernt Schiele, Jonas Fischer2026-02-11
💻 computer science

Modified TSception for Analyzing Driver Drowsiness and Mental Workload from EEG

تقترح هذه الورقة بنية TSception معدلة تستخدم استراتيجية صقل زمني هرمي مكونة من خمس طبقات وآلية دمج ثنائية المرحلة لتعزيز الاستقرار والقدرة على التعميم عبر المهام للكشف عن خمول السائق والعبء الذهني القائم على تخطيط كهربائية الدماغ (EEG).

Gourav Siddhad, Anurag Singh, Rajkumar Saini, Partha Pratim Roy2026-02-11
💻 computer science

REFA: Real-time Egocentric Facial Animations for Virtual Reality

يقدم REFA نظاماً مبتكراً لتتبع تعبيرات الوجه في الوقت الفعلي وبشكل غير اقتحامي في الواقع الافتراضي باستخدام كاميرات الأشعة تحت الحمراء ومنهجية تعلم آلي قائمة على التقطير، تم تدريبها على مجموعة بيانات ضخمة ومتنوعة.

Qiang Zhang, Tong Xiao, Haroun Habeeb, Larissa Laich, Sofien Bouaziz, Patrick Snape, Wenjing Zhang, Matthew Cioffi, Peiz (…)2026-02-11
🤖 AI

Detecting and Mitigating Memorization in Diffusion Models through Anisotropy of the Log-Probability

تقترح هذه الورقة مقياساً جديداً وفعالاً للكشف عن الحفظ لنماذج الانتشار، يستفيد من المحاذاة الزاوية بين درجات التوجيه والدرجات غير المشروطة في نظام التباين المنخفض، مما يتيح كشفاً أسرع وتخفيفاً فعالاً مقارنة بالطرق الحالية.

Rohan Asthana, Vasileios Belagiannis2026-02-11
⚡ electrical engineering

EchoJEPA: A Latent Predictive Foundation Model for Echocardiography

يُعد EchoJEPA نموذجاً تأسيسياً واسع النطاق لتخطيط صدى القلب يستخدم هدفاً تنبؤياً كامناً لتعلم تمثيلات تشريحية مقاومة للضجيج، مما يتفوق بشكل كبير على النماذج الحالية في دقة التقدير السريري، وكفاءة العينات، والقدرة على التعميم عبر مجموعات متنوعة من المرضى.

Alif Munim, Adibvafa Fallahpour, Teodora Szasz, Ahmadreza Attarpour, River Jiang, Brana Sooriyakanthan, Maala Sooriyakan (…)2026-02-11
💻 computer science

ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask

يعتبر ConsisDrive نموذج عالم قيادة يحافظ على الهوية، ويستخدم الانتباه المقنع بالنماذج (instance-masked attention) والخسارة المقنعة بالنماذج (instance-masked loss) لضمان الاتساق الزمني للأجسام، محققاً جودة رائدة في توليد الفيديو وأداءً محسناً في مهام القيادة الذاتية.

Zhuoran Yang, Yanyong Zhang2026-02-11