💻 computer science

MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning

تقدم الورقة البحثية MomaGraph، وهو تمثيل موحد لمخطط المشهد مدرك للحالة، ومجموعة بيانات وتقييم واسعة النطاق متوافقين معه، إلى جانب MomaGraph-R1، وهو نموذج لغوي بصري يستفيد من هذه الموارد لتحقيق أداء رائد في التنبؤ بمخطط المشهد الموجه للمهام وتخطيط المهام المتجسدة.

Yuanchen Ju, Yongyuan Liang, Yen-Jen Wang, Nandiraju Gireesh, Yuanliang Ju, Seungjae Lee, Qiao Gu, Elvis Hsieh, Furong H (…)2026-02-10
🤖 AI

SuperiorGAT: Graph Attention Networks for Sparse LiDAR Point Cloud Reconstruction in Autonomous Systems

يُعد SuperiorGAT إطار عمل يعتمد على انتباه الرسوم البيانية، يقوم بإعادة بناء بيانات الارتفاع المفقودة في سحب نقاط ليدار (LiDAR) المتفرقة من خلال نمذجة عمليات المسح كرسوم بيانية مدركة للحزم، مما يوفر طريقة فعالة حاسبياً لتحسين دقة المستشعر دون الحاجة إلى أجهزة إضافية.

Khalfalla Awedat, Mohamed Abidalrekab, Gurcan Comert, Mustafa Ayad2026-02-10
🤖 AI

Towards Spatio-Temporal Extrapolation of Phase-Field Simulations with Convolution-Only Neural Networks

تقدم هذه الورقة نموذجاً بديلاً من نوع (U-Net) تلافيفياً بالكامل وسريعاً، معززاً بالانتشار الشرطي للتهيئة وميزات هيكلية متخصصة، مما يتيح استقراءً مكانياً-زمانياً عالي الكفاءة لمحاكاة حقل الطور لعملية إزالة السبائك في المعادن السائلة بتكاليف حوسبة منخفضة بشكل كبير ودقة فيزيائية عالية.

Christophe Bonneville, Nathan Bieberdorf, Pieterjan Robbe, Mark Asta, Habib Najm, Laurent Capolungo, Cosmin Safta2026-02-10
🤖 AI

Moonworks Lunara Aesthetic Dataset

تُعد مجموعة بيانات "Moonworks Lunara Aesthetic" مجموعة عالية الجودة، مرخصة بموجب رخصة "Apache 2.0"، وتضم صوراً مُولدة بواسطة الذكاء الاصطناعي تتميز بأنماط فنية وإقليمية متنوعة، مصحوبة بتعليقات توضيحية دقيقة تم تنقيحها بشرياً لدعم الأبحاث الدقيقة والاستخدام التجاري.

Yan Wang, Sayeef Abdullah, Partho Hassan, Sabit Hassan2026-02-10
⚡ electrical engineering

W-DUALMINE: Reliability-Weighted Dual-Expert Fusion With Residual Correlation Preservation for Medical Image Fusion

إن W-DUALMINE هو إطار عمل لدمج الخبراء المزدوجين بوزن الموثوقية، والذي يحل المفاضلة بين التشابه الإحصائي العالمي والدقة الهيكلية المحلية في دمج الصور الطبية من خلال وزن الأنماط التكيفي، واستراتيجية الخبير مزدوج النطاق، ونموذج دمج المتبقي إلى المتوسط.

Md. Jahidul Islam2026-02-10
💻 computer science

Visual Prompt-Agnostic Evolution

لمعالجة ديناميكيات التدريب غير المستقرة وعدم التوافق بين الطبقات في الضبط الدقيق للمطالبات البصرية (Visual Prompt Tuning)، تقترح الورقة البحثية "التطور غير المرتبط بالمطالبة" (Prompt-Agnostic Evolution - PAE)، وهي طريقة تعمل على تثبيت تعلم المطالبات من خلال استخدام التهيئة في نطاق التردد، ومعامل كوبمان (Koopman operator) مشترك للتطور المتماسك عبر الطبقات، ومنظم استقرار مستوحى من نظرية ليابونوف (Lyapunov).

Junze Wang, Lei Fan, Dezheng Zhang, Weipeng Jing, Donglin Di, Yang Song, Sidong Liu, Cong Cong2026-02-10
💻 computer science

Moonworks Lunara Aesthetic II: An Image Variation Dataset

تقدم Moonworks مجموعة بيانات Lunara Aesthetic II، وهي مجموعة بيانات مُطلقة للعموم تتكون من 2,854 زوجاً من صور التباين ذات جمالية عالية ومستمدة من مصادر أخلاقية، صُممت لتقييم وتحسين الحفاظ على الهوية والاتساق السياقي في أنظمة توليد الصور وتحريرها.

Yan Wang, Partho Hassan, Samiha Sadeka, Nada Soliman, Sayeef Abdullah, Sabit Hassan2026-02-10
💻 computer science

SVD-ViT: Does SVD Make Vision Transformers Attend More to the Foreground?

يقترح SVD-ViT إطار عمل مبتكرًا يستخدم تحليل القيم المفردة من خلال ثلاثة مكونات متخصصة (SPC وSSVA وID-RSVD) لتثبيط ضوضاء الخلفية والشوائب، مما يمكن نماذج Vision Transformers من التركيز بشكل أكثر فعالية على سمات المقدمة لتحسين أداء التصنيف.

Haruhiko Murata, Kazuhiro Hotta2026-02-10
🤖 AI

DiGAN: Diffusion-Guided Attention Network for Early Alzheimer's Disease Detection

تقترح الورقة البحثية DiGAN، وهو إطار عمل مبتكر يجمع بين نمذجة الانتشار الكامن لتخليق مسارات التصوير العصبي الطولية مع شبكة تلافيفية موجهة بالانتباه لتحسين الكشف المبكر عن مرض ألزهايمر من بيانات سريرية محدودة وغير منتظمة.

Maxx Richard Rahman, Mostafa Hammouda, Wolfgang Maass2026-02-10
💻 computer science

When LLaVA Meets Objects: Token Composition for Vision-Language-Models

يُعد Mask-LLaVA إطار عمل يعمل على تحسين كفاءة النماذج اللغوية البصرية ذات التوليد الذاتي من خلال الجمع بين الرموز البصرية العالمية والمحلية والقائمة على القناع، مما يسمح بتقليل مرن في عدد الرموز البصرية أثناء الاستدلال دون فقدان ملحوظ في الأداء.

Soumya Jahagirdar, Walid Bousselham, Anna Kukleva, Hilde Kuehne2026-02-10