💻 computer science

SPARK-IL: Spectral Retrieval-Augmented RAG for Knowledge-driven Deepfake Detection via Incremental Learning

إن SPARK-IL هو إطار عمل استرجاع طيفي يعتمد على الاسترجاع المعزز، يجمع بين تحليل النطاق الترددي ثنائي المسار باستخدام شبكات كولموغوروف-أرنولد de (Kolmogorov-Arnold Networks) والتعلم التدريجي لتحقيق كشف قوي ومعمم للتزييف العميق عبر مختلف نماذج الصور المولدة بالذكاء الاصطناي.

Hessen Bougueffa Eutamene, Abdellah Zakaria Sellam, Abdelmalik Taleb-Ahmed, Abdenour Hadid2026-04-07
⚡ electrical engineering

Cost-Efficient Multi-Scale Fovea for Semantic-Based Visual Search Attention

تقدم هذه الورقة وحدة "المركز البصري متعدد المقاييس" (Multi-Scale Fovea) ذات التكلفة المنخفضة والمدمجة في إطار "الانتباه البايزي القائم على الدلالات" (SemBA)، والتي تحاكي حدة البصر لدى البشر من خلال مجال رؤية هرمي لتقليل التكاليف الحسابية بشكل كبير مع تحسين دقة التنبؤ بمسار المسح والواقعية البيولوجية في البحث البصري القائم على الدلالات.

João Luzio, Alexandre Bernardino, Plinio Moreno2026-04-07
💻 computer science

Task-Guided Multi-Annotation Triplet Learning for Remote Sensing Representations

تقترح هذه الورقة طريقة تعلم ثلاثيات متعددة التوسيم موجهة بالمهام، تعمل على تحسين تمثيلات الاستشعار عن بعد عبر الاختيار الديناميكي للثلاثيات المعلوماتية من خلال المعلومات المتبادلة، مما يلغي الحاجة إلى وزن الخسارة الثابت ويعزز أداء التصنيف والانحدار في المهام اللاحقة.

Meilun Zhou, Alina Zare2026-04-07
💻 computer science

Beyond Task-Driven Features for Object Detection

تقترح هذه الورقة إطار عمل لتعزيز الميزات بتوجيه من التوسيم، يقوم بحقن التضمينات في الهياكل العظمية لكشف الأشياء للتغلب على قيود الميزات المدفوعة بالمهام، مما يؤدي إلى تحسين متانة النموذج، وقابليته للتفسير، وقدرته على التعميم عبر أنظمة إشراف متنوعة.

Meilun Zhou, Alina Zare2026-04-07
💻 computer science

Training a Student Expert via Semi-Supervised Foundation Model Distillation

تقدم هذه الورقة إطار عمل لتقطير المعرفة شبه الموجه الذي يضغط نماذج الرؤية التأسيسية الثقيلة حاسوبياً إلى خبراء طلاب مدمجين وعاليي الأداء لتقسيم المثيل، وذلك من خلال الاستفادة من البيانات المحدلة والموسومة والبيانات غير الموسومة الوفيرة عبر عملية ثلاثية المراحل تتمحور حول التعلم التبايني للبيكسلات المدرك للمثيل.

Pardis Taghavi, Tian Liu, Renjie Li, Reza Langari, Zhengzhong Tu2026-04-07
💻 computer science

Learning 3D Reconstruction with Priors in Test Time

تقترح هذه الورقة إطار عمل للتحسين المقيد في وقت الاختبار يعزز نماذج المحولات متعددة الرؤية (multiview Transformers) لإعادة البناء ثلاثي الأبعاد من خلال التعامل مع وضعيات الكاميرا، والخصائص الداخلية، والعمق كقيود تحسين بدلاً من مدخلات معمارية، مما يحسن الأداء بشكل كبير عبر مختلف المعايير دون الحاجة إلى إعادة تدريب النموذج.

Lei Zhou, Haoyu Wu, Akshat Dave, Dimitris Samaras2026-04-07
🤖 AI

Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders

تقدم هذه الورقة أول دراسة منهجية للمشفرات التلقائية المتفرقة للفيديو (video Sparse Autoencoders)، حيث تقترح أهداف تباين مكاني-زماني وتجميع "ماتريوشكا" (Matryoshka grouping) للتغلب على فقدان التماسك الزماني للمشفرات التلقائية المتفرقة القياسية، مما يحقق أداءً فائقاً في التفسير، وتصنيف الأفعال، والاسترجاع.

Atahan Dokme, Sriram Vishwanath2026-04-07
🤖 machine learning

Supervised Dimensionality Reduction Revisited: Why LDA on Frozen CNN Features Deserves a Second Look

يحتوي النص المقدم على عنوان حول "تقليل الأبعاد الخاضع للإشراف" وملخص يصف نظام "إرسال مركبات النقل التشاركي"، مما يشير إلى عدم تطابق حيث لا يتوافق الملخص مع العنوان؛ ومع ذلك، فإن تلخيص محتوى الملخص يظهر أن الورقة تقترح إطار عمل للإرسال معايراً حسب النظام، وخالياً من التدريب، يقوم بتقسيم بيانات الرحلات التاريخية ومطابقة الظروف الحالية مع نظائر تاريخية لتقليل أوقات انتظار الركاب بنسبة 31.1% على بيانات سيارات الأجرة في مدينة نيويورك.

Indar Kumar, Girish Karhana, Sai Krishna Jasti, Ankit Hemant Lade2026-04-07
💻 computer science

Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection

تقترح هذه الورقة شبكة دمج هرمية بين النقاط والرقع (point-patch fusion network) مع كتاب رموز رقع تكيفي (adaptive patch codebook) للتغلب على قيود التعميم والحساسية للضوضاء في الطرق الحالية للكشف عن الشذوذ في الأشكال ثلاثية الأبعاد، مما يظهر أداءً فائقاً في كل من المعايير العامة ومجموعة بيانات صناعية تم إصدارها حديثاً تتميز بعيوب هندسية متنوعة.

Xueyang Kang, Zizhao Li, Tian Lan, Dong Gong, Kourosh Khoshelham, Liangliang Nan2026-04-07
💻 computer science

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

تقدم هذه الورقة البحثية "الطباعة متعددة الوسائط" (Multi-Modal Typography)، وهي دراسة منهجية تُظهر أن الهجمات الطباعية المنسقة عبر الوسائط على المدخلات الصوتية والبصرية والنصية تضعف بشكل كبير النماذج اللغوية الكبيرة الصوتية البصرية، محققةً معدل نجاح هجوم أعلى بكثير (83.43%) مقارنة بالهجمات أحادية الوسائط.

Tianle Chen, Deepti Ghadiyaram2026-04-07