💻 computer science

CLAP Convolutional Lightweight Autoencoder for Plant Disease Classification

تقترح الورقة البحثية CLAP، وهو مشفر تلقائي خفيف الوزن يستخدم التلافيف القابلة للفصل وبوابة سيجمويد لتحقيق دقة تنافسية في تصنيف أمراض النباتات بأقل تكلفة حوسبية (5 ملايين معلمة) عبر مجموعات بيانات عامة متعددة.

Asish Bera, Subhajit Roy, Sudiptendu Banerjee2026-02-24
💻 computer science

Joint Post-Training Quantization of Vision Transformers with Learned Prompt-Guided Data Generation

تقدم هذه الورقة إطار عمل جديد للكمية المشتركة في مرحلة ما بعد التدريب لنماذج محولات الرؤية (Vision Transformers) يحقق دقة عالية في عدد البتات المنخفضة تضاهي أحدث ما توصل إليه العلم دون الحاجة إلى بيانات مصنفة، وذلك عبر الجمع بين تحسين النموذج الكامل واستراتيجية معايرة خالية من البيانات باستخدام نموذج "Stable Diffusion Turbo" بتوجيه من مطالبات متعددة الأنماط متعلمة.

Shile Li, Markus Karmann, Onay Urfalioglu2026-02-24
🔭 astrophysics

Characterization of Residual Morphological Substructure Using Supervised and Unsupervised Deep Learning

تقيم هذه الدراسة فعالية الشبكات العصبية التلافيفية الخاضعة للإشراف والمشفرات التلقائية التلافيفية المتغيرة غير الخاضعة للإشراف في توصيف البنى التحتية المتبقية للمجرات ضمن صور مسح "CANDELS"، حيث وجدت أنه بينما ينجح النموذج الخاضع للإشراف في ربط السمات الكامنة بمقاييس قوة البقايا الكمية، فإن النموذج غير الخاضع للإشراف يفتقر إلى قدرة تمييزية واضحة للتفريق بين أنواع البنى التحتية المختلفة.

Kameswara Bharadwaj Mantha, Daniel H. McIntosh, Cody Ciaschi, Rubyet Evan, Luther Landry, Henry C. Ferguson, Camilla Pac (…)2026-02-24
💻 computer science

Beyond Stationarity: Rethinking Codebook Collapse in Vector Quantization

تحدد هذه الورقة الطبيعة غير المستقرة لتحديثات المشفر باعتبارها السبب الجذري لانهيار دفتر الرموز في التكميم المتجه، وتقترح طريقتين مبتكرتين، NSVQ وTransVQ، لتحقيق استغلال كامل تقريبًا لدفتر الرموز وجودة إعادة بناء فائقة.

Hao Lu, Onur C. Koyun, Yongxin Guo, Zhengjie Zhu, Abbas Alili, Metin Nafi Gurcan2026-02-24
💻 computer science

SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model

تقدم هذه الورقة SCHEMA، وهي منهجية هندسة أوامر مهيكلة لنموذج Gemini 3 Pro Image من Google، والتي تستخدم نظاماً تصاعدياً ثلاثي المستويات وبنية نمطية لتحقيق معدلات امتثال عالية واتساق فائق عبر ستة مجالات احترافية بناءً على اختبارات تجريبية مكثفة.

Luca Cazzaniga2026-02-24
🤖 machine learning

PCA-VAE: Differentiable Subspace Quantization without Codebook Collapse

يقدم نموذج PCA-VAE بديلاً قابلاً للاشتقاق كلياً وخالياً من كتاب الأكواد لعملية التكميم المتجهي عبر توظيف عنق زجاجة لـ PCA عبر الإنترنت باستخدام قاعدة أوجا، مما يحقق جودة إعادة بناء فائقة وتفسيراً دلالياً مع عدد أقل بكثير من البتات الكامنة، بينما يقضي على مشكلات عدم الاستقرار وعدم القابلية للاشتقاق المتأصلة في طرق التكميم المتجهي التقليدية.

Hao Lu, Onur C. Koyun, Yongxin Guo, Zhengjie Zhu, Abbas Alili, Metin Nafi Gurcan2026-02-24
💻 computer science

Marginalized Bundle Adjustment: Multi-View Camera Pose from Monocular Depth Estimates

تقدم هذه الورقة البحثية "تعديل الحزمة الهامشي" (Marginalized Bundle Adjustment - MBA)، وهو أسلوب مبتكر يدمج بفعالية خرائط تقدير العمق أحادي العين (MDE) الكثيفة ولكن المشوبة بالضجيج في مسارات "البنية من الحركة" (Structure-from-Motion) لتحقيق استعادة رائدة لحالة وضع الكاميرا وهندسة المشهد عبر سيناريوهات متعددة الرؤية متنوعة.

Shengjie Zhu, Ahmed Abdelkader, Mark J. Matthews, Xiaoming Liu, Wen-Sheng Chu2026-02-24
⚡ electrical engineering

Face Presentation Attack Detection via Content-Adaptive Spatial Operators

تقدم هذه الورقة نموذج CASO-PAD، وهو نموذج خفيف الوزن يعتمد على صور RGB فقط للكشف عن هجمات عرض الوجه، والذي يعمل على تعزيز MobileNetV3 باستخدام مؤثرات مكانية متكيفة مع المحتوى (involution) لتحقيق دقة ومتانة تضاهى أحدث ما توصل إليه العلم ضد مختلف هجمات التزييف على الأجهزة المحمولة دون الحاجة إلى مستشعرات إضافية أو بيانات زمنية.

Shujaat Khan2026-02-24
💻 computer science

Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding

يقدم Frame2Freq عائلة من المهايئات الطيفية المدركة للتردد التي تستفيد من تحويل فوريه السريع لالتقاط الديناميكيات الزمنية متعددة المقاييس، مما يحسن فهم الفيديو دقيق التفاصيل بشكل كبير ويتفوق على الأساليب الحالية الموفرة للمعلمات والأساليب التي يتم ضبطها بالكامل عبر مجموعات بيانات متعددة.

Thinesh Thiyakesan Ponbagavathi, Constantin Seibold, Alina Roitberg2026-02-24
💻 computer science

MoBind: Motion Binding for Fine-Grained IMU-Video Pose Alignment

يُعد MoBind إطار عمل للتعلم التبايني الهرمي يحقق محاذاة زمنية دقيقة بين إشارات وحدة القياس بالقصور الذاتي (IMU) والوضعيات ثنائية الأبعاد المستمدة من الفيديو عبر تصفية الخلفيات المرئية، وتفكيك الحركة إلى مسارات محلية لأجزاء الجسم، واستخدام استراتيجية محاذاة متعددة المستويات للتفوق على النماذج المرجعية في مهام الاسترجاع عبر الوسائط، والمزامنة، والتحديد الموضعي، والتعرف على الأفعال.

Duc Duy Nguyen, Tat-Jun Chin, Minh Hoai2026-02-24