🤖 machine learning

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

تقدم هذه الورقة البحثية طريقة "تحسين أخذ العينات الخاص بك" (OYS)، وهي طريقة لا تتطلب تدريباً تستخدم التحسين البايزي لضبط الخطوات الزمنية لأخذ عينات نماذج الانتشار بشكل مباشر، مما يقلل تكاليف الاستدلال بشكل كبير مع الحفاظ على جودة توليد عالية عبر مختلف المهام وأدوات أخذ العينات.

Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger2026-08-19
🤖 machine learning

DirMixE: Harnessing Test Agnostic Long-tail Recognition with Hierarchical Label Variations

تقترح الورقة البحثية إطار عمل DirMixE، وهو إطار عمل هرمي لخليط من الخبراء (Mixture-of-Experts) يعالج مشكلة التعرف على التوزيعات طويلة الذيل غير المرتبطة بالاختبار عبر نمذجة تغيرات توزيع الملصقات على المستويين العالمي والمحلي من خلال توزيعات ميتـا ديريشليه (Dirichlet meta-distributions)، والمتكامل مع نهج ضبط دقيق للمهارات الكامنة (Latent Skill Finetuning) لتحسين القدرة على التعميم واستقرار الأداء عبر سيناريوهات الاختبار المتنوعة وغير المتوازنة.

Zhiyong Yang, Qianqian Xu, Sicong Li, Zitai Wang, Xiaochun Cao, Qingming Huang2026-08-18
🤖 AI

TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization Ability

تقترح الورقة البحثية إطار عمل TIMA، وهو إطار عمل مبتكر يعزز المتانة الخصومية في حالة التعلم الصفري مع الحفاظ على القدرة على التعميم في النماذج التأسيسية مثل CLIP، وذلك من خلال تقديم ضبط الصور الواعي بالنص مع هامش تكيفي واعٍ دلاليًا لمعايرة هوامش اللوجيت، وضبط النصوص الواعي بالصور مع طاقة كروية دنيا متسقة دلاليًا للحفاظ على الاتساق الدلالي.

Fengji Ma, Hei Victor Cheng, Chenxing Li, Li Liu2026-08-18
🤖 AI

MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4

تقدم هذه الورقة البحثية MiniGPT-Reverse-Designing، وهو نموذج MiniGPT-4 تم ضبطه بدقة لتوسيع قدرات الرؤية واللغة لتشمل المهمة المعقدة المتمثلة في التنبؤ بتعديلات الصور ومعاييرها بناءً على صورة مصدر، ونسخة معدلة، وأوصاف نصية اختيارية.

Vahid Azizi, Fatemeh Koochaki2026-08-18
💻 computer science

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

يُعد GestureLSM إطار عمل مبتكرًا قائمًا على مطابقة التدفق (flow-matching) يعمل على توليد إيماءات جسدية كاملة عالية الجودة ومتماسكة متزامنة مع الكلام، وذلك من خلال نمذجة التفاعلات المكانية والزمانية بين مناطق الجسم وإدخال تعلم الاختصار الكامن لتسريع سرعة الاستنتاج بشكل كبير مقارنة بالطرق الحالية.

Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu2026-08-18
🤖 machine learning

Helios 2.0: A Robust, Ultra-Low Power Gesture Recognition System Optimised for Event-Sensor based Wearables

يقدم البحث نظام Helios 2.0، وهو نظام كاميرا أحداث فائق انخفاض استهلاك الطاقة (6-8 ميلي واط) للنظارات الذكية يحقق دقة رائدة في التعرف على الإيماءات (درجة F1 تزيد عن 80%) باستخدام البيانات الاصطناعية والإيماءات الدقيقة الطبيعية فقط، مما يمثل انخفاضاً في استهلاك الطاقة بمقدار 25 ضعفاً وتحسناً في الدقة بنسبة 20% مقارنة بالحلول الحالية.

Prarthana Bhattacharyya, Joshua Mitton, Ryan Page, Owen Morgan, Oliver Powell, Benjamin Menzies, Gabriel Homewood, Kemi (…)2026-08-18
💻 computer science

EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation

تقدم هذه الورقة البحثية إطار عمل EchoMask، وهو إطار عمل مبتكر يحسن توليد إيماءات الكلام الشاملة من خلال توظيف وحدة محاذاة الحركة والصوت وآلية انتباه مستعلم عنها عبر الكلام لحجب إطارات الحركة ذات الأهمية الدلالية بشكل انتقائي بناءً على سمات الكلام، مما يجعله يتفوق على الأساليب الحالية الرائدة.

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu2026-08-18
💻 computer science

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

تقدم هذه الورقة البحثية MME-VideoOCR، وهو معيار شامل يضم 25 مهمة عبر 44 سيناريو فيديو لتقييم قدرات التعرف الضوئي على الحروف (OCR) في النماذج اللغوية الكبيرة متعددة الوسائط، كاشفةً أن النماذج الحالية الرائدة تعاني من صعوبات في الفهم الشامل للفيديو، والاستدلال المكاني الزماني، والتكامل عبر الإطارات، رغم تحقيق دقة تبلغ 73.7% فقط حتى مع الأنظمة الأفضل أداءً.

Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting (…)2026-08-18
🤖 machine learning

FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens

يقدم FuseLIP بنية تضمين متعددة الوسائط مبتكرة تستفيد من أجهزة ترميز الصور المنفصلة لتوحيد معالجة النصوص والصور ضمن نموذج محول واحد عبر الاندماج المبكر، مما يتيح تفاعلات أكثر ثراءً بين الوسائط ويتفوق على نهج الاندماج المتأخر التقليدي عبر مختلف مهام التضمين.

Christian Schlarmann, Francesco Croce, Nicolas Flammarion, Matthias Hein2026-08-18
💻 computer science

Vision-Based Calorie Estimation for Bangladeshi Street Food: A Comparative Study of Detection and Regression Models

تقدم هذه الورقة نظاماً لتقدير السعرات الحرارية القائم على الرؤية الحاسوبية والمصمم خصيصاً لأطعمة الشوارع في بنغلاديش، والذي يجمع بين نموذج الكشف YOLO11n عالي الأداء وانحدار الغابة العشوائية (Random Forest regression)، مستخدماً عملة معدنية من فئة 5 تاكا كمرجع للمقياس لتحقيق متوسط دقة (mAP) بنسبة 96.1% ومعامل تحديد (R²) بنسبة 95.0% على مجموعة بيانات مملوكة خاصة تتكون من 3,885 صورة.

Aparup Dhar, Antu Das, Pritom Barua, MD Tamim Hossain2026-08-18