💻 computer science

RAWDet-7: A Multi-Scenario Benchmark for Object Detection and Description on Quantized RAW Images

تقدم الورقة البحثية RAWDet-7، وهو معيار مرجعي واسع النطاق ومتعدد السيناريوهات يتميز بصور RAW مكممة ذات تعليقات توضيحية كثيفة، مصمم لتقييم قدرات اكتشاف الأشياء ووصفها مع دراسة الحفاظ على المعلومات تحت قيود عمق بت مختلفة.

Mishal Fatima, Shashank Agnihotri, Kanchana Vaishnavi Gandikota, Michael Moeller, Margret Keuper2026-02-11
🤖 AI

Entropy-Aware Structural Alignment for Zero-Shot Handwritten Chinese Character Recognition

تقترح الورقة البحثية شبكة محاذاة هيكلية واعية بالإنتروبيا للتعرف على الرموز الصينية المكتوبة بخط اليد في ظروف التعلم الصفري، والتي تستخدم أولويات إنتروبيا المعلومات، وأشجار الجذور ثنائية الرؤية، ودمج السمات الدلالية من نوع (top-K) لالتقاط الهياكل الهرمية وسد الفجوة بين المرئي والدلالي.

Qiuming Luo, Tao Zeng, Feng Li, Heming Liu, Rui Mao, Chang Kong2026-02-11
🤖 machine learning

Understanding Image2Video Domain Shift in Food Segmentation: An Instance-level Analysis on Apples

تُظهر هذه الورقة أن نماذج تقسيم الأطعمة المدربة على الصور الثابتة تفشل في الحفاظ على الاتساق الزمني في الفيديو بسبب تغيرات المظهر مثل الإضاءة والانعكاسات، مما يكشف أن مقاييس الصور التقليدية تبالغ بشكل كبير في تقدير أدائها في العالم الحقيقي لمهام مثل عدّ الكائنات.

Keonvin Park, Aditya Pal, Jin Hong Mok2026-02-11
🔢 mathematics

Automatic regularization parameter choice for tomography using a double model approach

تقترح هذه الورقة طريقة مبتكرة للاختيار التلقائي لمعلمة التنظيم للتصوير المقطعي بالأشعة السينية، تستخدم خوارزمية تحكم بالتغذية الراجعة للموازنة بين دقة البيانات والمعلومات المسبقة من خلال مقارنة عمليات إعادة البناء من تمثيلين حسابيين مختلفين.

Chuyang Wu, Samuli Siltanen2026-02-11
💻 computer science

ALIVE: Animate Your World with Lifelike Audio-Video Generation

يُعد ALIVE نموذجاً من الجيل الجديد يعمل على تطويع بنيات "النص إلى الفيديو" سابقة التدريب إلى إطار عمل موحد قادر على توليد فيديو وصوت من النص، وتوليد فيديو وصوت من مرجع (رسوم متحركة) بجودة عالية، وذلك من خلال بنية MMDiT مُعززة ومسار بيانات متخصص.

Ying Guo, Qijun Gan, Yifu Zhang, Jinlai Liu, Yifei Hu, Pan Xie, Dongjun Qian, Yu Zhang, Ruiqi Li, Yuqi Zhang, Ruibiao Lu (…)2026-02-11
💻 computer science

MOVA: Towards Scalable and Synchronized Video-Audio Generation

إن MOVA هو نموذج مفتوح المصدر، بـ 32 مليار معلمة من نوع "خليط الخبراء" (Mixture-of-Experts)، مصمم لتوليد الصور والنصوص والفيديو والصوت بشكل قابل للتوسع ومتزامن، مما يوفر محتوى متعدد الوسائط عالي الجودة بما في ذلك الكلام المتزامن مع حركة الشفاه والمؤثرات الصوتية المدركة للبيئة المحيطة.

OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhan (…)2026-02-11
🤖 AI

GEBench: Benchmarking Image Generation Models as GUI Environments

يُعد GEBench معياراً جديداً ومقياساً متعدد الأبعاد (GE-Score) صُمم لتقييم قدرة نماذج توليد الصور على إنتاج انتقالات حالات واجهة المستخدم الرسومية (GUI) متماسكة زمنياً ومتسقة منطقياً عبر التفاعلات أحادية الخطوة ومتعددة الخطوات.

Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Da (…)2026-02-11
🤖 AI

Distributed Hybrid Parallelism for Large Language Models: Comparative Study and System Design Guide

تقدم هذه الورقة تحليلاً نظرياً وعملياً شاملاً للتوازي الهجين الموزع للنماذج اللغوية الكبيرة، حيث توفر أطرًا رياضية، ومبادئ تصميمية لتحسين التداخل بين الاتصال والحوسبة، ودراسات حالة تجريبية لتوجيه عملية اختيار استراتيجيات التدريب والاستدلال الفعالة.

Hossam Amer, Rezaul Karim, Ali Pourranjbar, Weiwei Zhang, Walid Ahmed, Boxing Chen2026-02-11
💻 computer science

SemanticMoments: Training-Free Motion Similarity via Third Moment Features

لمعالجة فشل النماذج الحالية في الفصل بين الحركة والمظهر، يقترح المؤلفون **SemanticMoments**، وهو منهج لا يتطلب تدريباً يحقق استرجاعاً فائقاً للفيديو بناءً على الحركة عبر حساب الإحصاءات الزمنية من الرتب العليا فوق الميزات الدلالية سابقة التدريب.

Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady2026-02-11
🤖 machine learning

Decoding Future Risk: Deep Learning Analysis of Tubular Adenoma Whole-Slide Images

تتقصى هذه الدراسة ما إذا كانت خوارزميات التعلم العميق، وتحديداً الشبكات العصبية الالتفافية، قادرة على تحديد السمات النسيجية الدقيقة في الصور الكاملة للشرائح لكتل الورم الغدي الأنبوبي منخفض الدرجة للتنبؤ بالمخاطر طويلة المدى لإصابة المريض بسرطان القولون والمستقيم.

Ahmed Rahu, Brian Shula, Brandon Combs, Aqsa Sultana, Surendra P. Singh, Vijayan K. Asari, Derrick Forchetti2026-02-11