💻 computer science

Escaping The Big Data Paradigm in Self-Supervised Representation Learning

تقدم هذه الورقة SCOTT، وهو مُرمز تلافيفي متناثر مدمج مع إطار تدريب MIM-JEPA، مما يمكّن نماذج المحولات الرؤيوية (Vision Transformers) من تعلم تمثيلات ذاتية الإشراف قوية من الصفر على مجموعات بيانات صغيرة النطاق ودقيقة التفاصيل، وبالتالي يتحدى ضرورة البيانات الضخمة والموارد الحسابية الهائلة لتعلم التمثيلات الرؤيوية الفعالة.

Carlos Vélez García, Miguel Cazorla, Jorge Pomares2026-03-09
💻 computer science

NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers

تقدم الورقة البحثية NAMI، وهو إطار عمل لمحول تدفق مستقيم جسري متدرج (Bridged Progressive Rectified Flow Transformer) يعمل على تسريع توليد الصور بشكل كبير وتقليل وقت الاستدلال بنسبة 64% من خلال بنية متسلسلة مكانياً متعددة الدقة مع وحدة BridgeFlow، مع الحفاظ على جودة رائدة وتقديم معيار NAMI-1K للتقييم.

Yuhang Ma, Bo Cheng, Shanyuan Liu, Hongyi Zhou, Liebucha Wu, Dawei Leng, Yuhui Yin2026-03-09
💻 computer science

ECLARE: Efficient cross-planar learning for anisotropic resolution enhancement

تُعد ECLARE طريقة مفتوحة المصدر للتعلم الذاتي لرفع دقة الصور، تعمل على تحسين أحجام الرنين المغناطيسي ثنائية الأبعاد متباينة الخواص من خلال تقدير مقاطع الشرائح وتعلم خرائط المستوى الداخلي دون بيانات خارجية، مما يتغلب على انزياح النطاق ويتفوق على التقنيات الحالية في كل من استعادة الإشارة والمهام اللاحقة.

Samuel W. Remedios, Shuwen Wei, Shuo Han, Jinwei Zhang, Aaron Carass, Kurt G. Schilling, Dzung L. Pham, Jerry L. Prince (…)2026-03-09
💻 computer science

Evaluating quality metrics through the lenses of psychophysical measurements of low-level vision

تقدم هذه الورقة إطار عمل جديد للاختبارات النفسية الفيزيائية القائم على مبادئ الرؤية منخفضة المستوى — وتحديداً حساسية التباين، والقناع، والمطابقة — لتقييم وكشف نقاط القوة والضعف الإدراكي لـ 34 مقياساً حالياً لجودة الصور والفيديو، مما يثبت أن بروتوكولات التقييم القياسية غالباً ما تفشل في استيعاب هذه الخصائص البصرية البشرية الأساسية.

Dounia Hammou, Yancheng Cai, Pavan Madhusudanarao, Christos G. Bampis, Rafał K. Mantiuk2026-03-09
🤖 AI

Maximizing Asynchronicity in Event-based Neural Networks

تقدم هذه الورقة البحثية EVA، وهو إطار عمل جديد للتحويل من غير متزامن إلى متزامن (A2S) على مستوى الحدث مستوحى من نمذجة اللغة، والذي يولد سمات عالية التعبير، متفوقاً بذلك على الأساليب السابقة في مهام التعرف ومحققاً نتائج هي الأفضل في مجالها في اكتشاف الأحداث للرؤية القائمة على الأحداث.

Haiqing Hao, Nikola Zubić, Weihua He, Zhipeng Sui, Davide Scaramuzza, Wenhui Wang2026-03-09
💻 computer science

BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation

تقدم هذه الورقة البحثية BusterX، وهو إطار عمل مدعوم بنماذج اللغات الكبيرة متعددة الوسائط (MLLM) للكشف عن تزييف الفيديو الناتج عن الذكاء الاصطناعي، والذي يجمع بين مجموعة بيانات GenBuster-200K الشاملة واختبار GenBuster-Bench متعدد المسارات للانتقال من التصنيف القائم على الصندوق الأسود إلى الاستدلال البصري القابل للتفسير، محققاً دقة فائقة وجودة تفسيرية متفوقة مقارنة بالنماذج الرائدة.

Haiquan Wen, Yiwei He, Zhenglin Huang, Tianxiao Li, Zihan Yu, Xingru Huang, Lu Qi, Baoyuan Wu, Xiangtai Li, Guangliang C (…)2026-03-09
💻 computer science

Alchemist: Turning Public Text-to-Image Data into Generative Gold

تقدم هذه الورقة "Alchemist"، وهي منهجية مبتكرة تسخر النماذج التوليدية مسبقة التدريب لتقويم مجموعة بيانات ضبط دقيق مُشرف عليه، مدمجة وعالية الجودة وذات أغراض عامة، مما يعزز بشكل كبير الجودة الجمالية والمواءمة لنماذج تحويل النص إلى صورة العامة مع الحفاظ على التنوع.

Valerii Startsev, Alexander Ustyuzhanin, Alexey Kirillov, Dmitry Baranchuk, Sergey Kastryulin2026-03-09
💻 computer science

Instance Data Condensation for Image Super-Resolution

تقدم هذه الورقة البحثية تكثيف بيانات العينات (IDC)، وهو إطار عمل مبتكر يستخدم استخراج ميزات فوريه المحلية العشوائية ومطابقة توزيع الميزات متعدد المستويات لتخليق مجموعة بيانات مدمجة للغاية (10% من الحجم) لغرض تحسين دقة الصور (Image Super-Resolution)، تحقق أداءً مماثلاً لمجموعة البيانات الأصلية الكاملة مع تقليل المتطلبات الحسابية والتخزينية بشكل كبير.

Tianhao Peng, Ho Man Kwan, Yuxuan Jiang, Ge Gao, Fan Zhang, Xiaozhong Xu, Shan Liu, David Bull2026-03-09
💻 computer science

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

يُعد VisualPrompter إطار عمل مبتكرًا لا يتطلب تدريبًا، يعمل على تعزيز عملية توليد الصور من النصوص عبر توظيف وحدة للتأمل الذاتي لتحديد المفاهيم المفقودة وآلية تحسين دقيقة لتنقيح المطالبات، مما يحقق توافقًا دلاليًا فائقًا بين أوصاف المستخدم والصور المُولدة.

Shiyu Wu, Mingzhen Sun, Weining Wang, Yequan Wang, Jing Liu2026-03-09
🤖 machine learning

SPoT: Subpixel Placement of Tokens in Vision Transformers

تقدم الورقة البحثية SPoT، وهي استراتيجية ترميز مبتكرة تضع رموز محول الرؤية (Vision Transformer) بشكل مستمر داخل الصور عبر بحث موجه من قِبل نموذج مثالي (oracle) للتغلب على قيود الشبكة، مما يقلل بشكل كبير من عدد الرموز المطلوبة مع تحسين الأداء والقابلية للتفسير.

Martine Hjelkrem-Tan, Marius Aasan, Gabriel Y. Arteaga, Adín Ramírez Rivera2026-03-09