💻 computer science

MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers

تُعد MicroViTv2 نموذج محول رؤية (Vision Transformer) خفيف الوزن ومدرك للأجهزة، حيث يستفيد من المكونات المعاد تمثيلها (reparameterized components) وانتباه العمق المنقول الأحادي (Single Depth-Wise Transposed Attention) لتحقيق دقة وكفاءة طاقة فائقتين على أجهزة الحافة، مما يثبت أن التحسين من أجل الأداء في العالم الحقيقي أكثر أهمية من تقليل عمليات النقطة العائمة (FLOPs).

Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu, Wen-Kai Kuo, Jun-Wei Hsieh2026-08-27
🤖 AI

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

تقدم الورقة البحثية S-EMBER، وهو معيار مرجعي واسع النطاق يتكون من 388 ساعة من الفيديو من منظور الشخص الأول وما يقرب من 10,000 زوج من الأسئلة والأجوبة المصممة لتقييم وكشف الفجوة الكبيرة في أداء نماذج الذكاء الاصطناعي الحالية في استرجاع الذاكرة العرضية المتدفقة والمؤصلة للوكلاء القابلين للارتداء.

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Gho (…)2026-08-27
🤖 AI

VGI-Bench: Probing Visual Intelligence in Video Generation Models

تقدم هذه الورقة البحثية VGI-Bench، وهو معيار مرجعي شامل يتكون من 27 مهمة و810 نماذج مصممة لتقييم قدرات الاستنتاج البصري لنماذج توليد الفيديو بدقة، مما يكشف أن حتى الأنظمة المتطورة مثل Seedance 2.0 لا تحقق سوى 51.0% من الدقة وتواجه صعوبة في التصحيح الذاتي الموثوق أثناء عملية التوليد.

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songchen (…)2026-08-27
💻 computer science

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

تقدم هذه الورقة إطار العمل الهجين متعدد الوكلاء الهرمي (H²MAF)، الذي يدمج مخرجات مستوى القرار من EfficientNet-B3 وConvNeXt-Tiny مع التحكيم الدلالي بواسطة النماذج اللغوية الكبيرة متعددة الوسائط (Gemma 4 وQwen3.5) لتحقيق تشخيص دقيق وقابل للتفسير لأمراض النباتات عبر مجموعات بيانات معيارية وميدانية روبوتية واقعية.

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee2026-08-27
💻 computer science

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

تقدم هذه الدراسة إطار عمل متعدد الوسائط للرؤية واللغة، خفيف الوزن وقابل للنشر على الحافة، يعتمد على TinyCLIP، ويحقق تصنيفاً وتحديداً دقيقين وقابلين للتفسير للبنى التشريحية لثمار التفاح في مراحلها المبكرة (الكأس، والجسم، والعنق) لدعم عملية التخفيف الروبوتية والإدارة الدقيقة للبساتين.

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee2026-08-27
💻 computer science

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

يُعد GaussVLA نموذجاً للرؤية واللغة والعمل يعتمد على بنية Mamba وفعالية في استخدام المعلمات، حيث يعزز الاستدلال المكاني عبر تقديم مُرمز غاوسي مكاني (Gaussian Spatial Tokenizer) لتحويل الميزات ثنائية الأبعاد إلى رموز غاوسية ثلاثية الأبعاد مدمجة، ووحدة تسلسل أفكيمدركة للعمق (Depth-Aware Chain-of-Thought) للاستدلال الهندسي المنظم، محققاً أداءً هو الأفضل في فئته على معيار LIBERO بـ 200 مليون معلمة فقط.

Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn2026-08-27
💻 computer science

SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs

إنَّ SHIFT-LLM هو إطار عمل للتقليم اللاحق لا يتطلب تدريباً، يعمل على استعادة الدقة في النماذج اللغوية الكبيرة التي تم تقليم عمقها عن طريق إدراج محولات متبقية خطية خفيفة الوزن تمت معايرتها عبر الانحدار ذي الصيغة المغلقة لتصحيح التحولات التوزيعية الناتجة عن إزالة كتل المحولات (Transformer blocks).

Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen2026-08-27
💻 computer science

What Do Audio-Visual Synchronization Metrics Actually Measure?

تدقق هذه الورقة أربعة مقاييس شائعة لمزامنة الصوت والصورة بموجب بروتوكول موحد للموثوقية، كاشفةً أنها تقيس جوانب متميزة من المزامنة بدلاً من مفهوم موحد واحد، وتوصي بناءً على ذلك بالإبلاغ عن "بطاقة موثوقية" شاملة بدلاً من الاعتماد على درجة واحدة.

Jai Kumar Sharma, Peeyush Tapadiya2026-08-27
💻 computer science

See More, Detect Less? Taming Information Leakage in Multi-View Anomaly Detection

تقدم هذه الورقة البحثية إطار عمل GLAD، وهو إطار عمل مبتكر للكشف عن الشذوذ متعدد الرؤى يمنع "تسرب المعلومات عبر الرؤى" — حيث تقوم الإشارات الطبيعية من الرؤى السليمة بإعادة بناء المناطق الشاذة بشكل خاطئ — وذلك من خلال توظيف آلية انتباه عالمي-محلي لدمج الميزات الخاصة بكل رؤية بشكل انتقائي مع تقييد معلومات وحدة فك التشفير صراحةً للحفاظ على فجوة إعادة البناء الحرجة.

Shang-Fu Chen, Kuan-Chuan Peng, Jhih-Ciang Wu, Wen-Huang Cheng, Kai-Lung Hua2026-08-27
💻 computer science

What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift

تتقصى هذه الورقة أنماط الفشل في نماذج الرؤية واللغة الطبية تحت تأثير تحولات التوزيع، كاشفةً أن الكفاءة الظاهرية ضمن النطاق غالباً ما تخفي أوجه قصور حرجة في النقل البصري عبر مجموعات البيانات، والمحاذاة متعددة الوسائط، والقابلية للتأثر بالاختصارات المستمدة من البيانات الوصفية، مما يسلط الضوء على الحاجة إلى بروتوكولات تقييم صارمة ومختبرة بالإجهاد.

Ayoub Louaye Bouaziz, Lokmane Chebouba, Yassine Himeur2026-08-27