💻 computer science

StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design

يُعد StepX-Edge نموذجاً لغوياً بصرياً يعمل على الأجهزة بـ 0.9 مليار معلمة، ويحقق فهماً فائقاً لواجهات المستخدم (UI) ونشراً فعالاً في الوقت الفعلي على شرائح الهواتف المحمولة من خلال تصميم مشترك مبتكر يجمع بين بنية مدركة لواجهات المستخدم، ومنهج تدريب تآزري مكون من خمس مراحل، واستراتيجية تكميم عالية الدقة.

Yin Wang, Haotian Hu, Jineng Han, Wentao Qiu, Zhenhua Ge, Liujian Tang, Fanyi Wang2026-07-28
🔬 optics

scMIR: a vision-language foundation model for single-cell light microscopy image representation

تقدم الورقة البحثية نموذج scMIR، وهو نموذج تأسيسي للرؤية واللغة تم تدريبه مسبقاً على أكثر من 200,000 زوج من الصور والنصوص، يجمع بشكل تآزري بين إعادة بناء الصور ذاتي الإشراف والمحاذاة عبر الوسائط الموجهة بالنص لتوليد تمثيلات موحدة لصور المجهر أحادية الخلية، مما يجعله يتفوق على الأساليب الحالية في التعميم والدقة عبر مهام التحليل المظهري المتنوعة دون الحاجة إلى ضبط دقيق خاص بالمهمة.

Yifan Shang (Department of Biomedical Engineering, The Chinese University of Hong Kong, Hong Kong, China, College of Com (…)2026-07-28
🤖 AI

Real-Time Semantic Segmentation with Optimized RetinaNet Architectures for Embedded Automotive Systems

تقدم هذه الورقة البحثية Opt-RetinaSeg، وهي بنية محسنة للتجزئة الدلالية مشتقة من RetinaNet، تستخدم عموداً فقرياً خفيف الوزن، وهيكلاً متسلسلاً (FPN) مبسطاً، ومسار تحسين ثلاثي المراحل لتحقيق أداء عالي الدقة وفي الوقت الفعلي على المنصات السياراتية المدمجة ذات الموارد المحدودة.

Sai Sidharth D2026-07-28
💻 computer science

Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework

تعالج هذه الورقة الفجوة في سلامة فيديوهات المحتوى المولد بواسطة الذكاء الاصطنا-التوليدي (AIGC) الخاصة بالأطفال من خلال تقديم معيار CAVSR الذي يتضمن تصنيفاً هرمياً للمخاطر، وإطار عمل QVRS-E الذي يستفيد من الاستدلال متعدد الوكلاء المعزز بالمعرفة لتحديد المخاطر الدقيقة وغير الملائمة نمائياً في فيديوهات الـ AIGC بفعالية.

Lewen Mi, Manyi Li, Yuling Sun, Yufan Zhang, Yuxin Shi, Yulong Bian, Xiangxian Li, Juan Liu2026-07-28
🤖 machine learning

Visual Token Compression Enhances Robustness of MLLMs

تقترح هذه الورقة طريقة لتقليم الرموز المرئية تعزز من متانة النماذج اللغوية الكبيرة متعددة الوسائط ضد هجمات الاختراق والهلوسة، وذلك من خلال تحديد وإزالة الرموز المرئية غير المتوافقة وخارج نطاق التوزيع، مع تقليل تكاليف الاستدلال في الوقت ذاته.

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong2026-07-28
🤖 AI

DAMamba-UNet3D: A Parameter-Efficient Mamba State Space U-Net with Dynamic Adaptive Scan for 3D Medical Image Segmentation

تقدم الورقة البحثية DAMamba-UNet3D، وهو نموذج هجين من نوع U-Net ثلاثي الأبعاد موفر للمعلمات لتقسيم الصور الطبية ثلاثية الأبعاد، يدمج آلية مسح تكيفي ديناميكي (DAS) مبتكرةة لتحقيق أداء تنافسي على مجموعة بيانات BraTS 2020 مع تقليل التكاليف الحسابية بشكل كبير مقارنة بالنماذج القائمة على Mamba.

Mohammad Arafat Hussain, Ellen Grant, Yangming Ou2026-07-28
💻 computer science

γγ-Bridge: A Look-Parametric Diffusion Bridge

تُقدم الورقة البحثية γ\gamma-Bridge، وهو جسر انتشار ذو معلمات مسبقة (look-parametric diffusion bridge) ينمذج ضوضاء "غاما" الضربيه عبر هوامش دقيقة لتمكين شبكة واحدة من إجراء عملية إزالة التبقيع لصور الرادار ذي الفتحة الاصطناعية (SAR) بشكل غير معتمد على المستشعر وبقدرة صفرية (zero-shot) عبر أعداد مسبقة (look numbers) متفاوتة دون الحاجة إلى بيانات مرجعية نظيفة أو ضبط دقيق خاص بمستشعر معين.

Xuran Hu, Yujie Zhu, Tengxi Wang, Jilong Li, Wufan Zhao2026-07-28
🤖 machine learning

CausalGate: Causal Importance Distillation for Transformer Module Pruning

يُعد CausalGate إطار عمل موجَّهًا بالتدخل، يقوم باستخلاص درجات الأهمية السببية المستمدة من قياس التأثير الدلالي لتصفير الطبقات الفرعية للمحول (transformer) وتحويلها إلى بوابات قياسية ثابتة لتمكين تقليم الوحدات بكفاءة وبدون عبء إضافي، مما يجعله يتفوق على أساليب الاستدلال التكيفي القائمة على الارتباط الحالية.

Kiran Nair, Smriti Regmi, Rodrigue Rizk2026-07-28
🤖 machine learning

A New Kind of Adversarial Example: Measuring the Human-Model Gap, and Its Relationship to OOD Detection

تقدم هذه الورقة البحثية وتتحقق من فئة جديدة من الأمثلة التنافسية حيث تتسبب الاضطرابات الكبيرة والمرئية في جعل البشر يخطئون في التعرف على الصور بينما تحتفظ النماذج بتنبؤات صحيحة، مما يثبت أن كواشف وخوارزميات الدفاع القياسية الخاصة بالبيانات خارج التوزيع (OOD) غير فعالة إلى حد كبير ضد هذه الفجوة بين الإنسان والنموذج.

Ali Borji2026-07-28
💻 computer science

Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

تقترح هذه الورقة إطار عمل لنماذج الرؤية واللغة الكبيرة الموجهة بالتصنيف، والذي يفصل بين تصنيف نوع المستند واستخراج المحتوى ويستفيد من التعلم في السياق لتحقيق استخراج معلومات مرئي قوي وعالي الدقة دون تدريب مسبق عبر تخطيطات مستندات متنوعة وبأقل قدر من الإشراف.

Huafu Li, Guo Chen, Jia Xia, Lei Wang, Wei Du, Yun Yao, Weijun Peng, Liming Li2026-07-28