🤖 machine learning

Hybrid Topological and Deep Feature Fusion for Accurate MRI-Based Alzheimer's Disease Severity Classification

تقترح هذه الورقة إطار عمل هجينًا جديدًا للتعلم العميق يدمج تحليل البيانات الطوبولوجي مع شبكة DenseNet121 لتحقيق دقة تبلغ 99.93% ومساحة تحت المنحنى (AUC) مثالية بنسبة 100% في تصنيف أربع مراحل من شدة مرض الزهايمر باستخدام بيانات رنين مغناطيسي من قاعدة بيانات OASIS.

Faisal Ahmed2026-02-03
🤖 AI

Navigating Simply, Aligning Deeply: Winning Solutions for Mouse vs. AI 2025

حقق فريق HCMUS_TheFangs نتائج فوز في كلا المسارين في مسابقة NeurIPS 2025 (Mouse vs. AI) من خلال إثبات أن البنيات البسيطة والخفيفة تتفوق في المتانة البصرية، بينما تتفوق النماذج العميقة ذات السعة العالية في المحاذاة العصبية، مما يكشف أن الأداء الأمثل يعتمد على مطابقة التعقيد البنيوي مع أهداف مهام محددة بدلاً من تعظيم حجم النموذج.

Phu-Hoa Pham, Chi-Nguyen Tran, Dao Sy Duy Minh, Nguyen Lam Phu Quy, Huynh Trung Kiet2026-02-03
🤖 AI

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

تقترح هذه الورقة UltraBreak، وهو إطار عمل جديد يحقق هجمات كسر الحماية (jailbreak) شاملة وقابلة للنقل على نماذج الرؤية واللغة من خلال تقييد الأنماط العدائية في الفضاء البصري وتحسين الأهداف القائمة على الدلالات في فضاء التضمين النصي للتغلب على ضعف تعميم الطرق الحالية القائمة على التدرج.

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang2026-02-03
💬 NLP

Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation

تستعرض هذه المراجعة المصغرة تطور عملية تحديد معنى الكلمة بصرياً (VWSD) من دمج الوسائط المتعددة المبكر إلى أطر عمل "CLIP" والانتشار (diffusion) والنماذج اللغوية الكبيرة (LLM) الحديثة، مع تسليط الضوء على المكاسب الكبيرة في الأداء مع تحديد التحديات المستمرة في السياق، والتحيز، والتقييم متعدد اللغات.

Shashini Nilukshi, Deshan Sumanathilaka2026-02-03
💬 NLP

SimpleGPT: Improving GPT via A Simple Normalization Strategy

تقدم هذه الورقة البحثية SimpleGPT، وهو متغير من نموذج Transformer يستخدم استراتيجية SimpleNorm مبتكرة تعمل على تثبيت مقاييس التنشيط وتقليل النط الطيفي لـ Hessian، مما يتيح معدلات تعلم أكبر بكثير ويحقق أداءً واستقراراً فائقين عبر مختلف أحجام النماذج مقارنة بالنماذج المرجعية الراسخة مثل LLaMA2.

Marco Chen, Xianbiao Qi, Yelin He, Jiaquan Ye, Rong Xiao2026-02-03
⚡ electrical engineering

Hyperspectral Image Fusion with Spectral-Band and Fusion-Scale Agnosticism

تقترح هذه الورقة البحثية إطار عمل SSA، وهو إطار تعلم عميق شامل لدمج الصور متعددة الأطياف وفائقة الأطياف يستخدم "نواة ماتريوشكا" (Matryoshka Kernel) والتمثيل العصبي الضمني لتحقيق عدم الارتباط بالنطاق الطيفي ونطاق الدمج، مما يمكن نموذجاً واحداً من التعميم بفعالية عبر أجهزة استشعار متنوعة ودقات مكانية عشوائية.

Yu-Jie Liang, Zihan Cao, Liang-Jian Deng, Yang Yang, Malu Zhang2026-02-03
💻 computer science

FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time

يُعد FreeFuse إطار عمل لا يتطلب تدريباً يُمكّن من توليد صور عالية الجودة متعددة المواضيع من النصوص عبر تنفيذ التوجيه التكيفي على مستوى الرموز (Adaptive Token-Level Routing) أثناء الاستدلال، والذي يستخدم آلية FreeFuseAttn مبتكرة لتعيين بقايا LoRA الخاصة بكل موضوع ديناميكياً وبدقة إلى مناطقها المكانية المقابلة دون الحاجة إلى أدوات تقسيم خارجية أو إعادة تدريب النموذج.

Yaoli Liu, Yao-Xiang Ding, Kun Zhou2026-01-30
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

تقدم هذه الورقة أداة Prompting4Debugging (P4D)، وهي أداة اختبار اختراق مؤتمتة تكشف عن ثغرات أمنية جسيمة في آليات السلامة لنماذج الانتشار من نوع نص-إلى-صورة عبر إثبات أن العديد من المطالبات التي كانت تُعتبر سابقاً "آمنة" يمكن التلاعب بها لتجاوز الحمايات الحالية، مما يتحدى موثوقية معايير التقييم الحالية.

Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu2026-01-15
⚡ electrical engineering

Exploiting Scale-Variant Attention for Segmenting Small Medical Objects

لمعالجة تحدي تقسيم الأجسام الطبية الصغيرة التي تشغل أقل من 1% من مساحات الصور وتعاني من فقدان المعلومات في الشبكات العصبية التلافيفية العميقة، تقترح هذه الورقة SvANet، وهي شبكة مبتكرة تدمج الانتباه متغير المقياس، والتوجيه عبر المقاييس، وانتباه مونت كارلو، ومحولات الرؤية لتحقيق أداء تقسيم فائق عبر سبع مجموعات بيانات طبية متنوعة.

Wei Dai, Rui Liu, Zixuan Wu, Tianyi Wu, Min Wang, Junxian Zhou, Yixuan Yuan, Jun Liu2026-01-15
💻 computer science

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

تقترح هذه الورقة CLIPF، وهي استراتيجية لإخفاء النصوص تعتمد على تكرار الكلمات للتدريب المسبق لنماذج الرؤية واللغة، والتي تتفوق على الأساليب الحالية مثل الإخفاء القائم على بناء الجملة، خاصة عندما تكون بيانات التدريب محدودة، بينما تُظهر أيضاً أن الاستراتيجيات الأخرى يمكن أن تتجاوز الإخفاء القائم على بناء الجملة مع توفر عدد كافٍ من دورات التدريب.

Mingliang Liang, Martha Larson2026-01-15