🤖 machine learning

Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies

تقدم هذه الورقة مراجعة منهجية شاملة للتحيز والعدالة في نماذج تحويل النص إلى صورة من خلال وضع تصنيف لأنواع التحيز، والتحليل النقدي للفجوة بين المعايير المثالية والمعايير القابلة للتطبيق، واقتراح إطار عمل جديد لترجمة العدالة إجرائياً من خلال اختبار صارم قائم على الأهداف.

Megan Smith, Venkatesh Thirugnana Sambandham, Florian Richter, Laura Crompton, Matthias Uhl, Torsten Schön2026-04-21
🤖 AI

Beyond Attack Success Rate: A Multi-Metric Evaluation of Adversarial Transferability in Medical Imaging Models

تجادل هذه الورقة بأن الاعتماد حصرياً على معدل نجاح الهجوم (ASR) غير كافٍ لتقييم المتانة العدائية في نماذج التصوير الطبي، حيث تثبت من خلال دراسة منهجية للشبكات العصبية الالتفافية (CNNs) ونماذج المحولات الرؤية (Vision Transformers) أن إطار عمل متعدد المقاييس يدمج الجودة الإدراكية وحجم الاضطراب أمر ضروري لإجراء تقييم شامل للمخاطر العدائية.

Emily Curl, Kofi Ampomah, Md Erfan, Sayanton Dibbo2026-04-21
🤖 AI

PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems

تقدم هذه الورقة البحثية "PoInit-of-View"، وهو هجوم مبتكر يستغل الثغرات في مرحلة تهيئة "بنية من الحركة" (Structure-from-Motion) عبر تحسين عدم الاتساق في تدرجات الرؤية المتقاطعة لتعطيل مطابقة النقاط المميزة وتقدير الوضعية، مما يحقق تسميماً عالي الفعالية وقابلاً للنقل عبر أنظمة إعادة البناء ثلاثية الأبعاد المتنوعة.

Weijie Wang, Songlong Xing, Zhengyu Zhao, Nicu Sebe, Bruno Lepri2026-04-21
🤖 machine learning

LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search

تقدم هذه الورقة LLMasTool، وهو إطار عمل للبحث عن البنية العصبية القائم على شجرة هرمية يعامل النماذج اللغوية الكبيرة كأدوات لحل درجات حرية محددة ضمن عملية بحث خوارزمية موثوقة، مما يتيح تطوراً مستقراً ومفتوح النهاية للنماذج يتفوق على الأساليب الحالية في معايير CIFAR وImageNet.

Masakazu Yoshimura, Zitang Sun, Yuiko Sakuma, Junji Otsuka, Atsushi Irie, Takeshi Ohashi2026-04-21
🤖 machine learning

S-GRPO: Unified Post-Training for Large Vision-Language Models

تقترح الورقة البحثية إطار عمل S-GRPO، وهو إطار عمل موحد لما بعد التدريب للنماذج اللغوية البصرية الضخمة يدمج بين الضبط الدقيق الخاضع للإشراف والتعلم المعزز عبر حقن مسار الحقيقة الأرضية الشرطي للتغلب على قيود النسيان الكارثي وانهيار التحسين، مما يؤدي إلى تسريع التقارب وتحقيق تكيف نطاقي متفوق مع الحفاظ على القدرات العامة.

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu2026-04-21
🤖 AI

See Through the Noise: Improving Domain Generalization in Gaze Estimation

تقدم هذه الورقة إطار عمل "الرؤية عبر الضجيج" (SeeTN)، وهو الأول من نوعه الذي يعالج بشكل شامل ضجيج التسميات في تقدير نظرات العين من خلال بناء فضاء تضمين دلالي وتطبيق تنظيم التقارب للتمييز بين العينات المشوبة بالضجيج، مما يعزز بشكل كبير من القدرة على التعميم عبر المجالات دون التضحية بدقة المجال المصدر.

Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian2026-04-21
🤖 AI

Classification of systolic murmurs in heart sounds using multiresolution complex Gabor dictionary and vision transformer

تقترح هذه الورقة نظاماً آلياً لتصنيف لغط القلب الانقباضي يستخدم مطابقة المنحى المتعامد المعقدة مع قاموس غابور المعقد متعدد الدقة لاستخراج الميزات، ومحول رؤية للتصنيف، محققةً دقة بنسبة 95.96% على مجموعة بيانات CirCor DigiScope.

Mahmoud Fakhry, Abeer FathAllah Brery2026-04-21
🤖 AI

Multilevel neural networks with dual-stage feature fusion for human activity recognition

تقترح هذه الورقة وتتحقق من صحة إطار عمل جديد لشبكة عصبية ثنائية المستوى بدمج ميزات ثنائي المراحل (يجمع بين الدمج المتوسط والمتأخر) والذي يحقق دقة فائقة في التعرف على النشاط البشري مقارنة بالنماذج التي تستخدم الدمج المتأخر فقط أو البنى المرجعية القياسية.

Abeer FathAllah Brery, Ascensión Gallardo-Antolín, Israel Gonzalez-Carrasco, Mahmoud Fakhry2026-04-21
🤖 AI

Real-Time Visual Attribution Streaming in Thinking Model

تقدم هذه الورقة إطاراً مستهلكاً (amortized) يتيح عزواً بصرياً أميناً في الوقت الفعلي في نماذج التفكير متعددة الوسائط من خلال تعلم تقدير الآثار السببية من ميزات الانتباه، مما يتغلب على التكاليف الحسابية للطرق السببية التقليدية مع توفير أدلة تجسيد فورية أثناء الاستنتاج.

Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang2026-04-21
💻 computer science

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

تقدم الورقة البحثية إطار عمل AVRT، وهو إطار عمل مبتكر يستفيد من نماذج المعلم أحادية الوسائط لتوليد مسارات استدلال سمعية-بصرية عالية الجودة لتدريب النماذج متعددة الوسائط الأصغر حجمًا، والتي تحقق لاحقًا أداءً هو الأفضل في فئتها على كل من معايير الاستدلال متعددة الوسائط وأحادية الوسائط.

Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hild (…)2026-04-21