💻 computer science

Beyond Fixed Thresholds and Domain-Specific Benchmarks for Explainable Multi-Task Classification in Autonomous Vehicles

تقترح هذه الورقة منهجية اختيار عتبة تكيفية للتغلب على قيود العتبات الثابتة في الإدراك متعدد المهام للقيادة الذاتية، وتقدم مجموعة بيانات IUST-XAI-AD لتمكين القابلية للتفسير عبر الثقافات وتقييم أكثر قوة لأنظمة المركبات ذاتية القيادة.

Maryam Sadat Hosseini Azad, Shahriar Baradaran Shokouhi2026-05-07
🤖 machine learning

Covariance-Aware Goodness for Scalable Forward-Forward Learning

تقدم هذه الورقة "جودة التباين الواعي" (Covariance-Aware Goodness)، وهو إطار عمل تعلم أمامي-أمامي (Forward-Forward) قابل للتوسع يتميز بـ "جودة التباين ثنائي المحور" (Bi-axis Covariance Goodness)، و"الدمج اللوجستي" (Logistic Fusion)، و"طبقات محاذاة الميزات" (Feature Alignment Layers) للتغلب على الاختناقات الهيكلية في الإعدادات الالتفافية، محققاً أداءً مماثلاً للانتشار العكسي (backpropagation) على مجموعتي بيانات ImageNet-100 وTiny-ImageNet مع تقليل ذروة استخدام الذاكرة بنسبة 50% تقريباً.

Xiaoyi Jiang, Bashir M. Al-Hashimi, Kai Xu2026-05-07
💻 computer science

InterFuserDVS: Event-Enhanced Sensor Fusion for Safe RL-Based Decision Making

تقترح هذه الورقة البحثية InterFuserDVS، وهي بنية محسنة لدمج المستشعرات تدمج مستشعرات الرؤية الديناميكية (DVS) مع بيانات RGB وLiDAR عبر استراتيجية مبتكرة قائمة على الرموز (token-based) لتحسين متانة وسلامة وكلاء القيادة الذاتية القائمين على التعلم التعزيزي (RL)، محققةً معدل إكمال مسار بنسبة 100% في لوحة صدارة CARLA.

Mustafa Sakhaia, Kaung Sithua, Min Khant Soe Okea, Maciej Wielgosza2026-05-07
💻 computer science

Intermediate Representations are Strong AI-Generated Image Detectors

تقترح هذه المقالة طريقة كشف جديدة قائمة على البحث تستفيد من حساسية تضمينات البيانات في الطبقات المتوسطة لتحديد الصور المولدة بواسطة الذكاء الاصطناعي بفعالية، مما يحقق تعميماً وأداءً متفوقين مقارنة بكل من التقنيات الحالية المعتمدة على التدريب والتقنيات الخالية من التدريب.

Zhenhan Huang, Pin-Yu Chen, Tejaswini Pedapati, Jianxi Gao2026-05-07
💻 computer science

UAV as Urban Construction Change Monitor: A New Benchmark and Change Captioning Model

تقدم هذه الورقة PTNet، وهو إطار عمل موجّه بالنماذج الأولية يعمل على نمذجة كشف التغيير والتعليق الوصفي بشكل مشترك للتغلب على تحديات التمثيل الدلالي في الاستشعار عن بعد، إلى جانب إصدار UCCD، وهو معيار مرجعي جديد واسع النطاق يعتمد على الطائرات بدون طيار ومصمم خصيصاً لمراقبة البناء الحضري عالي الدقة.

Yupeng Gao, Tianyu Li, Guoqing Wang, Yang Yang2026-05-07
🤖 AI

Evaluation Cards for XAI Metrics

لمعالجة نقص المعايير والشفافية في تقييم أساليب الذكاء الاصطناٍعي القابل للتفسير (XAI)، تقترح هذه الورقة "بطاقة تقييم الذكاء الاصطناعي القابل للتفسير"، وهي نموذج توثيق مصمم لتسجيل التفاصيل الحرجة مثل الخصائص المستهدفة، والافتراضات، وأدلة التحقق لأي مقياس جديد للذكاء الاصطناعي القابل للتفسير بشكل منهجي.

Rokas Gipiškis, Olga Kurasova2026-05-07
💻 computer science

Structured 3D Latents Are Surprisingly Powerful: Unleashing Generalizable Style with 2D Diffusion

تقدم الورقة البحثية DiLAST، وهي طريقة "plug-and-play" تستفيد من نماذج الانتشار ثنائية الأبعاد (2D diffusion models) المدربة مسبقاً كمعلمين لتوجيه تحسين التمثيلات الكامنة ثلاثية الأبعاد المهيكلة، مما يتيح توليد أصول ثلاثية الأبعاد عالية الدقة بأنماط متنوعة وخارج النطاق (out-of-distribution) تعجز الأساليب الحالية عن تحقيقها.

Yiran Qiao, Yiren Lu, Yunlai Zhou, Disheng Liu, Linlin Hou, Rui Yang, Yu Yin, Jing Ma2026-05-07
🤖 machine learning

Towards General Preference Alignment: Diffusion Models at Nash Equilibrium

تقدم هذه الورقة البحثية "تحسين تفضيل ناش للانتشار" (Diff.-NPO)، وهو إطار عمل قائم على نظرية الألعاب يُمكّن نماذج الانتشار من تحقيق محاذاة فائقة بين النص والصورة من خلال تشجيع اللعب الذاتي ضد نفسها، مما يتغلب على قيود طرق التفضيل التقليدية القائمة على نموذج برادلي-تيري.

Jiaming Hu, Jiamu Bai, Haoyu Wang, Debarghya Mukherjee, Ioannis Ch. Paschalidis2026-05-07
💬 NLP

SpecPL: Disentangling Spectral Granularity for Prompt Learning

يقدم SpecPL إطار عمل جديد لتعلم التلقين، يقوم بفك ارتباط الحبيبية الطيفية عبر إشراف الحبيبية المضادة للواقع لسد عدم التماثل في الأنماط في نماذج الرؤية واللغة، محققاً أداءً هو الأفضل في فئته في 11 معياراً من خلال تنشيط النماذج المرجعية الموجهة نحو النصوص عبر التوجيه البصري.

Jingtao Zhou, Xirui Kang, Feiyang Huang, Lai-Man Po2026-05-07
💻 computer science

From Priors to Perception: Grounding Video-LLMs in Physical Reality

تقدم هذه الورقة "نظرية الإسناد الموحد" لتفسير إخفاقات نماذج اللغات الكبيرة المرئية (Video-LLMs) في الاستدلال الفيزيائي نتيجة هيمنة الأولويات الدلالية، وتقترح مجموعة بيانات "المنهج التنافسي البرمجي" (PACC) وطريقة "سلسلة الاستدلال المرتكزة بصرياً" (VARC) لترسيخ النماذج بفعالية في الحقائق المرئية وتحسين قدراتها على الاستدلال الفيزيائي بشكل كبير دون إجراء تغييرات في البنية الهيكلية.

Zicheng Zhao, Chaofan Gan, Shijie Li, Weiyao Lin2026-05-07