🤖 AI

EdgeLPR: On the Deep Neural Network trade-off between Precision and Performance in LiDAR Place Recognition

تستقصي هذه الورقة البحثية المقايضات بين الدقة والكفاءة في الشبكات العصبية العميقة للتعرف على الأماكن القائم على تقنية ليدار (LiDAR) على الأجهزة الطرفية، وذلك من خلال قياس أداء بنيات "منظور عين الطائر" (Bird's Eye View) خفيفة الوزن تحت مستويات تكميم مختلفة (FP32، FP16، INT8) لتوجيه استراتيجيات النشر المستقبلية الواعية بحالات الاستخدام.

Pierpaolo Serio, Hetian Wang, Zixiang Wei, Vincenzo Infantino, Lorenzo Gentilini, Lorenzo Pollini, Valentina Donzella2026-05-06
💻 computer science

Improving Imbalanced Multi-Label Chest X-Ray Diagnosis via CBAM-Enhanced CNN Backbones

تقترح هذه الورقة بنية شبكة عصبية تلافيفية (CNN) معززة بآلية انتباه النطاق الكانوني (CBAM) لمعالجة عدم توازن الفئات وتحديد مواقع الأمراض متعددة الملصقات في تشخيص صور الأشعة السينية للصدر، محققةً متوسط مساحة تحت المنحنى (AUC) قدره 0.8695 على مجموعة بيانات ChestXray14.

Duy Nguyen Huu, Duy Hoang Khuong, Ngu Huynh Cong Viet2026-05-06
🤖 AI

Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning

تقترح هذه الورقة إطار عمل مبتكر يعزز التعلم في السياق متعدد الوسائط من خلال معالجة الفجوات الاستقرائية وفائض الرموز المرئية عبر عملية استدلال استقرائي-استنباطي مهيكلة، وضغط الرموز، وإعادة توازن الانتباه الديناميكي، ومسار تعلم تعزيزي، مما يؤدي إلى تحسينات كبيرة في الأداء عبر مختلف معايير الاختبار اللغوية-البصرية.

Haoyu Wang, Haonan Wang, Yuyan Chen, Jun Chen, Gang Liu, Qian Wang, Jiahong Yan, Yanghua Xiao2026-05-06
🤖 AI

Validation of an AI-based end-to-end model for prostate pathology using long-term archived routine samples

تؤكد هذه الدراسة متانة وقابلية تعميم نموذج GleasonAI المتكامل لتقييم درجة سرطان البروستاتا عبر 17 عاماً من العينات الروتينية المؤرشفة من 14 منطقة سويدية، مما يظهر أداءً يضاهي أطباء المسالك البولية ذوي الخبرة وتدرجاً إنذارياً هاماً للوفيات المرتبطة بالسرطان.

Xiaoyi Ji, Renata Zelic, Oskar Aspegren, Nita Mulliqi, Michelangelo Fiorentino, Francesca Giunchi, Luca Molinaro, Sol Er (…)2026-05-06
🤖 AI

ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking

يقترح ViewSAM إطار عمل ضعيف الإشراف مكون من مرحلتين يستفيد من النماذج التأسيسية كمولدات للتسميات المستعارة، ويقدم نموذجاً عابراً للأنماط مدركاً للمنظور لتحقيق أداء رائد في تتبع الأجسام المتعددة عبر الرؤى المختلفة باستخدام ملصقات فئات الأجسام التقريبية فقط.

Jiawei Ge, Xintian Zhang, Jiuxin Cao, Bo Liu, Fabian Deuser, Chang Liu, Gong Wenkang, Siyou Li, Juexi Shao, Wenqing Wu (…)2026-05-06
🤖 AI

Perceptual Flow Network for Visually Grounded Reasoning

لمعالجة التحيز اللغوي والهلوسة في نماذج اللغة والرؤية الكبيرة الناتجة عن الإشراف الهندسي غير الأمثل، تقترح الورقة البحثية شبكة التدفق الإدراكي (PFlowNet)، وهي إطار عمل مبتكر يفصل الإدراك عن الاستنتاج ويستخدم التعلم التعزيزي التبايني لتحقيق أداء رائد في معايير الاستنتاج البصري.

Yangfu Li, Yuning Gong, Hongjian Zhan, Teng Li, Yuanhuiyi Lyu, Tianyi Chen, Qi Liu, Ziyuan Huang, Zhihang Zhong, Dandan (…)2026-05-06
🤖 AI

TOC-SR: Task-Optimal Compact diffusion for Image Super Resolution

تقدم هذه الورقة البحثية TOC-SR، وهو إطار عمل يستفيد من التقطير التوليدي المعتمد على الميزات والتحسين البايزي المقيد بـ إبسيلون لاكتشاف هيكل انتشار مدمج، والذي يتم تقطيره بعد ذلك إلى مولد ذي خطوة واحدة فعال لرفع دقة الصور بجودة عالية مع تقليل تعقيد النموذج والتكلفة الحسابية بشكل كبير.

Sowmya Vajrala, Akshay Bankar, Manjunath Arveti, Shreyas Pandith, Sravanth Kodavanti, Subhajit Sanyal, Amit Unde, Sriniv (…)2026-05-06
🤖 AI

IConFace: Identity-Structure Asymmetric Conditioning for Unified Reference-Aware Face Restoration

تقترح الورقة البحثية IConFace، وهو إطار عمل موحد يستخدم التكييف غير المتماثل للهوية والبنية لتحقيق توازن فعال بين الحفاظ على الهوية القائمة على المرجع واستعادة البنية غير المرجعية من أجل ترميم الوجوه الأعمى عالي الجودة في ظل التدهور الشديد.

Axi Niu, Jinyang Zhang, Senyan Qing2026-05-06
🤖 machine learning

VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

لمعالجة التراجع في تقييم التعرف على الأفعال لنماذج الرؤية واللغة، تقدم هذه الورقة VideoNet، وهو معيار مرجعي واسع النطاق يغطي 1,000 فعل خاص بمجالات محددة ومجموعة بيانات تدريبية لأسئلة وأجوبة الفيديو تبلغ 500 ألف فيديو، مما يثبت أن الضبط الدقيق على هذه البيانات يمكّن النماذج الأصغر من التفوق على نظيراتها الأكبر ذات الأوزان المفتوحة في التعرف على الأفعال المعقدة والخاصة بمجالات محددة.

Tanush Yadav, Mohammadreza Salehi, Jae Sung Park, Vivek Ramanujan, Hannaneh Hajishirzi, Yejin Choi, Ali Farhadi, Rohun T (…)2026-05-06
💻 computer science

Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses

تقدم هذه الدراسة مراجعة شاملة للسلامة في الذكاء الاصطناዊ المجسد من خلال تقديم تصنيف موحد متعدد المستويات يفحص الهجمات والدفاعات عبر مسار الوكيل بأكمله، وتوليف الرؤى من أكثر من 400 ورقة بحثية لتحديد التحديات الحرجة وتقديم خارطة طريق لبناء أنظمة واقعية آمنة وقوية وموثوقة.

Xiao Li, Xiang Zheng, Yifeng Gao, Xinyu Xia, Yixu Wang, Xin Wang, Ye Sun, Yunhan Zhao, Ming Wen, Jiayu Li, Xun Gong, Yi (…)2026-05-06