💻 computer science

Out-of-Distribution Object Detection in Street Scenes via Synthetic Outlier Exposure and Transfer Learning

تقدم هذه الورقة البحثية SynOE-OD، وهو إطار عمل يستفيد من النماذج التوليدية مثل Stable Diffusion وكواشف الكائنات ذات المفردات المفتوحة لتخليق بيانات شاذة ذات معنى دلالي من أجل التعلم بنقل المعرفة، مما يمكّن كاشفاً موحداً من تحقيق أداء رائد في تحديد مواقع وتصنيف الكائنات خارج النطاق في مشاهد الشوارع.

Sadia Ilyas, Annika Mütze, Klaus Friedrichs, Thomas Kurbiel, Matthias Rottmann2026-03-18
💻 computer science

Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting

تقدم الورقة البحثية إطار عمل QICA، وهو إطار عمل جديد لعد الأجسام بنمط "التعلم الصفري" (zero-shot) يعزز الإدراك الكمي والوعي المكاني من خلال استراتيجية تحفيز تآزرية وفك تشفير لتجميع التكلفة للتغلب على قيود الاسترجاع الخشن وتشوه الميزات في الأساليب الحالية.

Da Zhang, Bingyu Li, Feiyu Wang, Zhiyuan Zhao, Junyu Gao2026-03-18
💻 computer science

EPOFusion: Exposure aware Progressive Optimization Method for Infrared and Visible Image Fusion

تقترح الورقة البحثية EPOFusion، وهي طريقة تحسين تدريجي مدركة للتعرض تستخدم وحدة توجيه، وفك تشفير تكراري، ودالة فقدان تكيفية لدمج الصور بالأشعة تحت الحمراء والمرئية بفعالية في سيناريوهات التعرض المفرط، مدعومة بتقديم مجموعة بيانات جديدة عالية الجودة للتعرض المفرط (IVOE).

Zhiwei Wang, Yayu Zheng, Defeng He, Li Zhao, Xiaoqin Zhang, Yuxing Li, Edmund Y. Lam2026-03-18
🤖 machine learning

When Generative Augmentation Hurts: A Benchmark Study of GAN and Diffusion Models for Bias Correction in AI Classification Systems

تكشف هذه الدراسة المرجعية أنه في حين أن نموذج Stable Diffusion مع تقنية LoRA يقلل بفعالية من انحياز المصنف في مهام تصنيف الحيوانات ذات البيانات المنخفضة، فإن تعزيز FastGAN يمكن أن يؤدي بنشاط إلى تفاقم الانحياز عبر توليد صور خارج نطاق التوزيع، لا سيًا عندما تنخفض مجموعات التدريب عن حجم حرج يتراوح بين 20 إلى 50 صورة لكل فئة.

Shesh Narayan Gupta, Nik Bear Brown2026-03-18
💻 computer science

Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

تقترح هذه الورقة إطار عمل IOMM، وهو إطار تدريب ثنائي المراحل كفء في استهلاك البيانات، يقوم بالتدريب المسبق لمكونات التوليد البصري لنموذج UMM حصرياً على صور غير مصنفة وفيرة قبل الضبط الدقيق باستخدام بيانات مقترنة محدودة، محققاً أداءً هو الأفضل في فئته مع تقليل التكاليف الحسابية بشكل كبير.

Peng Sun, Jun Xie, Tao Lin2026-03-18
💻 computer science

AI-Generated Figures in Academic Publishing: Policies, Tools, and Practical Guidelines

تستعرض هذه الورقة السياسات المتضاربة لدور النشر الأكاديمية الكبرى فيما يتعلق بالأشكال والرسوم التوضيحية المُنشأة بواسطة الذكاء الاصطناعي، وتحدد المخاوف الرئيسية مثل قابلية التكرار والتأليف، وتقترح إرشادات توجيهية لأفضل الممارسات تتسم بالشفافية لضمان الاستخدام الأخلاقي والفعال لهذه الأدوات في التواصل العلمي.

Davie Chen2026-03-18
🤖 AI

360{\deg} Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method

تقدم هذه الورقة 360Bench، وهو معيار شامل لتقييم النماذج اللغوية الكبيرة متعددة الوسائط في إدراك الصور بزاوية 360 درجة، وتقترح Free360، وهو إطار عمل يعتمد على الرسوم البيانية للمشهد ولا يتطلب تدريباً، ويعزز بشكل كبير أداء الأسئلة والأجوبة المرئية (VQA) من خلال تفكيك الاستدلال وتحويل الصور الكروية بشكل تكيفي.

Huyen T. T. Tran, Van-Quang Nguyen, Farros Alferro, Kang-Jun Liu, Takayuki Okatani2026-03-18
💻 computer science

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

يُعد KidsNanny نظاماً ثنائي المراحل ومنخفض التأخير للإشراف على المحتوى متعدد الوسائط، يجمع بين الفحص البصري السريع والاستدلال السياقي القائم على النصوص لتحقيق دقة وسرعة فائقتين في اكتشاف تهديدات سلامة الأطفال مقارنة بالنماذج الحالية، ويتميز بشكل خاص في تحديد المخاطر المضمنة في النصوص.

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel2026-03-18
💻 computer science

Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensors

تقدم الورقة البحثية نظام "Ground Reaction Inertial Poser" (GRIP)، وهو طريقة لالتقاط الحركة قائمة على الفيزياء تدمج بيانات مستشعرات القصور الذاتي (IMU) المتباعدة مع بيانات مستشعرات ضغط النعل داخل الحذاء مع محاكي التوأم الرقمي لإعادة بناء حركة بشرية منطقية فيزيائياً، متفوقةً بذلك على الأساليب الحالية من خلال استخدام مجموعة بيانات PRISM واسعة النطاق تم تقديمها حديثاً.

Ryosuke Hori, Jyun-Ting Song, Zhengyi Luo, Jinkun Cao, Soyong Shin, Hideo Saito, Kris Kitani2026-03-18
💻 computer science

Synergizing Deep Learning and Biological Heuristics for Extreme Long-Tail White Blood Cell Classification

تقدم هذه الورقة إطار عمل هجين يجمع بين تقنيات التعلم العميق، بما في ذلك استعادة العيوب القائمة على نموذج Pix2Pix وتجمعات محولات Swin مع التضمينات التباينية، جنباً إلى جنب مع الاستدلالات البيولوجية للتحسين المورفولوجي، لتحقيق تصنيف قوي لأنواع خلايا الدم البيضاء النادرة في ظل عدم توازن حاد في الفئات.

Trong-Duc Nguyen, Hoang-Long Nguyen, Huy-Hieu Pham2026-03-18