💻 computer science

Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

تقدم هذه الورقة البحثية TurningPoint-GRPO (TP-GRPO)، وهو إطار عمل مبتكر يعزز خوارزمية Flow-Based GRPO لتوليد الصور من النصوص عبر استبدال المكافآت القائمة على النتائج المتفرقة بمكافآت تراكمية كثيفة على مستوى الخطوات، وتحديد "نقاط التحول" لتعيين مكافآت طويلة الأمد مجمعة، مما يساهم بفعالية في نمذجة التأثيرات الفورية والمتأخرة ضمن مسار إزالة الضجيج.

Yunze Tong, Mushui Liu, Canyu Zhao, Wanggui He, Shiyi Zhang, Hongwei Zhang, Peng Zhang, Jinlong Liu, Ju Huang, Jiamang W (…)2026-02-09
💻 computer science

Exploring Specular Reflection Inconsistency for Generalizable Face Forgery Detection

تقترح هذه الورقة البحثية شبكة SRI-Net، وهي طريقة مبتكرة للكشف عن تزييف الوجوه تستفيد من تقدير الملمس القائم على نموذج ريتينكس (Retinex) لعزل الانعكاسات المرآتية، وتستخدم آلية انتباه تقاطعي ثنائية المرحلة لتحديد أوجه عدم الاتساق في العلاقة الفيزيائية بين الانعكاس والملمس والإضاءة، مما يحقق تعميماً قوياً ضد عمليات التزييف عالية الجودة الناتجة عن الذكاء الاصطناعي.

Hongyan Fei, Zexi Jia, Chuanwei Huang, Jinchao Zhang, Jie Zhou2026-02-09
💻 computer science

DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving

يُعد DriveWorld-VLA إطار عمل مبتكر يوحّد بين التخطيط القائم على الرؤية واللغة والأفعال ونمذجة العالم في فضاء كامن مشترك لتمكين التخيل المشهدي القابل للتحكم والمشروط بالأفعال وتحسين اتخاذ القرار في القيادة الذاتية، محققاً أداءً هو الأفضل في فئته في معايير NAVSIM وnuScenes.

Feiyang jia, Lin Liu, Ziying Song, Caiyan Jia, Hangjun Ye, Xiaoshuai Hao, Long Chen2026-02-09
💻 computer science

Think Proprioceptively: Embodied Visual Reasoning for VLA Manipulation

تقدم الورقة البحثية ThinkProprio، وهي طريقة تحول الحالة الحسية العميقة إلى رموز نصية للدمج المبكر مع تعليمات المهام في نماذج الرؤية واللغة والأفعال (Vision-Language-Action models)، مما يتيح للحالة المتجسدة توجيه الاستنتاج البصري واختيار الرموز مع تحقيق أداء يضاهي أو يتفوق على النماذج المرجعية القوية مع تقليل زمن انتقال الاستدلال بنسبة تزيد عن 50%.

Fangyuan Wang, Peng Zhou, Jiaming Qi, Shipeng Lyu, David Navarro-Alarcon, Guodong Guo2026-02-09
🤖 AI

ProtoQuant: Quantization of Prototypical Parts For General and Fine-Grained Image Classification

يقدم ProtoQuant بنية مبتكرة تستفيد من تكميم المتجهات الكامنة لإنشاء كتاب رموز (codebook) منفصل ومستقر للأجزاء النموذجية، مما يتيح رأس تصنيف فعال وقابل للتفسير يحقق دقة تنافسية في كل من مجموعات البيانات واسعة النطاق ودقيقة التفاصيل دون الحاجة إلى الضبط الدقيق المكلف حاسوبياً للعمود الفقري (backbone).

Mikołaj Janusz, Adam Wróbel, Bartosz Zieliński, Dawid Rymarczyk2026-02-09
🤖 AI

DAVE: Distribution-aware Attribution via ViT Gradient Decomposition

تقدم الورقة البحثية DAVE، وهي طريقة عزو ذات أساس رياضي لنماذج المحولات الرؤية (Vision Transformers)، والتي تعمل على تفكيك تدرجات المدخلات لعزل المكونات المستقرة والمتساوية التباين محلياً والقضاء على الآثار المعمارية، مما يتيح توليد تفسيرات عالية الدقة ومستقرة على مستوى البكسل.

Adam Wróbel, Siddhartha Gairola, Jacek Tabor, Bernt Schiele, Bartosz Zieliński, Dawid Rymarczyk2026-02-09
💻 computer science

Clinical-Prior Guided Multi-Modal Learning with Latent Attention Pooling for Gait-Based Scoliosis Screening

تقدم هذه الورقة ScoliGait، وهو عبارة عن مجموعة بيانات مرجعية جديدة وإطار عمل للتعلم متعدد الوسائط موجه بالأولويات السريرية مع تجميع الانتباه الكامن، لتحقيق فحص قوي وقابل للتفسير قائم على المشية لمرض الجنف مجهول السبب لدى المراهقين مع معالجة تحديات تسرب البيانات وقابلية تفسير النموذج.

Dong Chen, Zizhuang Wei, Jialei Xu, Xinyang Sun, Zonglin He, Meiru An, Huili Peng, Yong Hu, Kenneth MC Cheung2026-02-09
💻 computer science

Machine Learning for Detection and Severity Estimation of Sweetpotato Weevil Damage in Field and Lab Conditions

تقدم هذه الدراسة إطار عمل يعتمد على الرؤية الحاسوبية باستخدام نماذج التصنيف للتنبؤ بشدة الأضرر الميدانية، ومسار معالجة ثنائي المراحل يعتمد على YOLO12 لتحديد الثقوب المختبرية، مما يوفر حلاً فعالاً وموضوعياً وقابلاً للتوسع لأتمتة تقييم أضرار سوس البطاطا الحلوة وتعزيز برامج التربية.

Doreen M. Chelangat, Sudi Murindanyi, Bruce Mugizi, Paul Musana, Benard Yada, Milton A. Otema, Florence Osaru, Andrew Ka (…)2026-02-09
🤖 AI

AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models

تقترح هذه الورقة البحثية إطار عمل AEGPO، وهو إطار جديد لتحسين السياسات لنماذج الانتشار يستفيد من إنتروبيا الانتباه كوكيل إشارة مزدوج لتخصيص ميزانيات التدحرج ديناميكيًا عبر العينات وتوجيه الاستكشاف بشكل انتقائي عند الخطوات الزمنية الحرجة، مما يؤدي إلى تحسين سرعة التقارب وأداء المحاذاة بشكل كبير مقارنة بطرق GRPO القياسية.

Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang2026-02-09