Score-Based One-step MeanFlow Policy Optimization
تقدم هذه الورقة البحثية خوارزمية "تحسين سياسة تدفق المتوسط أحادي الخطوة القائم على الدرجة" (SOM)، وهي خوارزمية "ممثل-ناقد" تتيح توليد سياسة بكفاءة في خطوة واحدة في التعلم التعزيزي عبر الإنترنت من خلال بناء حقل سرعة مستهدف مباشرة من دالة (Q)، مما يحقق أداءً رائدًا مع تقليل العبء الحسابي بشكل كبير مقارنة بطرق الانتشار ومطابقة التدفق التقليدية متعددة الخطوات.