Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy
يُعد Q-Flow إطار عمل للتعلم التعزيزي يحقق تحسيناً مستقراً ومعبراً للسياسات من خلال الاستفادة من ديناميكيات التدفق الحتمية لنقل القيم النهائية إلى الحالات المتوسطة، مما يلغي الحاجة إلى الانتشار العكسي غير المستقر عبر الحلول العددية ويتفوق على النماذج المرجعية المتطورة في الإعدادات غير المتصلة والمتصلة.