ReFPO: Reflow Regularization for Flow Matching Policy Gradients
ReFPO एक सरल, कुशल ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक स्पष्ट रिफ्लो (Reflow) नियमितीकरण पद को पेश करके फ्लो मैचिंग पॉलिसी ग्रेडिएंट्स को बेहतर बनाता है, जो प्रशिक्षण को स्थिर करता है, प्रॉक्सी-अनुपात स्पाइक्स को कम करता है, और बिना किसी अतिरिक्त कम्प्यूटेशनल ओवरहेड के उच्च-सटीकता वाले एक-चरण अनुमान (one-step inference) को सक्षम बनाता है।