Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models
यह शोध पत्र रीइन्फोर्स एडजॉइंट मैचिंग (RAM) को प्रस्तुत करता है, जो डिफ्यूजन और फ्लो-मैचिंग मॉडल्स के लिए एक स्केलेबल आरएल (RL) पोस्ट-ट्रेनिंग विधि है, जो एक सरल कंसिस्टेंसी लॉस (consistency loss) व्युत्पन्न करके रिवॉर्ड्स के साथ बेहतर अलाइनमेंट प्राप्त करता है जो बिना किसी महंगी एसडीई (SDE) रोलआउट्स, बैकवर्ड एडजॉइंट स्वीप्स, या रिवॉर्ड ग्रेडिएंट्स के प्रीट्रेनिंग लक्ष्यों को ठीक करता है।