Staleness-Learning Rate Scaling Laws for Asynchronous RLHF
यह शोध पत्र के क्रम के प्रति-चरण ग्रेडिएंट बायस (per-step gradient bias) को व्युत्पन्न करके और रोलआउट लैग (rollout lag) तथा संचयी लर्नर ड्रिफ्ट (cumulative learner drift) पर आधारित लर्निंग रेट के लिए एक दो-प्रतिबंध स्थिरता स्थिति (two-constraint stability condition) को परिभाषित करने वाले एक सशर्त कोलैप्स-टाइम स्केलिंग लॉ (conditional collapse-time scaling law) को स्थापित करके, एसिंक्रोनस GRPO-आधारित RLHF में स्टेल रोलआउट्स (stale rollouts) के प्रभाव का विश्लेषण करता है।