G-Zero: Self-Play for Open-Ended Generation from Zero Data
إن G-Zero هو إطار عمل تطوري مشترك وخالٍ من المتحقق (verifier-free)، يتيح التحسين الذاتي مفتوح النهاية للنماذج اللغوية الكبيرة عبر استخدام مكافأة "تلميح-" (Hint-) جوهرية لتدريب نموذج "المقترح" (Proposer) على توليد استعلامات وتلميحات تحدّية، والتي يتعلم منها نموذج "المولد" (Generator) عبر خوارزمية التفضيل المباشر (DPO)، مما يتجاوز قيود الحكام الخارجيين.