Distilling Game Code World Model Generation into Lightweight Large Language Models
यह शोध पत्र एक स्केलेबल पोस्ट-ट्रेनिंग पाइपलाइन का प्रस्ताव करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग और वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग को जोड़ता है ताकि फ्रंटियर मॉडल्स से गेम कोड वर्ल्ड मॉडल जनरेशन क्षमताओं को एक हल्के 3B-पैरामीटर वाले LLM में डिस्टिल किया जा सके, जिससे यह प्राकृतिक भाषा के नियमों से सटीक रूप से निष्पादन योग्य (executable) गेम वातावरण उत्पन्न करने में सक्षम हो सके।