Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation
यह अनुभवजन्य अध्ययन कोड जनरेशन के लिए प्रीट्रेन्ड (pretrained) और इंस्ट्रक्शन-ट्यून्ड (instruction-tuned) दोनों प्रकार के एलएलएम (LLMs) पर रिवॉर्ड-फ्री अलाइनमेंट तकनीकों (DPO और BoNBoN) को लागू करने के ट्रेड-ऑफ की जांच करता है, जो यह प्रकट करता है कि जबकि प्रीट्रेन्ड मॉडल्स को अलाइन करने से बड़े सापेक्ष सुधार प्राप्त होते हैं, इंस्ट्रक्शन-ट्यून्ड मॉडल्स से शुरुआत करने पर आम तौर पर उच्च पूर्ण सटीकता बनी रहती है, भले ही वे कम लाभ या संभावित गिरावट प्रदान करते हों।