Representation-Based Exploration for Language Models: From Test-Time to Post-Training
यह शोध पत्र यह प्रदर्शित करता है कि प्री-ट्रेंड हिडन स्टेट्स (pre-trained hidden states) से व्युत्पन्न एक सरल, रिप्रेजेंटेशन-आधारित डाइवर्सिटी बोनस को इन्फरेंस-टाइम सैंपलिंग और पोस्ट-ट्रेनिंग रीइन्फोर्समेंट लर्निंग दोनों में शामिल करने से भाषा मॉडल के प्रदर्शन और सैंपल दक्षता में महत्वपूर्ण वृद्धि होती है, क्योंकि यह मौजूदा व्यवहारों को केवल परिष्कृत करने के बजाय नवीन व्यवहारों की खोज को बढ़ावा देता है।