LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training
यह शोध पत्र LEAF का प्रस्ताव करता है, जो एक रेट्रोस्पेक्टिव ट्री-आधारित सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) विधि है जो रोलआउट बैचों में साझा प्रीफिक्स को स्पैन-स्तरीय लाभ (स्पैन-लेवल एडवांटेज) प्रदान करके स्पीच-अवेयर लार्ज लैंग्वेज मॉडल पोस्ट-ट्रेनिंग में सुधार करता है, जिससे यह मौजूदा GRPO-शैली के दृष्टिकोणों और यहाँ तक कि छोटे मॉडलों वाले फुल-पैरामीटर बेसलाइनों को भी पीछे छोड़ देता है।