LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models
यह शोध पत्र LEAD को प्रस्तुत करता है, जो एक नवीन विधि है जो सुदृढीकरण शिक्षण (reinforcement learning) के दौरान शुद्धता और दक्षता को गतिशील रूप से संतुलित करने के लिए ऑनलाइन, स्व-अनुकूली तंत्रों का उपयोग करती है, जिससे बड़े रीजनिंग मॉडल को विविध गणितीय बेंचमार्क में सटीकता से समझौता किए बिना काफी छोटे चेन-ऑफ-थॉट (Chain-of-Thought) आउटपुट उत्पन्न करने में सक्षम बनाया जा सके।