SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
SmartThinker एक नवीन GRPO-आधारित विधि है जो बड़े रीजनिंग मॉडल्स में रेडंडेंसी (अनावश्यकता) और ओवरथिंकिंग को कम करने के लिए प्रशिक्षण के दौरान चेन-ऑफ-थॉट की लंबाई को गतिशील रूप से कैलिब्रेट करती है, जिससे जटिल बेंचमार्क पर सटीकता में सुधार या उसे बनाए रखते हुए महत्वपूर्ण टोकन संपीड़न (कंप्रेशन) प्राप्त होता है।