On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
यह शोध पत्र प्रकट करता है कि DeepSeek-R1 के लंबे Chain-of-Thought प्रक्षेप पथों (trajectories) पर सुपरवाइज्ड फाइन-ट्यूनिंग करने से gpt-oss-120b डेटा की तुलना में कम प्रशिक्षण हानि (training loss) तो प्राप्त होती है, लेकिन अक्षम और विचलित तर्क पैटर्न के कारण सामान्यीकरण (generalization) खराब हो जाता है, और यह बार-बार शाखाओं में विभाजित होने वाले प्रक्षेप पथों को फ़िल्टर करने का प्रस्ताव देता है जिससे तर्क प्रदर्शन में उल्लेखनीय सुधार होता है।