Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study
यह अध्ययन प्रकट करता है कि RL-प्रशिक्षित लीन (Lean) प्रमेय सिद्ध करने वाले (theorem provers) इन्फरेंस-टाइम मोड कोलैप्स (inference-time mode collapse) से ग्रस्त होते हैं, जिसे विविध टैक्टिक स्केलेटन (diverse tactic skeletons) के एक निश्चित शेड्यूल को लागू करके प्रभावी ढंग से कम किया जा सकता है जिससे महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं, जबकि प्रॉम्प्ट पैराफ्रेसिंग (prompt paraphrasing) और अप्रासंगिक टिप्पणियाँ अप्रभावी या हानिकारक सिद्ध होती हैं।