Exploration-Driven Optimization for Test-Time Large Language Model Reasoning
यह शोध पत्र एक्सप्लोरेशन-ड्रिवन ऑप्टिमाइजेशन (EDO) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो iDPO और GRPO जैसी पुनरावृत्ति पोस्ट-ट्रेनिंग विधियों में विविधता-बढ़ाने वाले एक्सप्लोरेशन उद्देश्यों को एकीकृत करता है ताकि इन्फरेंस-टाइम सैंपलिंग विविधता और RL-प्रेरित वितरण शार्पनिंग के बीच के तनाव को हल किया जा सके, जिससे इन-डिस्ट्रीब्यूशन और आउट-ऑफ-डिस्ट्रीब्यूशन दोनों कार्यों में LLM रीजनिंग प्रदर्शन और स्थिरता को बढ़ाया जा सके।