Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR
यह शोध पत्र 'रिनफोर्समेंट लर्निंग विद वेरीफिएबल रिवार्ड्स' (RLVR) में 'लो-रैंक अडैप्टेशन' (LoRA) के लिए 'जियोमेट्री-प्रिजर्विंग ऑर्थोनॉर्मल इनिशियलाइजेशन' का प्रस्ताव करता है, जो सैद्धांतिक रूप से यह प्रदर्शित करता है कि यह दृष्टिकोण 'फुल फाइन-ट्यूनिंग' के अंतर को न्यूनतम करता है, प्रशिक्षण को स्थिर करता है, और गणितीय तर्क संबंधी बेंचमार्क पर PiSSA और MiLoRA जैसे मौजूदा वेरिएंट्स से बेहतर प्रदर्शन करता है।