Compute Aligned Training: Optimizing for Test Time Inference
यह शोध पत्र "कंप्यूट अलाइन्ड ट्रेनिंग" (Compute Aligned Training) पेश करता है, जो एक नया फ्रेमवर्क है जो नए लॉस फंक्शन्स को व्युत्पन्न करके लार्ज लैंग्वेज मॉडल्स के ट्रेनिंग ऑब्जेक्टिव्स को टेस्ट-टाइम इन्फरेंस रणनीतियों के साथ संरेखित करता है, जिससे मानक SFT और RL दृष्टिकोणों की तुलना में प्रदर्शन स्केलिंग में महत्वपूर्ण सुधार होता है।