Scale Determines Whether Language Models Organize Representation Geometry for Prediction
यह शोध पत्र Subspace PGA को प्रस्तुत करता है जिससे यह पता चलता है कि जबकि भाषा मॉडल की प्रतिनिधित्व ज्यामिति (representation geometry) भविष्यवाणी के लिए व्यवस्थित होती है, छोटे मॉडल बाद की परतों में इस संरेखण (alignment) को खो देते हैं जो प्रमुख दिशाओं द्वारा छिपा हुआ एक क्षमता संबंधी समझौता (capacity trade-off) है, जबकि बड़े मॉडल प्रशिक्षण के दौरान इसे बनाए रखते हैं।