Deriving Neural Scaling Laws from the statistics of natural language
Questo articolo presenta la prima teoria che predice quantitativamente, partendo da primi principi, gli esponenti di scaling dei modelli linguistici di grandi dimensioni in condizioni di dati limitati, derivando una formula priva di parametri basata esclusivamente sul decadimento delle correlazioni tra coppie di token e sul decadimento dell'entropia condizionale del prossimo token nel linguaggio naturale.