Pseudoperplexity Probes Memorization in Protein Language Models
Deze studie maakt gebruik van pseudoperplexiteit om aan te tonen dat het proteïnelinguïstische model ProtT5 een detecteerbare maar beperkte memorisatie van zijn trainingsdata vertoont, wat suggereert dat het primair de statistische grammatica van proteïnen generaliseert in plaats van simpelweg sequenties uit het hoofd te leren.