Pseudoperplexity Probes Memorization in Protein Language Models
Este estudo utiliza a pseudoperplexidade para demonstrar que o modelo de linguagem de proteínas ProtT5 exibe uma memorização detectável, porém limitada, de seus dados de treinamento, sugerindo que ele generaliza primordialmente a gramática estatística das proteínas em vez de apenas realizar a aprendizagem mecânica de sequências.