Rewriting protein alphabets with language models
Ce papier présente TEA, un nouvel alphabet protéique à 20 lettres dérivé des embeddings de modèles de langage par apprentissage contrastif, qui permet une détection rapide et sensible d'homologies lointaines rivalisant avec les méthodes basées sur la structure tout en exploitant les algorithmes de recherche de séquences existants.