TEDlm: domain-centric protein language models with optional structural pre-training
Das Paper stellt TEDlm vor, ein domänenzentriertes Protein-Sprachmodell, das auf strukturell definierten Domänensegmenten vortrainiert wurde und größere Full-Sequence-Modelle bei der Detektion von Fernhomologie sowie der Vorhersage molekularer Funktionen übertrifft, was zeigt, dass die Konzentration auf domänenspezifische Signale kompakte, strukturell informierte Repräsentationen liefert.