TEDlm: domain-centric protein language models with optional structural pre-training
O artigo introduz o TEDlm, um modelo de linguagem de proteínas centrado em domínios pré-treinado em segmentos de domínios estruturalmente definidos que supera modelos de sequência completa maiores na detecção de homologia remota e na predição de função molecular, demonstrando que focar em sinais intrínsecos aos domínios produz representações compactas e estruturalmente informadas.