A geometric atlas of how ESM3 organizes modalities across depth
Este estudio revela que en el modelo de lenguaje de proteínas multimodal ESM3, las distintas modalidades físicas (secuencia, estructura, estructura secundaria y accesibilidad al solvente) ocupan inicialmente subespacios separados antes de fusionarse en una representación compartida de baja dimensión entre las capas 25 y 35, mientras que las anotaciones funcionales permanecen ortogonales en todo momento, siendo este proceso de fusión una propiedad aprendida y universal independiente de la longitud de la proteína, pero retrasada por el desorden estructural.