A novel benchmark dataset for enzyme function prediction reveals the limitations of state-of-the-art models
El artículo presenta EnzymARC, un nuevo conjunto de datos de referencia de señuelos de enzimas estructuralmente perturbados, para demostrar que los actuales predictores de función enzimática de última generación dependen en gran medida de atajos filogenéticos y no logran distinguir variantes catalíticamente incompetentes de enzimas funcionales, resaltando así la necesidad crítica de ejemplos negativos conscientes de la estructura en el entrenamiento y la evaluación de modelos.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo
En la vasta biblioteca de la vida, cada ser vivo porta un conjunto de instrucciones escritas en un código llamado ADN. Dentro de estas instrucciones se encuentran los planos de diminutas máquinas biológicas conocidas como enzimas. Estas enzimas actúan como los trabajadores de la célula, acelerando las reacciones químicas que mantienen vivo a un organismo, desde la digestión de los alimentos hasta la reparación del tejido dañado. Para llevar la cuenta de los millones de enzimas diferentes que han descubierto, los científicos utilizan un sistema de etiquetado estandarizado llamado números de la Comisión de Enzimas. Piense en estos números como un sistema de catálogo universal que le dice a un investigador exactamente qué labor realiza una enzima específica. A medida que los científicos secuencian los genomas de más y más organismos, están encontrando nuevas enzimas a un ritmo asombroso. El desafío ahora es averiguar qué hacen estas enzimas recién descubiertas sin tener que probar cada una en un laboratorio, una tarea que tomaría siglos. Para resolver esto, los investigadores han recurrido a las computadoras, entrenando a la inteligencia artificial para que observe la secuencia de una enzima y prediga su función basándose en patrones que ha aprendido de ejemplos conocidos.
Un equipo de investigadores decidió recientemente probar si estos modelos computacionales realmente comprenden cómo funcionan las enzimas o si simplemente están tomando atajos. Crearon un nuevo conjunto de datos de prueba llamado EnzymARC para ver si los mejores programas actuales podrían distinguir entre una enzima funcional y una rota. Para construir esta prueba, partieron de enzimas que ya se sabía que funcionaban y luego las dañaron sistemáticamente. Utilizando un modelo computacional de la forma tridimensional de la enzima, atacaron el lugar específico donde ocurre la reacción química, conocido como el sitio activo. Luego, alteraron la estructura de una manera que destruiría la capacidad de la enzima para funcionar, creando lo que llaman secuencias "señuelo". Estos señuelos fueron diseñados para parecerse casi exactamente a las enzimas originales y funcionales, excepto por el daño crítico en la maquinaria que las hace trabajar. Crearon estas versiones rotas cambiando la estructura dentro de distancias específicas desde el sitio activo, que variaban desde un radio muy ajustado de 5 Angstroms hasta uno más amplio de 15 Angstroms, asegurando que el resto de la enzima permaneciera prácticamente sin cambios.
Los investigadores alimentaron luego estos señuelos rotos en tres tipos diferentes de herramientas de predicción computacional para ver qué dirían las máquinas. Una herramienta se basaba en encontrar secuencias similares en una base de datos, otra utilizó un método que aprende comparando diferentes formas de proteínas, y la tercera fue un modelo de aprendizaje profundo entrenado específicamente para reconocer enzimas que no funcionan. Los resultados fueron reveladores. Cuando los modelos computacionales observaron las enzimas ligeramente dañadas, fallaron casi por completo. A pesar de que la maquinaria catalítica había sido destruida, los modelos asignaron con confianza la descripción de la labor original y correcta a las enzimas rotas. De hecho, para los señuelos menos dañados, los modelos realizaron predicciones falsas más del 90 por ciento de las veces. Esto sugiere que los modelos no están aprendiendo realmente las reglas físicas de cómo funciona una enzima; en su lugar, están recurriendo a un atajo. Están observando la similitud general con las enzimas conocidas y asumiendo que si parece un pato, debe ser un pato, incluso si el pato está roto.
Incluso el modelo más avanzado, que había sido entrenado para reconocer enzimas rotas, tuvo dificultades para identificar el daño específico cuando este se centraba en el sitio activo. Si bien este modelo funcionó mejor cuando el daño era más severo, aun así pasó por alto las interrupciones dirigidas que dejaban a la enzima inútil. El estudio demuestra que los programas computacionales actuales son altamente vulnerables a estos atajos filogenéticos, lo que significa que son fácilmente engañados por la historia familiar de una proteína en lugar de su función real. Los investigadores concluyen que, para construir herramientas verdaderamente confiables para comprender la biología, la próxima generación de modelos debe ser entrenada con ejemplos que incluyan estas versiones rotas y conscientes de la estructura. Solo enseñando a las computadoras a reconocer la diferencia entre una máquina funcional y una rota, en lugar de simplemente emparejar patrones, podremos desarrollar modelos lo suficientemente robustos como para manejar la compleja realidad de la función enzimática.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.