Interrogating contrastive learning embeddings for structure-based virtual screening: a case study on DrugCLIP
Cet article évalue systématiquement les plongements de l'apprentissage contrastif de DrugCLIP pour le criblage virtuel basé sur la structure, révélant que si ses plongements de poches offrent une recherche de similitude structurelle rapide et robuste et que ses plongements de ligands capturent des motifs chimiques sensibles à la poche avec une forte capacité de généralisation aux cibles inconnues, la performance est significativement limitée par les variations conformationnelles et les inexactitudes des poches protéiques prédites.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Trouver un nouveau médicament est un pari lent et coûteux. Cela peut prendre quinze ans et coûter plus d'un milliard de dollars pour mettre un seul médicament sur le marché, principalement parce que la plupart des candidats potentiels échouent en cours de route. Pour réduire ce gaspillage, les scientifiques utilisent des programmes informatiques pour passer au crible des millions de composés chimiques, à la recherche des rares éléments qui pourraient se fixer à une protéine spécifique causant une maladie. Ce processus, appelé criblage virtuel, agit comme un filtre, réduisant une immense bibliothèque de possibilités à une liste gérable pour des tests en conditions réelles. Pendant des décennies, cela reposait sur l'appariement de la forme physique d'un médicament à la forme du site de liaison d'une protéine, une tâche très gourmande en calcul et souvent trop lente pour le nombre immense de protéines et de produits chimiques désormais disponibles.
Récemment, une nouvelle approche est apparue qui traite cette recherche comme un problème de traduction de langue. Au lieu de calculer la physique de chaque interaction, ces méthodes utilisent l'intelligence artificielle pour traduire à la fois la poche de liaison de la protéine et la molécule du médicament dans un langage de nombres abstrait et partagé. Dans cet espace partagé, un médicament qui s'ajuste bien à une protéine aura un motif numérique très similaire au propre motif de la protéine, tandis qu'une mauvaise correspondance paraîtra très différente. Cela permet aux ordinateurs de trouver de bonnes correspondances en comparant simplement ces motifs numériques, un processus incroyablement rapide. Un tel outil, appelé DrugCLIP, a montré de grandes promesses, mais jusqu'à présent, les scientifiques ne comprenaient pas pleinement ce que ces motifs numériques abstraits représentaient réellement. Ils savaient que l'outil fonctionnait, mais ils ne savaient pas s'il comprenait vraiment la chimie ou s'il se contentait de mémoriser les réponses.
Une équipe de chercheurs de l'University College London a décidé d'ouvrir la boîte noire de DrugCLIP pour voir exactement ce qui se passait à l'intérieur. Ils ont traité l'outil non pas comme une baguette magique, mais comme un système qui peut être mesuré et compris. Leur enquête a révélé que l'outil avait appris quelque chose de bien plus utile que le simple appariement de médicaments à des protéines. Les chercheurs ont découvert que la représentation interne par l'outil de la poche de liaison d'une protéine était si précise qu'elle pouvait identifier des poches similaires à travers différentes protéines mieux que n'importe quelle méthode existante, et ce, plus de cent fois plus vite. C'était une surprise car l'outil n'avait jamais été explicitement enseigné pour trouver des poches similaires ; il avait seulement appris à trouver des médicaments qui se lient. Pourtant, en apprenant à trouver des médicaments, il avait par inadvertance appris à reconnaître la forme et la structure des poches elles-mêmes avec une précision remarquable.
L'équipe a également examiné comment l'outil gérait la réalité physique des molécules. Les protéines et les médicaments ne sont pas des statues rigides ; ils oscillent et se déplacent. Les chercheurs ont testé si l'outil serait confus si une molécule de médicament était présentée sous une forme légèrement différente ou si la protéine se trouvait dans une position légèrement différente. Ils ont découvert que l'outil était remarquablement robuste. Même lorsqu'on présentait le même médicament sous des dizaines de formes oscillantes différentes, l'outil les reconnaissait comme étant la même molécule. De même, lorsque la poche de la protéine était présentée dans différents états — certaines liées à un médicament, d'autres vides, et d'autres prédites par d'autres modèles d'IA — la carte interne de l'outil restait cohérente. Cependant, l'étude a également tracé une ligne claire où les performances de l'outil commençaient à décliner. Lorsque les chercheurs utilisaient des structures de protéines prédites qui comportaient les mauvais acides aminés dans le site de liaison, ou lorsque les chaînes latérales de la protéine pointaient dans la mauvaise direction, la capacité de l'outil à trouver le bon médicament chutait considérablement. Cela indiquait que, bien que l'outil soit puissant, il reste dépendant de l'obtention d'une image précise de la structure physique de la protéine.
Le résultat le plus important fut peut-être un test visant à déterminer si l'outil reposait sur la mémorisation. Les chercheurs ont créé un test strict en demandant à l'outil de trouver des médicaments pour des protéines et des produits chimiques qu'il n'avait jamais vus auparavant, garantissant qu'il ne pouvait pas simplement se rappeler les réponses de ses données d'entraînement. Les résultats ont été encourageants. Pour de nouvelles protéines dotées d'une chimie totalement nouvelle, l'outil parvenait toujours à classer le bon médicament dans le premier pour cent de tous les candidats possibles dans environ 55 à 75 pour cent des cas. Cela a prouvé que l'outil apprenait véritablement les règles de l'interaction entre les protéines et les médicaments, plutôt que de simplement mémoriser une liste de paires connues. Cela a montré que l'outil pouvait généraliser ses connaissances à des situations entièrement nouvelles, une exigence critique pour la découverte de médicaments dans le monde réel.
L'étude a conclu que, bien que des outils comme DrugCLIP représentent un bond en avant massif en termes de vitesse et de capacité, ils ne sont pas encore parfaits. Leur succès dépend de la précision de la structure de la protéine fournie. Si le modèle initial de la protéine est légèrement erroné, ou si le site de liaison prédit inclut les mauvais atomes, les performances de l'outil en pâtissent. Les chercheurs suggèrent que la prochaine étape pour améliorer ces systèmes n'est pas seulement une meilleure IA, mais de meilleures méthodes pour prédire la forme précise des poches protéiques. En combinant ces outils de criblage rapides et intelligents avec des prédictions structurelles plus précises, les scientifiques peuvent se rapprocher d'un avenir où la découverte de nouveaux médicaments est plus rapide, moins chère et plus fiable. Ce travail démystifie une technologie complexe, montrant qu'elle est un nouveau prisme puissant pour voir le monde moléculaire, à condition que le prisme lui-même soit tenu fermement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.