How many crystal structures do you need to trust your docking results?
L'analyse de 403 structures cristallines de la protéase principale du SARS-CoV-2 issues du projet COVID Moonshot révèle que la précision de la prédiction de pose basée sur la structure plafonne après la collecte d'environ cinq structures par échafaudage générique, offrant ainsi une directive pratique pour optimiser l'allocation des ressources dans les campagnes de découverte de médicaments.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Dans le monde à enjeux élevés de la découverte de nouveaux médicaments, les scientifiques s'appuient souvent sur une stratégie appelée découverte de médicaments basée sur la structure. Imaginez que vous essayez de concevoir une clé qui s'insère parfaitement dans une serrure complexe et tridimensionnelle. Dans ce cas, la serrure est une protéine à l'intérieur du corps humain qui provoque une maladie, et la clé est une nouvelle molécule médicamenteuse. Pour que la clé s'ajuste, les chercheurs doivent savoir exactement quelle est la forme de la serrure et comment les clés précédentes s'y sont logées. Pendant des décennies, le moyen le plus fiable de voir cette forme a été de figer la protéine avec un médicament attaché et d'en prendre une photo à l'aide de rayons X, un processus qui crée une structure cristalline. Ces images servent de plans, montrant aux scientifiques exactement où le médicament se lie afin qu'ils puissent ajuster la conception de futurs médicaments pour les rendre plus puissants et plus précis. Cependant, prendre ces photos est coûteux, lent et difficile. Cela nécessite de faire croître des cristaux parfaits et de les envoyer sur des machines massives, ce qui signifie que les scientifiques sont souvent confrontés à un choix difficile : combien de ces photos coûteuses doivent-ils réellement prendre avant d'avoir suffisamment d'informations pour avancer ?
Une équipe de chercheurs s'est donné pour mission de répondre à cette question en revenant sur l'un des efforts de découverte de médicaments les plus vastes et les plus ouverts de l'histoire : le COVID Moonshot. Ce projet mondial visait à trouver un traitement contre le virus qui cause la COVID-19 en testant des milliers de conceptions chimiques différentes contre la principale protéase du virus, une enzyme critique dont le virus a besoin pour survivre. Tout au long de la campagne, l'équipe a généré une collection sans précédent de 403 structures cristallines, chacune montrant une molécule médicamenteuse légèrement différente liée à l'enzyme. Cet ensemble de données massif a offert une occasion unique de tester une hypothèse courante dans le domaine. De nombreux scientifiques pensaient que plus ils collecteraient de structures cristallines, meilleurs deviendraient leurs modèles informatiques pour prédire comment de nouveaux médicaments, encore non vus, s'inséreraient. Les chercheurs voulaient voir s'il existait un point où la collecte de plus de photos cessait d'être utile, un moment de rendements décroissants où le coût de la prise d'une photo supplémentaire l'emporte sur le bénéfice de la nouvelle information fournie.
Pour mener cette enquête, les chercheurs ont utilisé une méthode appelée « docking croisé » (cross-docking). Au lieu de simplement regarder les photos qu'ils possédaient déjà, ils ont utilisé leurs ordinateurs pour simuler le placement de chaque molécule médicamenteuse de la collection dans le site de liaison de chaque autre structure cristalline dont ils disposaient. Ils ont ensuite vérifié si l'ordinateur pouvait prédire correctement la position du médicament en se basant sur les structures de référence disponibles. Ils ont mesuré le succès en vérifiant si la supposition de l'ordinateur se trouvait à une distance infime de la position réellement observée expérimentalement. En faisant tourner ces simulations avec différents nombres de structures de référence, ils ont pu observer comment la précision s'améliorait à mesure que des données étaient ajoutées. Ils ont également comparé deux approches différentes : une qui n'utilisait que la forme de la protéine pour deviner l'ajustement, et une autre qui utilisait les formes des médicaments précédents comme guide pour aider l'ordinateur à aligner les nouvelles molécules.
Les résultats ont révélé un schéma clair qui remet en question l'idée selon laquelle « plus, c'est toujours mieux ». Les chercheurs ont découvert que la précision des prédictions dépendait fortement de la similitude entre le nouveau médicament et les médicaments déjà présents dans la base de données. Lorsque la nouvelle molécule ressemblait beaucoup à une précédente, l'ordinateur pouvait prédire sa position avec une grande précision en utilisant seulement quelques structures de référence. Cependant, la découverte la plus surprenante concernait la variété des structures plutôt que le nombre total. L'équipe a découvert qu'une fois qu'ils possédaient environ cinq structures cristallines pour un cadre chimique spécifique, ou « scaffold », ajouter d'autres structures de ce même type n'apportait presque aucun bénéfice supplémentaire. Le taux de réussite de la prédiction de la position du médicament plafonnait, atteignant un niveau où il était presque impossible de l'améliorer simplement en collectant plus de molécules du même type.
En fait, l'étude a montré que la diversité des structures chimiques était bien plus importante que le volume pur de données. Pour la série de médicaments la plus performante de la campagne, posséder seulement cinq structures cristallines de la même forme de base suffisait à atteindre un taux de réussite de plus de 95 pour cent. Ajouter des dizaines d'autres structures de cette même forme n'augmentait pas significativement ce chiffre. À l'inverse, lorsque les chercheurs tentaient de prédire la position d'un médicament avec une forme chimique totalement nouvelle, la précision chutait, à moins qu'ils ne disposent d'une structure de référence correspondant à cette nouvelle forme. Cela suggère que l'utilisation la plus précieuse des ressources ne consiste pas à continuer à prendre des photos de versions légèrement différentes du même médicament, mais à prendre des photos de formes chimiques entièrement nouvelles dès qu'elles sont découvertes.
Les chercheurs ont également examiné si la qualité des structures cristallines importait. Ils ont étudié des facteurs tels que la netteté des images et l'agitation des atomes dans le modèle. Ils ont constaté que même avec des images de moindre qualité, les modèles informatiques pouvaient toujours prédire les positions des médicaments avec précision, à condition que les formes chimiques soient suffisamment similaires. Cela indique que le goulot d'étranglement du processus n'est pas la qualité des images de rayons X, mais plutôt la capacité de l'ordinateur à générer la position de départ correcte du médicament. Même lorsqu'on donnait à l'ordinateur un moyen parfait de classer la meilleure supposition, il ne pouvait pas améliorer le taux de réussite bien au-delà de ce qu'il avait atteint avec une méthode de notation standard. Cela suggère que le défi principal réside dans la génération initiale de la position du médicament, et non dans le choix de la bonne option parmi une liste de possibilités.
Ces conclusions offrent un guide pratique pour les futures campagnes de découverte de médicaments. Au lieu de passer du temps et de l'argent à collecter des centaines de structures cristallines pour une seule série chimique, les scientifiques peuvent désormais viser un ensemble plus restreint et plus stratégique. En se concentrant sur la collecte de structures pour quelques cadres chimiques différents, peut-être cinq à dix structures par cadre, ils peuvent atteindre un niveau de puissance prédictive presque identique à celui obtenu en collectant des centaines de structures. Cette approche permet aux chercheurs d'avancer plus vite et plus efficacement, en dirigeant leurs ressources vers l'exploration de nouveaux territoires chimiques plutôt que vers le réexamen de terrains déjà connus. L'étude confirme une intuition de longue date chez les chimistes médicinaux : posséder un ensemble de points de référence diversifiés est plus puissant que de posséder un ensemble profond de points similaires. En comprenant où les rendements diminuent, la communauté scientifique peut prendre des décisions plus intelligentes sur la manière d'allouer le temps et l'argent nécessaires pour apporter de nouveaux médicaments au monde.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.