MQSS-Selector: RL-Guided Pass Selection for an MLIR Compilation Pipeline
Cet article introduit MQSS-Selector, un cadre unifié basé sur l'apprentissage qui exploite l'apprentissage par renforcement et l'apprentissage profond pour optimiser dynamiquement la sélection de dispositifs, l'ordonnancement des passes du compilateur et l'ordonnancement des tâches pour les flux de travail de calcul HPC-Quantique, visant à maximiser simultanément la fidélité tout en minimisant le temps de compilation et la latence dans l'ère NISQ.
Auteurs originaux : Andre Youssefi (Leibniz Supercomputing Centre), Ercüment Kaya (Leibniz Supercomputing Centre, Technical University of Munich), Minh Chung (Leibniz Supercomputing Centre), Jorge Echavarria (Munich Quantum Valley), Laura B. Schulz (Argonne National Laboratory), Martin Schulz (Leibniz Supercomputing Centre, Technical University of Munich)
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : MQSS-Selector
Énoncé du problème et motivation
La convergence du calcul haute performance (HPC) et de l'informatique quantique (QC) vers des infrastructures HPCQC unifiées nécessite des piles logicielles capables de jeter un pont entre les flux de travail classiques et quantiques. Cependant, les dispositifs actuels de l'ère NISQ (Noisy Intermediate-Scale Quantum) sont sujets aux erreurs, limités en ressources et hautement sensibles à la calibration et à la topologie. Par conséquent, une exécution efficace nécessite une compilation et une optimisation spécialisées.
Les piles logicielles existantes souffrent souvent de fragmentation, traitant la sélection du dispositif, l'optimisation des passes de compilation et l'ordonnancement des tâches comme des étapes isolées. L'article identifie deux défis critiques et interdépendants :
- Sélection du dispositif : Choisir un dispositif quantique cible parmi un ensemble de backends disponibles, en tenant compte de la topologie, de la fidélité des portes, des délais de file d'attente et des fenêtres de maintenance.
- Ordonnancement des phases (Phase Ordering) : Déterminer une séquence optimale de passes de compilation pour transformer un programme quantique, minimisant le temps de compilation Just-In-Time (JIT) et le temps d'exécution tout en garantissant la conformité au dispositif.
Les auteurs prouvent formellement (Théorème 1) que la sélection du dispositif et l'ordonnancement des phases sont tous deux des problèmes NP-difficiles, bien qu'ils se réduisent à des bases de complexité différentes : la sélection du dispositif se réduit au problème de la Partition, tandis que l'ordonnancement des phases se réduit au problème de l'arrêt (prouvant l'indécidabilité). De plus, leur interdépendance crée un « dilemme de démarrage » (bootstrapping dilemma), où l'optimisation d'une étape de manière isolée peut sous-optimaliser l'autre. Les solutions actuelles reposent souvent sur des heuristiques statiques ou des tâches d'apprentissage séparées (par exemple, l'apprentissage supervisé pour les dispositifs, l'apprentissage par renforcement pour les passes) qui ne parviennent pas à rendre compte des conditions dynamiques des backends ou de la nature conjointe de l'espace d'optimisation.
Méthodologie
L'article propose MQSS-Selector, un cadre unifié basé sur l'apprentissage, conçu pour intégrer la sélection du dispositif et l'ordonnancement des passes en un processus de prise de décision cohérent. L'approche exploite l'apprentissage par renforcement (RL) et l'apprentissage profond au sein du cadre de compilation MLIR (Multi-Level Intermediate Representation), utilisant spécifiquement le dialecte Quake.
La méthodologie est structurée autour de deux schémas conceptuels pour un ordonnanceur unifié, qui sont actuellement implémentés comme des composants distincts prévus pour une intégration future :
- Approche 1 (Hybride) : Une conception modulaire où un module d'apprentissage supervisé gère la sélection du dispositif, et sa sortie informe un module distinct basé sur le RL pour l'ordonnancement des phases.
- Approche 2 (Entièrement basée sur le RL) : Une conception monolithique où la sélection du dispositif et l'ordonnancement des phases sont combinés en un seul espace d'action plus large pour un agent de RL unifié.
Composants clés :
- Module de sélection du dispositif : Utilise des modèles d'apprentissage supervisé (MLP, Random Forest, SVM, KNN) pour prédire la fidélité de Hellinger d'un programme sur divers dispositifs. Le système normalise le temps d'exécution et la fidélité pour classer les dispositifs, privilégiant la précision du classement relatif plutôt que la précision de la valeur absolue.
- Module de sélection de passes : Implémente un algorithme Actor-Critic de RL.
- État : Comprend les caractéristiques du programme (nombre de qubits, profondeur), l'état du backend et les résultats de compilation intermédiaires.
- Action : Sélection de passes de compilation à partir d'une suite étendue de 92+ passes MQSS, une passe de mapping, ou une action « Finish ».
- Fonction de récompense : Conçue pour satisfaire l'exécutabilité (conformité aux portes natives), l'arrêt précoce (préférant les chemins plus courts pour des résultats équivalents) et l'optimisation structurelle (réduction de la profondeur et du nombre d'opérations).
- Dual-Annealed Exploration Priming (DAEP) : Une stratégie d'entraînement novatrice introduite pour répondre à la rareté des itérations de compilation réussies. DAEP introduit un terme de guidage dans la fonction de perte qui remplace la sélection de l'acteur par une politique prédéfinie avec une probabilité décroissante (pDAEP) et une magnitude (αDAEP). Cela accélère la convergence en fournissant une structure initiale avant que l'agent n'apprenne à exploiter les estimations du critique indépendamment.
Résultats expérimentaux
Les auteurs ont évalué les composants en utilisant deux jeux de données :
- Sélection de dispositif : Testée sur 128 programmes MQT-Bench sur 12 backends IBM fictifs et 2 880 benchmarks aléatoires sur deux dispositifs réels locaux.
- Résultats : Le Random Forest (RF) est apparu comme le candidat le plus approprié pour le jeu de données de dispositifs fictifs, surpassant les MLP qui peinaient avec les prédictions de programmes infaisables. Sur les dispositifs réels, où tous les programmes étaient exécutables, tous les modèles ont performé de manière similaire avec des scores R2 élevés. Les auteurs notent que si SVM et KNN ont montré une bonne prédiction de fidélité sur des données limitées, ils pourraient ne pas passer aussi bien à l'échelle que RF pour des ensembles de programmes diversifiés et de grande ampleur.
- Sélection de passes : Évaluée sur un jeu de données de 1 548 programmes d'Hamiltoniens chimiques.
- Résultats : L'agent de RL entraîné avec DAEP a nettement surpassé un baseline sans guidage.
- Exécutabilité : Le modèle guidé a atteint un taux de 95,5 % de programmes exécutables lors de la terminaison, contre 42,1 % pour le modèle non guidé.
- Optimisation : Le modèle guidé a réduit la profondeur du programme dans 87/154 échantillons et le nombre d'opérations dans 93/154 échantillons, alors que le modèle non guidé n'a obtenu ces réductions que dans 8 et 15 échantillons respectivement.
- Terminaison : L'agent guidé a appris à appeler l'action « Finish » efficacement (153/154 fois), tandis que l'agent non guidé terminait rarement de façon précoce.
- Critique : Les auteurs notent que le réseau critique nécessite un entraînement supplémentaire, car sa performance de classification (Vrais/Faux Positifs) était conservatrice dans le modèle guidé, probablement parce que l'acteur apprend à terminer efficacement avec moins d'étapes, fournissant ainsi moins d'échantillons d'entraînement pour le critique. Crucialement, les données expérimentales suggèrent que le RL sans méthodes additionnelles (comme DAEP) n'est pas une approche viable pour entraîner un réseau pour la compilation sous les contraintes de ressources considérées.
- Résultats : L'agent de RL entraîné avec DAEP a nettement surpassé un baseline sans guidage.
Signification et revendications
L'article prétend démontrer la faisabilité des blocs de construction fondamentaux (sélection de dispositif supervisée et ordonnancement de passes basé sur le RL) pour une approche de compilation quantique pilotée par les données et native à MLIR. Les principales contributions sont :
- Concept de cadre unifié : L'article propose un cadre d'optimisation conjoint pour traiter la nature NP-difficile et interdépendante de la sélection du dispositif et des passes, s'éloignant des heuristiques fragmentées et spécifiques à chaque étape. Cependant, l'ordonnanceur unifié lui-même reste un concept de conception avec deux composants distincts prévus pour une intégration future, plutôt qu'un système pleinement intégré et démontré.
- Implémentation native à MLIR : Contrairement aux travaux antérieurs (par exemple, TuniQ) qui ciblent Qiskit, ce travail étend la suite de passes de compilation MQSS avec un large ensemble de passes basées sur MLIR, permettant une intégration avec les infrastructures de compilation modernes.
- Stratégie DAEP : L'introduction du Dual-Annealed Exploration Priming répond au défi de la rareté des récompenses dans les tâches de compilation, permettant à l'agent de RL d'apprendre des politiques efficaces là où l'exploration aléatoire échouerait.
- Perspective modeste : Les auteurs concluent que, bien que l'approche unifiée ait le potentiel de surpasser les pipelines d'optimisation indépendants en exploitant les interdépendances, la composante de sélection de passes nécessite actuellement un entraînement et un guidage plus approfondis. Ils soulignent que ce travail établit les fondations d'un ordonnanceur adaptatif et pleinement intégré capable de gérer des environnements HPCQC dynamiques, plutôt que de prétendre que le système unifié est totalement réalisé.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles quantum physics chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.