MQSS-Selector: RL-Guided Pass Selection for an MLIR Compilation Pipeline
Questo articolo introduce MQSS-Selector, un framework unificato basato sull'apprendimento che sfrutta il reinforcement e il deep learning per ottimizzare dinamicamente la selezione dei dispositivi, l'ordinamento dei pass del compilatore e lo scheduling dei job per i flussi di lavoro HPC-Quantum, con l'obiettivo di massimizzare simultaneamente la fedeltà minimizzando al contempo il tempo di compilazione e la latenza nell'era NISQ.
Autori originali: Andre Youssefi (Leibniz Supercomputing Centre), Ercüment Kaya (Leibniz Supercomputing Centre, Technical University of Munich), Minh Chung (Leibniz Supercomputing Centre), Jorge Echavarria (Munich Quantum Valley), Laura B. Schulz (Argonne National Laboratory), Martin Schulz (Leibniz Supercomputing Centre, Technical University of Munich)
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Riepilogo Tecnico: MQSS-Selector
Problema e Motivazione
La convergenza tra High Performance Computing (HPC) e Quantum Computing (QC) in infrastrutture HPCQC unificate richiede stack software capaci di colmare il divario tra i workflow classici e quantistici. Tuttavia, i dispositivi attuali Noisy Intermediate-Scale Quantum (NISQ) sono soggetti a errori, limitati nelle risorse e altamente sensibili alla calibrazione e alla topologia. Di conseguenza, un'esecuzione efficace richiede compilazione e ottimizzazione specializzate.
Gli stack software esistenti soffrono spesso di frammentazione, trattando la selezione del dispositivo, l'ottimizzazione dei passaggi del compilatore e lo scheduling dei job come fasi isolate. Il documento identifica due sfide critiche e interdipendenti:
- Selezione del Dispositivo: Scegliere un dispositivo quantistico target da un insieme di backend disponibili, considerando topologia, fedeltà delle porte (gate fidelity), ritardi di coda e finestre di manutenzione.
- Ordinamento dei Passaggi (Phase Ordering): Determinare una sequenza ottimale di passaggi del compilatore per trasformare un programma quantistico, minimizzando il tempo di compilazione Just-In-Time (JIT) e il tempo di esecuzione, garantendo al contempo la conformità al dispositivo.
Gli autori dimostrano formalmente (Teorema 1) che sia la selezione del dispositivo che l'ordinamento dei passaggi sono problemi NP-difficili, sebbene si riducano a basi di difficoltà differenti: la selezione del dispositivo si riduce al problema della Partizione, mentre l'ordinamento dei passaggi si riduce al problema della fermata (dimostrando l'indecidibilità). Inoltre, la loro interdipendenza crea un "dilemma di bootstrapping", in cui l'ottimizzazione di una fase in isolamento può rendere subottimale l'altra. Le soluzioni attuali spesso si affidano a euristiche statiche o a compiti di apprendimento separati (ad esempio, apprendimento supervisionato per i dispositivi, RL per i passaggi) che non tengono conto delle condizioni dinamiche del backend o della natura congiunta dello spazio di ottimizzazione.
Metodologia
Il documento propone MQSS-Selector, un framework unificato basato sull'apprendimento, progettato per integrare la selezione del dispositivo e l'ordinamento dei passaggi in un processo decisionale coeso. L'approccio sfrutta il Reinforcement Learning (RL) e il Deep Learning all'interno del framework di compilazione MLIR (Multi-Level Intermediate Representation), utilizzando specificamente il dialetto Quake.
La metodologia è strutturata attorno a due schemi concettuali per uno scheduler unificato, attualmente implementati come componenti separati in vista di una futura integrazione:
- Approccio 1 (Ibrido): Un design modulare in cui un modulo di apprendimento supervisionato gestisce la selezione del dispositivo, e il suo output informa un modulo separato basato su RL per l'ordinamento dei passaggi.
- Approccio 2 (Completamente basato su RL): Un design monolitico in cui la selezione del dispositivo e l'ordinamento dei passaggi sono combinati in un unico, più ampio spazio di azione per un singolo agente RL.
Componenti Chiave:
- Modulo di Selezione del Dispositivo: Utilizza modelli di apprendimento supervisionato (MLP, Random Forest, SVM, KNN) per prevedere la fedeltà di Hellinger di un programma su vari dispositivi. Il sistema normalizza il tempo di esecuzione e la fedeltà per classificare i dispositivi, dando priorità alla precisione della classifica relativa rispetto alla precisione del valore assoluto.
- Modulo di Selezione dei Passaggi: Implementa un algoritmo Actor-Critic RL.
- Stato: Include le caratteristiche del programma (numero di qubit, profondità), lo stato del backend e i risultati intermedi della compilazione.
- Azione: Selezione di passaggi di compilazione da una suite estesa di passaggi MQSS (oltre 92 passaggi), un passaggio di mappatura o un'azione di "Fine" (Fine).
- Funzione di Ricompensa (Reward Function): Progettata per soddisfare l'eseguibilità (conformità alle porte native), l'arresto anticipato (preferendo percorsi più brevi per risultati equivalenti) e l'ottimizzazione strutturale (riduzione della profondità e del numero di operazioni).
- Dual-Annealed Exploration Priming (DAEP): Una nuova strategia di addestramento introdotta per affrontare la scarsità di rollout di compilazione riusciti. DAEP introduce un termine di guida nella funzione di perdita che sovrascrive la selezione dell'attore con una policy predefinita con una probabilità decrescente (pDAEP) e una magnitudo (αDAEP). Ciò accelera la convergenza fornendo una struttura iniziale prima che l'agente impari a sfruttare le stime del critico indipendentemente.
Risultati Sperimentali
Gli autori hanno valutato i componenti utilizzando due dataset:
- Selezione del Dispositivo: Testata su 128 programmi MQT-Bench su 12 mock IBM backend e 2.880 benchmark casuali su due dispositivi reali locali.
- Risultati: Random Forest (RF) è emerso come il candidato più adatto per il dataset dei dispositivi mock, superando gli MLP che faticavano con le previsioni di programmi non fattibili. Sui dispositivi reali, dove tutti i programmi erano eseguibili, tutti i modelli si sono comportati in modo simile con punteggi R2 elevati. Gli autori notano che, sebbene SVM e KNN abbiano mostrato una buona previsione della fedeltà con dati limitati, potrebbero non scalare bene quanto RF per set di programmi diversificati e su larga scala.
- Selezione dei Passaggi: Valutata su un dataset di 1.548 programmi di Hamiltoniana chimica.
- Risultati: L'agente RL addestrato con DAEP ha superato significativamente un baseline senza guida.
- Eseguibilità: Il modello guidato ha raggiunto un tasso del 95,5% di programmi eseguibili al termine, rispetto al 42,1% del modello non guidato.
- Ottimizzazione: Il modello guidato ha ridotto la profondità del programma in 87/154 campioni e il numero di operazioni in 93/154 campioni, mentre il modello non guidato ha ottenuto queste riduzioni solo in 8 e 15 campioni rispettivamente.
- Terminazione: L'agente guidato ha imparato a chiamare l'azione "Finish" efficacemente (153/154 volte), mentre l'agente non guidato raramente terminava in anticipo.
- Critica: Gli autori notano che la rete del critico richiede un ulteriore addestramento, poiché le sue prestazioni di classificazione (Veri/Falsi Positivi) sono state conservative nel modello guidato, probabilmente perché l'attore ha imparato a terminare in modo efficiente con meno passi, fornendo così meno campioni di addestramento per il critico. Fondamentalmente, i dati sperimentali suggeriscono che l'RL senza metodi aggiuntivi (come DAEP) non è un approccio praticabile per l'addestramento di una rete per la compilazione sotto i vincoli di risorse considerati.
- Risultati: L'agente RL addestrato con DAEP ha superato significativamente un baseline senza guida.
Significatività e Rivendicazioni
Il documento sostiene di dimostrare la fattibilità dei blocchi costruttivi fondamentali (selezione del dispositivo tramite apprendimento supervisionato e ordinamento dei passaggi basato su RL) per un approccio alla compilazione quantistica nativo di MLIR e basato sui dati. I contributi chiave includono:
- Concetto di Framework Unificato: Il documento propone un framework di ottimizzazione congiunta per affrontare la natura NP-difficile e interdipendente della selezione del dispositivo e dei passaggi, allontanandosi dalle euristiche frammentate e specifiche per fase. Tuttavia, lo scheduler unificato rimane un design concettuale con due componenti separate pianificate per una futura integrazione, piuttosto che un sistema integrato pienamente dimostrato.
- Implementazione Nativa MLIR: A differenza del lavoro precedente (ad esempio, TuniQ) che mira a Qiskit, questo lavoro estende la suite di passaggi MQSS X con un vasto set di passaggi basati su MLIR, consentendo l'integrazione con moderne infrastrutture di compilazione.
- Strategia DAEP: L'introduzione di Dual-Annealed Exploration Priming affronta la sfida delle ricompense scarse nelle attività di compilazione, permettendo all'agente RL di apprendere politiche efficaci dove l'esplorazione casuale fallirebbe.
- Prospettiva Modesta: Gli autori concludono che, sebbene l'approccio unificato abbia il potenziale per superare le pipeline di ottimizzazione indipendenti sfruttando le interdipendenze, la componente di selezione dei passaggi richiede attualmente un addestramento e una guida più estesi. Essi sottolineano che l'attuale lavoro stabilisce i blocchi costruttivi fondamentali per uno scheduler adattivo e completamente integrato, capace di gestire ambienti HPCQC dinamici, piuttosto che pretendere che il sistema unificato sia pienamente realizzato.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.
Ricevi i migliori articoli di quantum physics ogni settimana.
Scelto da ricercatori di Stanford, Cambridge e dell'Accademia francese delle scienze.
Controlla la tua casella di posta per confermare l'iscrizione.
Qualcosa è andato storto. Riprovare?
Niente spam, cancellati quando vuoi.