Shot saturation and evidence limits in quantum-AI hardware benchmarks
Cet article réanalyse les bancs d'essai archivés de matériel quantique-IA pour démontrer comment la saturation des tirages (shot saturation) et le traitement incomplet des données impactent significativement la reconstruction des erreurs et l'interprétation des observables, tout en soulignant les limites des normes de rapportage actuelles pour distinguer les valeurs mesurées des valeurs imposées.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Dans la course à la construction de machines capables de penser, une nouvelle frontière est apparue, là où les règles du monde physique rencontrent la logique de l'intelligence artificielle. Des scientifiques testent de minuscules et fragiles processeurs qui fonctionnent selon les principes de la mécanique quantique, espérant qu'ils puissent résoudre des problèmes qui prendraient des siècles aux superordinateurs actuels pour être déchiffrés. Pour savoir si ces machines fonctionnent, les chercheurs doivent mesurer des quantités spécifiques, comme la proximité avec laquelle deux modèles de données correspondent ou la capacité d'un circuit à trouver la meilleure solution à un casse-tête. Cependant, ces mesures ne sont pas prises une seule fois ; elles sont répétées des milliers de fois pour construire une image fiable, un peu comme si l'on lançait une pièce de monnaie de nombreuses fois pour voir si elle est équilibrée. Le défi réside dans le fait que ces machines quantiques sont bruyantes et imparfaites, et la manière dont les chercheurs comptent leurs tentatives, ou « shots », peut radicalement changer ce que les chiffres semblent dire. Si la méthode de comptage est défectueuse ou si les données sont incomplètes, les résultats peuvent paraître prometteurs alors qu'ils sont en réalité trompeurs, rendant difficile de savoir si la machine est véritablement en train d'apprendre ou si elle se contente de tâtonner à travers le bruit.
Une étude récente de Vikram Lex de KarLex AI porte un regard dur et critique sur une collection d'expériences passées impliquant ces processeurs quantiques. Le chercheur n'a pas effectué de nouveaux tests sur le matériel lui-même. Au lieu de cela, il est retourné dans les archives numériques d'une campagne précédente qui utilisait des ordinateurs quantiques basés sur le cloud provenant de fournisseurs tels que Rigetti et IonQ. Son objectif était de réexaminer les résumés bruts de ces expériences pour voir si les conclusions qui en avaient été tirées tenaient la route sous un microscope plus strict et plus transparent. Il s'est concentré sur trois types de tâches : mesurer la similitude entre des vecteurs, tester un type spécifique de matrice mathématique utilisé dans l'apprentissage automatique, et exécuter un algorithme conçu pour résoudre des problèmes de graphes. En fouillant dans les détails de la façon dont les données ont été enregistrées, il a découvert que la manière dont les expériences étaient configurées et rapportées occultait souvent la performance réelle des machines.
La première partie de l'enquête a examiné comment l'augmentation du nombre de tentatives de mesure affectait la précision des résultats. Dans ces expériences, les chercheurs faisaient fonctionner un circuit et enregistraient le résultat des milliers de fois, puis faisaient la moyenne des résultats pour obtenir un chiffre unique. L'étude a réanalysé des données où le nombre de tentatives par lot passait de 256 à 2 048. L'attente était que le simple fait d'augmenter le nombre de « shots » lisserait les erreurs et rapprocherait le résultat de la valeur réelle. Cependant, la réanalyse a révélé une histoire différente. Bien que les fluctuations aléatoires dans les données aient légèrement diminué à mesure que le nombre de shots augmentait, l'erreur globale restait obstinément élevée. La source principale de l'erreur n'était pas le manque de données, mais un décalage constant dans la valeur moyenne elle-même. Même avec 2 048 shots, la valeur moyenne était toujours significativement différente de ce qu'une machine idéale et parfaite aurait dû produire. Cela suggère que le simple fait de demander à la machine de faire plus d'efforts ou d'essayer plus souvent ne résoudrait pas le problème ; le problème résidait dans la configuration fondamentale de la mesure ou dans le comportement du matériel, qui restait inchangé quel que soit le nombre de répétitions du test.
Le deuxième domaine de concentration concernait une structure mathématique appelée noyau (kernel), qui est essentiellement un tableau de nombres représentant la relation entre différents points de données. Dans un tableau complet et utile, chaque paire possible de points de données devrait avoir une valeur mesurée. Dans les données archivées d'un des fournisseurs, Rigetti, les 45 paires possibles ont été mesurées. Cependant, dans les données d'un autre fournisseur, IonQ, seules 18 paires ont été mesurées avec succès avant que l'expérience n'épuise ses crédits de calcul. Les 27 paires restantes ont été laissées vides. L'étude a mis en évidence une faille critique dans la gestion de ces données incomplètes. Lorsque les entrées manquantes ont été traitées comme des zéros, la valeur moyenne de l'ensemble du tableau a chuté de manière spectaculaire, passant d'une valeur d'environ 0,22 à 0,09. Ce changement massif a montré que la conclusion finale dépendait entièrement de la manière dont les nombres manquants étaient remplis. De plus, l'étude a révélé que les deux fournisseurs ne testaient pas exactement les mêmes entrées de données, ce qui rendait impossible une comparaison équitable de la performance de leur matériel. Sans savoir exactement quels points de données ont été utilisés et sans s'assurer que chaque entrée a été mesurée, toute comparaison entre les deux machines était scientifiquement invalide.
La section finale a examiné les résultats d'un algorithme appelé QAOA, conçu pour trouver la meilleure façon de diviser un réseau de connexions en deux groupes. Les chercheurs avaient rapporté leur succès sous la forme d'un ratio, comparant la qualité de la division trouvée au nombre total de connexions dans le réseau. La réanalyse a révélé que les différents fournisseurs utilisaient des définitions différentes pour le dénominateur de ce ratio. Un fournisseur divisait le résultat par le nombre total d'arêtes du graphe, tandis qu'un autre le divisait par le meilleur score théorique possible. Cela signifie qu'un score de 0,5 pour une machine et de 0,6 pour une autre ne signifiait pas nécessairement que la seconde était meilleure ; elles utilisaient simplement des règles différentes pour mesurer la même chose. De plus, les données manquaient des registres détaillés nécessaires pour vérifier si les machines résolvaient réellement le problème comme prévu ou si les résultats étaient simplement un produit de la manière dont les données étaient traitées. L'étude a conclu que sans une méthode standardisée pour rapporter ces chiffres et un accès complet aux données brutes, il est impossible de déterminer quel matériel est véritablement supérieur.
En fin de compte, cette réanalyse sert de mise en garde pour le domaine de l'intelligence artificielle quantique. Elle démontre que posséder une grande quantité de données ou un nombre élevé de tentatives de mesure ne garantit pas une réponse correcte si les définitions sous-jacentes sont obscures ou si les données sont incomplètes. L'étude a révélé que les erreurs dominantes dans ces expériences n'étaient pas des bruits aléatoires qui pourraient être corrigés en effectuant plus de tests, mais plutôt des problèmes systématiques liés à la conception et à la communication des expériences. Les chercheurs ont souligné que pour progresser, la communauté doit établir des normes strictes sur les données qui doivent être enregistrées, la manière dont les informations manquantes doivent être gérées et la façon dont les résultats doivent être comparés. Tant que ces questions fondamentales ne seront pas résolues, les affirmations concernant la performance du matériel quantique resteront difficiles à vérifier, et le véritable potentiel de ces machines demeurera caché derrière un voile de preuves incomplètes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.