Shot saturation and evidence limits in quantum-AI hardware benchmarks
Diese Arbeit reanalysiert archivierte Quanten-KI-Hardware-Benchmarks, um zu demonstrieren, wie Shot-Sättigung und unvollständige Datenverarbeitung die Fehlerrekonstruktion und die Interpretation von Observablen signifikant beeinflussen, während sie gleichzeitig die Unzulänglichkeiten aktueller Berichterstattungsstandards bei der Unterscheidung zwischen gemessenen und aufgelegten Werten hervorhebt.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Im Wettlauf um den Bau von Maschinen, die denken können, ist eine neue Grenze entstanden, an der die Regeln der physischen Welt auf die Logik der künstlichen Intelligenz treffen. Wissenschaftler testen winzige, fragile Prozessoren, die nach den Prinzipien der Quantenmechanik arbeiten, in der Hoffnung, dass sie Probleme lösen können, für deren Bewältigung heutige Supercomputer Jahrhunderte benötigen würden. Um zu wissen, ob diese Maschinen funktionieren, müssen Forscher spezifische Größen messen, wie etwa, wie eng zwei Datenmuster übereinstimmen oder wie gut ein Schaltkreis die beste Lösung für ein Rätsel finden kann. Diese Messungen werden jedoch nicht nur einmal durchgeführt; sie werden tausende Male wiederholt, um ein zuverlässiges Bild zu erhalten, ganz so, als würde man eine Münze oft genug werfen, um zu sehen, ob sie fair ist. Die Herausforderung besteht darin, dass diese Quantenmaschinen verrauscht und unvollkommen sind, und die Art und Weise, wie Forscher ihre Versuche oder „Shots“ zählen, die Ergebnisse drastisch verändern kann. Wenn die Zähnmethode fehlerhaft ist oder die Daten unvollständig sind, könnten die Ergebnisse vielversprechend aussehen, obwohl sie in Wirklichkeit irreführend sind, was es schwierig macht, zu unterscheiden, ob die Maschine wirklich lernt oder nur durch das Rauschen stolpert.
Eine aktuelle Studie von Vikram Lex von KarLex AI wirft einen harten, kritischen Blick auf eine Sammlung vergangener Experimente mit diesen Quantenprozessoren. Der Forscher führte keine neuen Tests an der Hardware selbst durch. Stattdessen griff er auf die digitalen Archive einer vorangegangenen Kampagne zurück, bei der Cloud-basierte Quantencomputer von Anbietern wie Rigetti und IonQ eingesetzt wurden. Sein Ziel war es, die Rohzusammenfassungen dieser Experimente neu zu untersuchen, um zu sehen, ob die daraus gezogenen Schlussfolgerungen unter einem strengeren, transparenteren Mikroskop Bestand hätten. Er konzentrierte sich auf drei Arten von Aufgaben: die Messung der Ähnlichkeit zwischen Vektoren, das Testen eines spezifischen mathematischen Matrixtyps, der in der maschinellen Lernprozessen verwendet wird, und das Ausführen eines Algorithmus, der darauf ausgelegt ist, Graphprobleme zu lösen. Durch die Untersuchung der Details darüber, wie die Daten aufgezeichnet wurden, fand er heraus, dass die Art und Weise, wie die Experimente aufgebaut und berichtet wurden, die wahre Leistung der Maschinen oft verschleierte.
Der erste Teil der Untersuchung untersuchte, wie die Erhöhung der Anzahl der Messversuche die Genauigkeit der Ergebnisse beeinflusste. In diesen Experimenten ließen Forscher einen Schaltkreis laufen und zeichneten das Ergebnis tausende Male auf, um dann die Ergebnisse zu mitteln, um eine einzige Zahl zu erhalten. Die Studie analysierte Daten neu, bei denen die Anzahl der Versuche pro Batch von 256 auf 2.048 erhöht wurde. Die Erwartung war, dass das bloße Ausführen von mehr Shots die Fehler glätten und das Ergebnis näher an den wahren Wert bringen würde. Die Neuanalyse ergab jedoch ein anderes Bild. Während die zufälligen Schwankungen in den Daten mit mehr Shots leicht abnahmen, blieb der Gesamtfehler hartnäckig hoch. Die primäre Quelle des Fehlers war nicht der Mangel an Daten, sondern ein konsistenter Versatz im Durchschnittswert selbst. Selbst mit 2.048 Shots war das durchschnittliche Ergebnis immer noch signifikant verschieden von dem, was eine ideale, perfekte Maschine produziert hätte. Dies deutet darauf hin, dass die bloße Aufforderung an die Maschine, intensiver oder häufiger zu arbeiten, das Problem nicht lösen würde; das Problem lag im grundlegenden Aufbau der Messung oder im Verhalten der Hardware, welches unabhängig davon unverändert blieb, wie oft der Test wiederholt wurde.
Der zweite Schwerpunkt betraf eine mathematische Struktur, die als Kernel bekannt ist – im Wesentlichen eine Tabelle von Zahlen, die darstellen, wie verschiedene Datenpunkte zueinander in Beziehung stehen. In einer vollständigen und nützlichen Tabelle sollte für jedes mögliche Paar von Datenpunkten ein gemessener Wert vorliegen. In den archivierten Daten eines der Anbieter, Rigetti, wurden alle 45 möglichen Paare gemessen. In den Daten eines anderen Anbieters, IonQ, wurden jedoch nur 18 Paare erfolgreich gemessen, bevor das Experiment die Rechenguthaben aufgebraucht hatte. Die verbleibenden 27 Paare blieben leer. Die Studie hob einen kritischen Fehler im Umgang mit diesen unvollständigen Daten hervor. Als die fehlenden Einträge als Null behandelt wurden, sank der Durchschnittswert der gesamten Tabelle drastisch von einem Wert von etwa 0,22 auf 0,09. Diese massive Verschiebung zeigte, dass das Endergebnis vollständig davon abhing, wie die fehlenden Zahlen aufgefüllt wurden. Darüber hinaus stellte die Studie fest, dass die beiden Anbieter nicht exakt dieselben Dateneingaben testeten, was einen fairen Vergleich ihrer Hardwareleistung unmöglich machte. Oh\ne ohne genau zu wissen, welche Datenpunkte verwendet wurden und ohne sicherzustellen, dass jeder Eintrag gemessen wurde, war jeder Vergleich zwischen den beiden Maschinen wissenschaftlich ungültig.
Der abschließende Abschnitt untersuchte die Ergebnisse eines Algorithmus namens QAOA, der darauf ausgelegt ist, den besten Weg zu finden, ein Netzwerk von Verbindungen in zwei Gruppen aufzuteilen. Die Forscher hatten ihren Erfolg als Verhältnis angegeben, indem sie die Qualität der gefundenen Aufteilung mit der Gesamtzahl der Verbindungen im Netzwerk verglichen. Die Neuanalyse deckte auf, dass verschiedene Anbieter unterschiedliche Definitionen für den Nenner in diesem Verhältnis verwendeten. Ein Anbieter teilte das Ergebnis durch die Gesamtzahl der Kanten im Graphen, während ein anderer durch den theoretisch bestmöglichen Wert teilte. Dies bedeutete, dass ein Wert von 0,5 bei einer Maschine und 0,6 bei einer anderen nicht zwangsläufig bedeutete, dass die zweite Maschine besser war; sie benutzten lediglich unterschiedliche Lineale, um dasselbe zu messen. Zudem fehlten in den Daten die detaillierten Aufzeichnungen, die nötig gewesen wären, um zu verifizieren, ob die Maschinen tatsächlich das Problem wie beabsichtigt lösten oder ob die Ergebnisse lediglich ein Nebenprodukt der Datenverarbeitung waren. Die Studie kam zu dem Schluss, dass es ohne eine standardisierte Methode zur Berichterstattung dieser Zahlen und ohne vollen Zugriff auf die Rohdaten unmöglich ist, zu bestimmen, welche Hardware wirklich überlegen ist.
Letztendlich dient diese Neuanalyse als Warnung für das Feld der Quanten-KI. Sie zeigt, dass eine große Menge an Daten oder eine hohe Anzahl von Messversuchen keine korrekte Antwort garantieren, wenn die zugrunde liegenden Definitionen unklar sind oder die Daten unvollständig sind. Die Studie fand heraus, dass die dominierenden Fehler in diesen Experimenten nicht zufälliges Rauschen waren, das durch mehr Tests behoben werden konnte, sondern systematische Probleme im Zusammenhang mit dem Design und der Berichterstattung der Experimente. Die Forscher betonten, dass die Gemeinschaft, um voranzukommen, strenge Standards etablieren muss, welche Daten aufgezeichnet werden müssen, wie mit fehlenden Informationen umzugehen ist und wie Ergebnisse verglichen werden sollten. Bis diese grundlegenden Probleme gelöst sind, werden Behauptungen über die Leistungsfähigkeit von Quantenhardware schwer zu verifizieren bleiben, und das wahre Potenzial dieser Maschinen wird hinter einem Schleier aus unvollständigen Beweisen verborgen bleiben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.