← Nieuwste papers
🧬 biology

Shot saturation and evidence limits in quantum-AI hardware benchmarks

Dit artikel heranalyseert gearchiveerde quantum-AI-hardwarebenchmarks om aan te tonen hoe shot-verzadiging en onvolledige gegevensverwerking de foutreconstructie en de interpretatie van observabelen aanzienlijk beïnvloeden, terwijl het tegelijkertijd de beperkingen van de huidige rapportagestandaarden benadrukt bij het onderscheiden van gemeten waarden van opgelegde waarden.

Oorspronkelijke auteurs: Vikram Lex

Gepubliceerd 2026-09-23
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vikram Lex

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

In de race om machines te bouwen die kunnen denken, is een nieuwe grens ontstaan waar de regels van de fysieke wereld de logica van kunstmatige intelligentie ontmoeten. Wetenschappers testen kleine, fragiele processors die werken volgens de principes van de kwantummechanica, in de hoop dat ze problemen kunnen oplossen die de huidige supercomputers eeuwen zouden kosten. Om te weten of deze machines werken, moeten onderzoekers specifieke hoeveelheden meten, zoals hoe nauw twee datapatronen overeenkomen of hoe goed een circuit de beste oplossing voor een puzzel kan vinden. Deze metingen worden echter niet één keer uitgevoerd; ze worden duizenden keren herhaald om een betrouwbaar beeld te vormen, vergelijkbaar met het vele malen werpen van een munt om te zien of deze eerlijk is. De uitdaging ligt in het feit dat deze kwantummachines luidruchtig en imperfect zijn, en de manier waarop onderzoekers hun pogingen, of "shots", tellen, de resultaten drastisch kan veranderen. Als de telmethode gebrekkig is of als de data incompleet is, kunnen de resultaten veelbelovend lijken terwijl ze in werkelijkheid misleidend zijn, waardoor het moeilijk wordt om te bepalen of de machine echt leert of slechts door de ruis heen struikelt.

Een recente studie door Vikram Lex van KarLex AI werpt een kritische blik op een collectie eerdere experimenten met deze kwantumprocessors. De onderzoeker heeft geen nieuwe tests op de hardware zelf uitgevoerd. In plaats daarvan is hij teruggegaan naar de digitale archieven van een eerdere campagne die gebruikmaakte van cloudgebaseerde kwantumcomputers van aanbieders zoals Rigetti en IonQ. Zijn doel was om de ruwe samenvattingen van die experimenten opnieuw te onderzoeken om te zien of de conclusies die daaruit werden getrokken standhielden onder een striktere, meer transparante microscoop. Hij richtte zich op drie soorten taken: het meten van de gelijkenis tussen vectoren, het testen van een specifiek type wiskundige matrix die wordt gebruikt in machine learning, en het draaien van een algoritme dat is ontworpen om grafiekproblemen op te lossen. Door in de details te duiken van hoe de gegevens werden geregistreerd, ontdekte hij dat de manier waarop de experimenten waren opgezet en gerapporteerd, de werkelijke prestaties van de machines vaak verbloemde.

Het eerste deel van het onderzoek keek naar hoe het verhogen van het aantal meetpogingen de nauwkeurigheid van de resultaten beïnvloedde. In deze experimenten draaide onderzoekers een circuit en legden de uitkomst duizenden keren vast, waarna ze de resultaten middelden om tot één getal te komen. De studie heranalyseerde gegevens waarbij het aantal pogingen per batch werd verhoogd van 256 naar 2.048. De verwachting was dat het simpelweg uitvoeren van meer shots de fouten zou gladstrijken en het resultaat dichter bij de ware waarde zou brengen. De heranalyse onthulde echter een ander verhaal. Hoewel de willekeurige fluctuaties in de data licht afnamen naarmate er meer shots werden toegevoegd, bleef de algehele fout hardnekkig hoog. De primaire bron van de fout was niet een gebrek aan data, maar een consistente afwijking in de gemiddelde waarde zelf. Zelfs met 2.048 shots was het gemiddelde resultaat nog steeds significant verschillend van wat een ideale, perfecte machine zou hebben geproduceerd. Dit suggereert dat het simpelweg vragen aan de machine om harder of vaker te proberen het probleem niet zou oplossen; het probleem lag in de fundamentele opzet van de meting of het gedrag van de hardware, die onveranderd bleef ongeacht hoe vaak de test werd herhaald.

Het tweede focusgebied betrof een wiskundige structuur die bekend staat als een kernel, wat in essentie een tabel met getallen is die vertegenwoordigt hoe verschillende datapunten met elkaar samenhangen. In een volledige en nuttige tabel zou elk mogelijk paar datapunten een gemeten waarde moeten hebben. In de gearchiveerde gegevens van een van de aanbieders, Rigetti, werden alle 45 mogelijke paren gemeten. Echter, in de gegevens van een andere aanbieder, IonQ, werden slechts 18 paren succesvol gemeten voordat de experimentele rekencredits op waren. De overige 27 paren bleven leeg. De studie wees op een kritieke fout in de manier waarop met deze incomplete data werd omgegaan. Wanneer de ontbrekende vermeldingen als nul werden behandeld, daalde de gemiddelde waarde van de gehele tabel drastisch, van een waarde van ongeveer 0,22 naar 0,09. Deze enorme verschuiving toonde aan dat de uiteindelijke conclusie volledig afhankelijk was van de manier waarop de ontbrekende getallen werden ingevuld. Bovendien stelde de studie vast dat de twee aanbieders niet exact dezelfde data-inputs testten, wat een eerlijke vergelijking van hun hardwareprestaties onmogelijk maakte. Zonder precies te weten welke datapunten werden gebruikt en zonder te waarborgen dat elke vermelding werd gemeten, was elke vergelijking tussen de twee machines wetenschappelijk ongeldig.

De laatste sectie onderzocht resultaten van een algoritme genaamd QAOA, dat is ontworpen om de beste manier te vinden om een netwerk van verbindingen in twee groepen te splitsen. De onderzoekers hadden hun succes gerapporteerd als een ratio, waarbij de kwaliteit van de gevonden splitsing werd vergeleken met het totaal aantal verbindingen in het netwerk. De heranalyse onthulde dat verschillende aanbieders verschillende definities gebruikten voor de noemer in deze ratio. De ene aanbieder deelde het resultaat door het totaal aantal randen (edges) in de grafiek, terwijl een andere deelde door de theoretisch best mogelijke score. Dit betekende dat een score van 0,5 van de ene machine en 0,6 van een andere niet noodzakelijkerwijs betekende dat de tweede machine beter was; ze gebruikten simpelweg verschillende linialen om hetzelfde te meten. Daarnaast ontbrak het de data aan de gedetailleerde verslagen die nodig zijn om te verifiëren of de machines daadwerkelijk het probleem oplosten zoals bedoeld, of dat de resultaten slechts een bijproduct waren van de manier waarop de data werd verwerkt. De studie concludeerde dat het zonder een gestandaardiseerde manier om deze getallen te rapporteren en zonder volledige toegang tot de ruwe data, onmogelijk is om te bepalen welke hardware werkelijk superieur is.

Uiteindelijk dient deze heranalyse als een waarschuwing voor het vakgebied van de kwantumartificiële intelligentie. Het demonstreert dat het bezitten van een grote hoeveelheid data of een hoog aantal meetpogingen geen correct antwoord garandeert als de onderliggende definities onduidelijk zijn of als de data incompleet is. De studie vond dat de dominante fouten in deze experimenten niet willekeurige ruis waren die kondend worden opgelost door meer tests uit te voeren, maar eerder systematische problemen met betrekking tot hoe de experimenten werden ontworpen en gerapporteerd. De onderzoekers benadrukten dat om vooruitgang te boeken, de gemeenschap strikte standaarden moet vaststellen voor wat er aan data moet worden geregistreerd, hoe met ontbrekende informatie moet worden omgegaan en hoe resultaten vergeleken moeten worden. Totdat deze fundamentele kwesties zijn opgelost, zullen claims over de prestaties van kwantumhardware moeilijk te verifiëren blijven, en zal het ware potentieel van deze machines verborgen blijven achter een sluier van incomplete bewijsvoering.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →