← Neueste Arbeiten
🤖 machine learning

Quantum Models with Multi-Stage Training for Compositional Concept Generalization

Dieses Paper schlägt ein mehrstufiges Trainingsframework für multimodales Quanten-Maschinelles-Lernen vor, das Nomen- und Relationsrepräsentationen mittels Tensoren und variabler Quantenschaltkreise trennt und eine signifikant verbesserte kompositorische Generalisierung auf dem CLEVR-Datensatz mit weitaus weniger trainierbaren Parametern als klassische Baselines demonstriert.

Ursprüngliche Autoren: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

Veröffentlicht 2026-08-18
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die menschliche Intelligenz besitzt die bemerkenswerte Fähigkeit, einfache, gelernte Ideen zu völlig neuen Situationen neu zu kombinieren. Eine Person, die versteht, was ein „Auto“ ist und was „gelb“ bedeutet, kann sofort ein gelbes Auto erkennen, das sie noch nie zuvor gesehen hat, indem sie ihr Wissen über Gefahr auf diese neuartige Kombination anwendet. Diese Kapazität, bekannt als kompositionelle Generalisierung, ermöglicht es uns, in einer Welt zu navigieren, in der wir ständig auf frische Anordnungen vertrauter Teile stoßen. Für künstliche Intelligenz bleibt diese Fähigkeit jedoch eine hartnäckige Hürde. Während moderne Systeme exzellent darin sind, Muster zu erkennen, die sie während des Trainings gesehen haben, stolpern sie oft, wenn sie gebeten werden, dieselben Muster auf neue Kombinationen anzuwenden, wie etwa ein spezifisches Objekt in einer neuen räumlichen Beziehung. Diese Einschränkung deutet darauf an, dass aktuelle Modelle eher Beispiele auswendig lernen, anstatt die zugrunde liegenden Regeln wirklich zu verstehen, wie die Dinge zusammenpassen.

Forscher des University College London und der University of Amsterdam haben einen anderen Weg zur Lösung dieses Problems untersucht, indem sie sich der seltsamen und kraftvollen Logik der Quantenmechanik zuwandten. In ihrer Arbeit, die für die Konferenz „IEEE Quantum Week“ präsentiert wurde, schlagen sie vor, dass die Art und Weise, wie Quantencomputer Informationen verarbeiten, möglicherweise natürlich mit der Art und Weise übereinstimmt, wie Menschen Konzepte kombinieren. Durch den Aufbau eines Modells, das das Lernen von Objekten vom Lernen von Beziehungen zwischen ihnen trennt, schufen sie ein System, das in der Lage ist, in ungesehenen Szenarien weitahe effektiver zu generalisieren als traditionelle Methoden, und das dies alles mit einem Bruchteil der Rechenleistung tut.

Das Team konzentrierte sich auf eine Aufgabe, bei der ein Computer ein Bild von zwei geometrischen Formen betrachten und die korrekte Beschreibung ihrer Beziehung aus zwei Optionen auswählen muss. Beispielsweise muss das System, wenn ihm ein Bild eines Würfels links von einem Kegel vorgelegt wird, die korrekte Phrase „Würfel links Kegel“ von dem Ablenker „Würfel rechts Kegel“ unterscheiden. Um die Maschine zu lehren, verwendeten die Forscher einen Datensatz mit Bildern von Formen wie Kugeln, Zylindern und Kegeln in verschiedenen Positionen. Die Herausforderung bestand darin, das System auf einigen Kombinationen zu trainieren, wie etwa einem Kegel rechts von einem Würfel, und es dann an Kombinationen zu testen, die es noch nie gesehen hat, wie etwa einem Kegel links von einem Würfel. Dieser Aufbau zwingt das Modell dazu, das Konzept von „links“ und „rechts“ als unabhängige Regeln zu lernen, die auf jede Form angewendet werden können, anstatt nur spezifische Bilder auswendig zu lernen.

Anstatt das gesamte System auf einmal zu trainieren, wählten die Forscher einen zweistufigen Ansatz, der einem Lehrplan ähnelt. In der ersten Phase lernte das Modell, einzelne Objekte zu erkennen. Dem Modell wurden einzelne Formen gezeigt, wie eine einsame Kugel oder ein einzelner Würfel, und es wurde beigebracht, diese mit ihren Namen zu verknüpfen. Sobald das Modell diese grundlegenden Bausteine gemeistert hatte, „fror“ die Forschungsgruppe sein Gedächtnis darüber ein, wie diese Formen aussah. In der zweiten Phase führten sie die relationale Aufgabe ein. Das Modell wurde nun Bilder mit zwei Formen gezeigt und musste nur die Regeln lernen, wie sie zueinander in Beziehung stehen, wobei es die stabilen, zuvor gelernten Definitionen der Formen nutzte, die es bereits auswendig gelernt hatte. Dieses Design stellte sicher, dass das System nicht jedes Mal neu lernen musste, was ein „Würfel“ ist, wenn es eine neue Beziehung sah, sondern gezwungen war, die Beziehung als eine separate Transformation anzuwenden, die auf ein festes Objekt wirkt.

Um dies umzusetzen, nutzte das Team ein Framework, das Sprache und Bedeutung in mathematische Strukturen namens Tensoren übersetzt, welche direkt auf Quantenschaltkreise abgebildet werden können. Sie testeten verschiedene Möglichkeiten, Bilddaten in diese Quantenschaltkreise einzuspeisen. Eine Methode, genannt Amplitudenkodierung (amplitude encoding), versuchte, die exakte Geometrie der ursprünglichen Bilddaten zu bewahren. Eine andere, die Winkelkodierung (angle encoding), transformierte die Daten auf eine Weise, die nicht-lineare Änderungen einführte und die Informationen effektiv so umgestaltete, dass die Unterschiede zwischen den Beziehungen deutlicher wurden. Sie experimentierten auch mit einer „Collage“-Methode, bei der die Quantenschaltkreise für zwei separate Formen physisch kombiniert wurden, um ein einziges relationales Bild darzustellen.

Die Ergebnisse ihrer Simulationen waren aufschlussreich. Als die Forscher ihr mehrstufiges Quantenmodell mit einem Standard-Klassiksystem verglichen, war der Unterschied in der Effizienz eklatant. Das klassische Basissystem benötigte über 150 Millionen trainierbare Parameter, um die Aufgabe zu bewältigen, scheiterte jedoch an der Generalisierung und erreichte bei ungesehenen Kombinationen lediglich 50 Prozent – was im Wesentlichen einem Raten entspricht. Im Gegensatz dazu erreichte das Quantenmodell eine starke Generalisierung mit nur 426 trainierbaren Parametern. Die erfolgreichste Version ihres Systems, die die Collage-Methode in Kombination mit der Winkelkodierung verwendete, erreichte eine Genauigkeit von über 72 Prozent bei den ungesehenen Testfällen. Diese Leistung war signifikant besser als die eines einstufigen Quantenmodells, das versuchte, alles gleichzeitig zu lernen, was bewies, dass die Trennung des Lernens von Objekten und des Lernens von Beziehungen entscheidend war.

Die Forscher fanden heraus, dass der Erfolg ihres Modells stark davon abhing, wie die Daten kodiert wurden. Die Winkelkodierung, die nicht-lineare Transformationen einführte, erwies sich als überlegen gegenüber der Amplitudenkodierung. Dies deutet darauf an, dass die ursprünglichen Bilddaten, wie sie durch Standardwerkzeuge verarbeitet werden, die für die Aufgabe benötigten räumlichen Beziehungen nicht klar genug trennten. Der Prozess der Quantenkodierung selbst half dabei, die Informationen umzustrukturieren, wodurch die Unterscheidung zwischen „links“ und „rechts“ für das Modell sichtbarer wurde. Während die Amplitudenkodierung die ursprüngliche Form der Daten bewahrte, hielt sie die verwirrenden Ähnlichkeiten zwischen verschiedenen räumlichen Anordnungen aufrecht, was sie schwerer unterscheidbar machte.

Diese Erkenntnisse, die vollständig aus Computersimulationen gewonnen wurden, legen nahe, dass strukturierte Quantendarstellungen einen vielversprechenden Weg darstellen, um Maschinen das Verständnis von Kompositionalität beizubringen. Indem sie eine klare Trennung zwischen dem, was Dinge sind, und dem, wie sie miteinander in Beziehung stehen, erzwangen und indem sie Quantenschaltkreise nutzten, um die Daten in eine besser separierbare Form umzugestalten, erreichte das Modell ein Maß an Generalisierung, mit dem klassische Systeme trotz weitaus größerer Ressourcen kämpften. Die Arbeit behauptet nicht, das Problem der künstlichen Intelligenz gelöst zu zu haben, aber sie demonstriert, dass ein spezifischer, strukturierter Lernansatz – bei dem Primitive zuerst gelernt und dann kombiniert werden – äußerst effektiv sein kann, wenn er mit den einzigartigen Eigenschaften des Quantencomputings gepaart wird. Die Autoren merken an, dass zukünftige Arbeiten diese Ideen an tatsächlicher Quantenhardware testen und untersuchen müssen, ob diese Methoden auf komplexere Szenen und reichere Vokabulare skalierbar sind, aber die aktuellen Ergebnisse liefern einen überzeugenden Beweis für die Machbarkeit (Proof of Concept) einer neuen Art des maschinellen Lernens.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →