Average Attention Transformers and Arithmetic Circuits
Dieser Artikel zeigt, dass Transformer-Encoder, die mit arithmetischen Schaltkreisen und durchschnittlicher harter Aufmerksamkeit ausgestattet sind, die Rechenleistung besitzen, um arithmetische Schaltkreise mit konstanter Tiefe, die über den reellen, rationalen und intermediären Ringen unbeschränkte Addition, binäre Multiplikation und Vorzeichengatter enthalten, zu simulieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben zwei verschiedene Arten von Supercomputern, die versuchen, dasselbe Rätsel zu lösen.
Computer A ist ein Transformer. Sie kennen diese vielleicht als das Gehirn hinter modernen KI-Chatbots. Sie sind dafür bekannt, einen ganzen Satz auf einmal zu betrachten, herauszufinden, welche Wörter am wichtigsten füreinander sind (ein Prozess namens „Aufmerksamkeit"), und diese Informationen dann zu mischen, um einen neuen Satz zu erstellen.
Computer B ist eine Arithmetische Schaltung. Stellen Sie sich dies als eine riesige, starre Fabrikmontagestraße vor, die aus Mathematikmaschinen besteht. Sie verfügt über Eingabeschlitze für Zahlen, und im Inneren gibt es Zahnräder, die nur bestimmte Dinge tun: Zahlen addieren, sie multiplizieren oder prüfen, ob eine Zahl positiv oder negativ ist.
Diese Arbeit stellt eine einfache Frage: Wenn wir diesen beiden Computern denselben Auftrag geben, sind sie gleich leistungsfähig?
Die große Entdeckung
Die Autoren stellten fest, dass der Transformer, wenn man ihn nur ein wenig anpasst, eine perfekte Entsprechung zu einer bestimmten Art von Arithmetischer Schaltung wird.
Hier ist das „Geheimrezept", das sie verwendeten, um sie zur Deckung zu bringen:
- Der „Durchschnitt"-Trick: Anstatt dass der Transformer nur ein einziges wichtiges Wort auswählt (wie ein strenger Lehrer, der den besten Schüler auswählt), ließen sie ihn alle Wörter auswählen, die gleich wichtig sind, und ihren Durchschnitt bilden.
- Der „Mathematik"-Austausch: Normalerweise haben Transformer ein „Gehirn" in sich (ein sogenanntes Feed-Forward-Netzwerk), das komplexe, unübersichtliche Berechnungen durchführt. Die Autoren ersetzten dieses unübersichtliche Gehirn durch eine saubere, einfache Arithmetische Schaltung.
Die Analogie: Die Fabrik versus der Koch
Stellen Sie sich vor, Sie versuchen, eine komplexe Maschine zu bauen.
- Die Arithmetische Schaltung ist wie eine Fabrik. Sie füttern Rohmaterialien (Zahlen) ein. Die Materialien laufen auf einem Förderband entlang. An jeder Station addiert eine Maschine entweder zwei Dinge, multipliziert sie oder prüft, ob sie null sind. Die Fabrik ist sehr schnell und sehr präzise, hat aber eine feste Tiefe; sie kann in einem einzigen Durchgang keine unendliche Anzahl von Schritten ausführen.
- Der Standard-Transformer ist wie ein Koch, der eine Suppe probiert, entscheidet, welche Zutat die „beste" ist, und dann ein wenig davon hinzufügt. Das ist großartig für den Geschmack, aber es ist schwierig, einen Koch zu verwenden, um eine Fabrik zu bauen.
- Der „Durchschnittliche-Aufmerksamkeit"-Transformer (der in dieser Arbeit) ist wie ein Koch, der auch Fabrikleiter ist.
- Anstatt nur eine Zutat auszuwählen, betrachtet der Koch alle Zutaten, die für die „beste" gleichauf liegen, mischt sie zusammen (bildet ihren Durchschnitt) und verarbeitet diese Mischung dann mit einer Fabrikmaschine (der arithmetischen Schaltung).
Die Arbeit beweist, dass dieser „Koch-Leiter" exakt dieselben Dinge tun kann wie die „Fabrik" (die Arithmetische Schaltung), und umgekehrt.
Was können sie tun?
Die Autoren zeigen, dass diese spezifische Art von Transformer Schaltungen simulieren kann, die:
- Riesige Listen von Zahlen sofort aufsummieren.
- Zahlen miteinander multiplizieren.
- Prüfen, ob eine Zahl positiv, negativ oder null ist.
Sie nennen diese Leistungsklasse FSAC0. Stellen Sie sich dies als einen „super-schnellen Mathematik-Club" vor, der diese spezifischen Aufgaben in einer festen, kurzen Zeitspanne erledigen kann, unabhängig davon, wie groß die Liste der Zahlen ist.
Der Haken (Die „Spielregeln")
Es gibt ein paar Regeln, damit diese Magie funktioniert:
- Die Zahlen: Die Mathematik funktioniert am besten, wenn Sie „perfekte" Zahlen verwenden (wie Brüche oder reelle Zahlen), nicht nur die gerundeten Zahlen, die Computer normalerweise verwenden.
- Die Kodierung: Um zu beweisen, dass der Transformer die Aufgabe der Schaltung erledigen kann, mussten die Autoren die Anweisungen der Schaltung zunächst in eine lange Liste von Zahlen umschreiben. Es ist wie das Übersetzen eines Bauplans in eine Einkaufsliste, bevor der Koch kochen kann.
- Keine „weiche" Aufmerksamkeit: Wenn der Transformer versucht, „weich" zu sein (kleine Gewichte für viele Dinge vergibt, anstatt nur die Top-Werte zu mitteln), verliert er diese spezifische Superkraft. Er muss „hart" und entscheidend sein bezüglich der Zahlen, die gemittelt werden sollen.
Das Fazit
Die Arbeit sagt nicht, dass dies Ihr Telefon schneller macht oder Krankheiten heilt. Stattdessen ist es ein theoretischer Durchbruch. Es zieht eine gerade Linie zwischen zwei sehr unterschiedlichen Denkweisen über Mathematik und KI.
Es sagt uns: „Wenn Sie einen Transformer bauen, der 'Durchschnittliche Aufmerksamkeit' verwendet und sein Gehirn durch eine einfache Mathematik-Schaltung ersetzt, haben Sie eine Maschine gebaut, die mathematisch identisch mit einer bestimmten Art von arithmetischer Fabrik ist."
Dies hilft Wissenschaftlern, die wahren Grenzen und Kräfte von KI-Modellen zu verstehen, indem sie sie mit den gut verstandenen Regeln von Mathematik-Fabriken vergleichen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.