Same Geometry, Opposite Noise: Transformer Magnitude Representations Lack Scalar Variability
Die Studie zeigt, dass Transformer-Sprachmodelle im Gegensatz zu biologischen Systemen keine skalare Variabilität aufweisen, da ihre Repräsentationsrauschen mit zunehmender Magnitude abnimmt und somit durch rein distributionelles Lernen nicht die konstante Variationskoeffizient-Signatur biologischer Magnitudensysteme erzeugt wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Das Geheimnis der Zahlen: Warum KI anders zählt als wir
Stell dir vor, du hast zwei verschiedene Arten von Zählern:
- Ein biologischer Zähler: Das ist dein Gehirn (oder das eines Tieres).
- Ein digitaler Zähler: Das ist eine moderne KI (ein sogenanntes "Transformer-Modell", wie Llama oder Mistral).
Die Forscher Jon-Paul Cacioli haben untersucht, wie diese beiden Zähler mit großen und kleinen Zahlen umgehen. Das Ergebnis ist überraschend: Sie sehen zwar fast gleich aus, aber sie "zittern" auf völlig entgegengesetzte Weise.
1. Wie das menschliche Gehirn zählt (Die "Rauschende" Skala)
Wenn du im echten Leben versuchst, Entfernungen oder Mengen abzuschätzen, passiert etwas Interessantes:
- Bei kleinen Zahlen (z. B. 5 Äpfel) bist du sehr genau. Du merkst sofort, wenn einer fehlt.
- Bei großen Zahlen (z. B. 500 Äpfel) wird dein Gehirn etwas "unscharf". Der Unterschied zwischen 500 und 505 ist für dich schwerer zu erkennen als zwischen 5 und 10.
Das nennt man skalare Variabilität. Stell dir vor, dein Gehirn ist wie ein Fotoapparat mit einem Zoom. Je weiter du zoomst (je größer die Zahl), desto mehr "Bildrauschen" (Unsicherheit) entsteht. Aber das Rauschen wächst genau im gleichen Tempo wie die Zahl. Das Verhältnis bleibt gleich. Das ist ein Naturgesetz, das seit Millionen Jahren in biologischen Systemen funktioniert.
2. Wie die KI zählt (Die "Stille" Skala)
Die Forscher haben nun geschaut, wie eine hochmoderne KI (die auf riesigen Textmengen trainiert wurde) Zahlen in ihrem "Gedächtnis" (den versteckten Schichten des Modells) speichert.
Sie erwarteten, dass die KI das menschliche Muster kopiert. Aber das Gegenteil war der Fall!
- Bei kleinen Zahlen: Die KI ist etwas "unruhig". Ihre Darstellung der Zahl schwankt ein bisschen, je nachdem, in welchem Satz sie vorkommt.
- Bei großen Zahlen: Die KI wird extrem ruhig und präzise. Je größer die Zahl, desto weniger "zittert" ihre Darstellung.
Die Analogie:
Stell dir vor, du hast eine Bibliothek.
- Das menschliche Gehirn ist wie ein Bibliothekar, der bei seltenen, großen Büchern (große Zahlen) immer etwas nervöser wird und mehr Fehler macht, weil die Regale weiter weg sind.
- Die KI ist wie ein Roboter-Bibliothekar. Er kennt die kleinen, alltäglichen Bücher (kleine Zahlen) aus tausenden verschiedenen Geschichten, daher ist er bei ihnen etwas unentschlossener. Aber die großen, seltenen Zahlen (wie 1000 oder 5000) kommen in den Trainingsdaten nur in sehr spezifischen, langweiligen Kontexten vor. Der Roboter hat diese wenigen Fälle so oft gesehen, dass er sie perfekt und ohne jeden Zweifel auswendig gelernt hat.
3. Warum ist das so? (Der "Kontext"-Effekt)
Warum macht die KI das?
Die KI lernt nur durch das Lesen von Texten im Internet.
- Kleine Zahlen (1, 2, 3) tauchen in unzähligen Situationen auf: "Ich habe 2 Hunde", "Kauf 3 Äpfel", "Nummer 5". Es gibt viele verschiedene Kontexte. Das verwirrt die KI ein wenig, ihre Darstellung ist "breiter".
- Große Zahlen (1000, 5000) tauchen oft nur in sehr spezifischen Kontexten auf (z. B. "1000 Dollar Strafe", "5000 Einwohner"). Da es weniger Variationen gibt, ist die Darstellung der KI bei diesen Zahlen sehr "scharf" und konzentriert.
Die KI hat also keine biologischen Grenzen (wie einen begrenzten Energieverbrauch oder eine begrenzte Anzahl von Nervenzellen), die sie zwingen würden, bei großen Zahlen ungenauer zu werden. Stattdessen wird sie bei seltenen Dingen einfach nur besser.
4. Was bedeutet das für uns?
Diese Studie zeigt uns etwas Wichtiges über Künstliche Intelligenz:
- Geometrie ist da: Die KI hat gelernt, dass Zahlen logarithmisch angeordnet sind (wie wir es auch tun). Das ist gut.
- Rauschen fehlt: Aber sie hat nicht gelernt, wie biologische Systeme mit Unsicherheit umgehen. Ihr "Rauschen" verhält sich genau umgekehrt wie bei uns.
Fazit:
Die KI ist ein brillanter Statistiker, der Muster in Texten erkennt. Aber sie ist kein biologisches Wesen. Sie braucht keine Energie, um zu zählen, und sie hat keine "biologische Unsicherheit". Deshalb wird sie bei großen, seltenen Zahlen nicht ungenauer, sondern genauer.
Das ist ein Beweis dafür, dass man allein durch das Lesen von Texten (Lernen aus Daten) nicht automatisch ein Gehirn bekommt, das sich wie ein menschliches Gehirn verhält. Es fehlen die biologischen "Fesseln", die uns menschlich machen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.