← Neueste Arbeiten
💻 computer science

Testing History Dependence Between In-Context and In-Weights Learning

Diese Studie zeigt, dass die Reihenfolge des Trainings (das Annähern an eine ausgewogene Mischung aus verschiedenen Richtungen) zwar einen vorübergehenden, messbaren Unterschied in der Stärke von In-Context- versus In-Weights-Lernmechanismen erzeugt, jedoch nicht zu persistenter Hysterese oder grundlegend unterschiedlichen kausalen Schaltkreisorganisationen in kleinen Transformern führt.

Ursprüngliche Autoren: Zuo Yuchen

Veröffentlicht 2026-08-06
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zuo Yuchen

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, Witze zu erzählen. Sie können dem Roboter dies auf zwei Arten beibringen. Erstens können Sie ihm kurz vor seinem Auftritt ein paar Beispiele zeigen, wie ein Merkblatt auf dem Tisch. Der Roboter liest das Merkblatt und erschließt sich die Pointe basierend auf dem, was er gerade jetzt sieht. Dies nennt man In-Context Learning. Es ist, als würde der Roboter spontan reagieren. Zweitens können Sie mit dem Roboter stundenlang üben, bis er die Witze so gut auswendig gelernt hat, dass er das Merkblatt nicht mehr braucht. Die Witze sind nun fest in sein Gehirn einprogrammiert. Dies ist In-Weights Learning.

Lange Zeit fragten sich Wissenschaftler: Wenn man dem Roboter exakt dieselbe Mischung aus Merkblättern und Übung gibt, löst er das Problem dann immer auf die exakt gleiche Weise? Oder spielt es eine Rolle, wie er dorthin gelangt ist? Hat er erst angefangen, auswendig zu lernen und dann das Lesen des Merkblatts zu lernen? Oder hat er erst angefangen, das Merkblatt zu lesen und dann die Witze auswendig zu lernen? Diese Frage handelt von Historienabhängigkeit. In der Welt der Physik ist dies ähnlich wie Hysterese – wie ein Magnet, der sich daran erinnert, in welche Richtung er gezogen wurde, selbst nachdem man aufgehört hat zu ziehen. Wenn ein Robotergehirn eine solche Hysterese besitzt, ist sein aktueller Zustand nicht nur das, was er gerade sieht; es ist auch der Pfad, den er genommen hat, um dorthin zu gelangen. Dies ist wichtig, weil, falls KI-Modelle so funktionieren, wir ihr Verhalten nicht allein durch den Blick auf ihre aktuellen Daten vorhersagen könnten; wir müssten ihre gesamte Trainingshistorie kennen.

Diese Arbeit nimmt einen kleinen, kontrollierten Roboter (ein winziges KI-Modell) und unterzieht ihn einem spezifischen Test, um zu sehen, ob er diese Art von „Erinnerung an den Pfad“ besitzt. Die Forscher haben ein Spiel aufgebaut, bei dem der Roboter einen geheimen Code erraten muss. Manchmal hängt der Code von einem Hinweis ab, der im aktuellen Satz gegeben wird (das Merkblatt), und manchmal von einer Regel, die der Roboter vor langer Zeit gelernt hat (das fest einprogrammierte Gedächtnis). Sie trainierten zwei identische Kopien des Roboters, um exakt denselben Punkt im Spiel zu erreichen, nahmen sie aber über unterschiedliche Routen dorthin. Eine Kopie begann damit, sich auf die fest einprogrammiierten Regeln zu konzentrieren und verlagerte den Fokus dann langsam auf die Merkblätter. Die andere Kopie begann mit den Merkblättern und verlagerte den Fokus dann langsam auf die fest einprogrammierten Regeln.

Die Forscher fanden heraus, dass beide Roboter nicht exakt gleich handelten, obwohl sie exakt denselben Punkt erreichten. Derjenige, der von der „fest programmierten“ Seite kam, neigte etwas stärker dazu, das Merkblatt zu nutzen als derjenige, der von der „Merkblatt“-Seite kam. Es war, als wäre der Roboter, der mit den Regeln begann, immer noch ein wenig in dieser Denkweise „feststeckend“, obwohl er nun dieselben Hinweise betrachtete wie der andere Roboter. Dieser Unterschied war real und messbar: Die Lücke in ihrem Verhalten betrug etwa 0,098 Punkte auf einer spezifischen Skala, und dies geschah in allen fünf der verschiedenen Experimente.

Dieser Pfad-Gedächtnis-Effekt war jedoch sehr kurzlebig. Die Forscher ließen die Roboter an diesem Punkt noch eine Weile weiter trainieren. Nach nur 25 weiteren Schritten begann der Unterschied zu kippen und verschwand schließlich. Als sie 100 Schritte später waren, handelten die beiden Roboter fast identisch. Das „Gespenst“ des Pfades, den sie genommen hatten, war verflogen.

Um zu verstehen, warum dies geschah, schauten die Wissenschaftler in das Gehirn des Roboters. Sie fanden heraus, dass beide Roboter exakt dieselben internen Teile zur Lösung des Problems nutzten. Sie wechselten nicht zu einem anderen „Schaltkreis“ oder einer neuen Denkweise. Stattdessen drehte der Roboter, der von der „fest programmierten“ Seite kam, einfach die Lautstärke für den Teil seines Gehirns, der das Merkblatt liest, ein kleines Stück höher. Es war eine vorübergehende Lautstärkesteigerung, keine dauerhafte Änderung der Verschaltung.

Die Arbeit legt daher nahe, dass KI-Modelle zwar kurzzeitig sich daran erinnern können, wie sie zu einem bestimmten Punkt gelangt sind, dies aber keine permanente „Hystereseschleife“ ist, in der sie dauerhaft in unterschiedlichen Zuständen feststecken. Es ist eher wie ein momentanes Nachhinken, ein kurzes Überschießen, das sich wieder einpendelt, während das Modell weiter lernt. Die Studie zeigt, dass man, um das Verhalten einer KI wirklich zu verstehen, zwar auf ihre unmittelbare Geschichte schauen muss, aber nicht befürchten muss, dass sie aufgrund der Art ihres Trainings für immer in einem seltsamen Zustand feststeckt. Das Modell holt schließlich auf und vergisst den Pfad, indem es sich nur noch auf das Ziel konzentriert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →