← Neueste Arbeiten
🤖 machine learning

SG-Blend: Learning an Interpolation Between Improved Swish and GELU for Robust Neural Representations

Das Papier stellt SG-Blend vor, eine schichtweise adaptive Aktivierungsfunktion, die eine optimale Interpolation zwischen einer neuartigen, bias-korrigierten Swish-Variante (SSwish) und GELU lernt und im Vergleich zu standardmäßigen festen Aktivierungsfunktionen eine reduzierte Trainingsvarianz sowie eine überlegene Leistung bei Aufgaben der natürlichen Sprachverarbeitung und des Computer Vision demonstriert.

Ursprüngliche Autoren: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

Veröffentlicht 2026-09-11
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Deep Learning, die Technologie hinter der modernen künstlichen Intelligenz, stützt sich auf riesige Netzwerke mathematischer Pfade, die Informationen Schicht für Schicht verarbeiten. Um zu funktionieren, benötigen diese Netzwerke spezielle Schalter, die sogenannte Aktivierungsfunktionen. Diese Schalter entscheiden, wie viel Information von einer Schicht zur nächsten fließt, und formen die Fähigkeit des Netzwerks, komplexe Muster zu erlernen. Jahrelang haben sich Forscher auf einige Standard-Schalter verlassen, wie etwa Swish und GELU, die als Standardeinstellungen für fast jedes moderne KI-Modell fungieren. Diese Standard-Schalter sind jedoch starr; sie wenden exakt dieselbe Form und dasselbe Verhalten auf jede einzelne Schicht eines Netzwerks an, unabhängig davon, ob sich diese Schicht am Anfang, in der Mitte oder am Ende des Prozesses befindet. Dieser Einheitsansatz schafft ein Problem: Während das Netzwerk im Durchschnitt gut funktionieren mag, kann seine Leistung je nach der zufälligen Initialisierung stark schwanken, was es schwierig macht, Ergebnisse konsistent zu vertrauen oder zu reproduzieren.

Ein Forschungsteam hat eine neue Lösung namens SG-Blend vorgeschlagen, einen flexiblen Schalter, der es jeder Schicht eines neuronalen Netzwerks ermöglicht, ihre eigene perfekte Balance zwischen zwei verschiedenen Verhaltensweisen zu finden. Anstatt jede Schicht zu zwingen, dieselbe starre Einstellung zu verwenden, lässt diese neue Methode jede Schicht lernen, wie sehr sie eine Art von Schalter gegenüber einer anderen bevorzugt. Die Forscher fanden heraus, dass das gesamte Netzwerk durch die Gewährung dieser kleinen Menge an Freiheit signifikant stabiler wird. In Tests an Sprachmodellen reduzierte dieser Ansatz die Unvorhersehbarkeit der Ergebnisse um zweiundvierzig Prozent im Vergleich zur Standardmethode und erreichte gleichzeitig die höchsten Genauigkeitswerte. Die entscheidende Entdeckung ist, dass die beste Leistung nicht daraus resultiert, einen einzigen perfekten Schalter auszuwählen, sondern daraus, dem Netzwerk zu erlauben, zwischen zwei bekannten Optionen sanft zu interpolieren oder zu verschmelzen, sodass die frühen Schichten anders agieren als die tiefen Schichten.

Der Kern der Idee hinter dieser Arbeit ist, dass die starre Natur aktueller Aktivierungsfunktionen zu einem Missverhältnis mit der Art und Weise führt, wie moderne neuronale Netze aufgebaut sind. In älteren Netzwerken half eine andere Art der Normalisierung dabei, den Informationsfluss zu glätten, was die Mängel dieser festen Schalter maskierte. Aber in den neueren, tieferen Architekturen, die für Sprache und Vision verwendet werden, ist dieser Glättungseffekt verschwunden. Oh ohne ihn verursachen die festen Schalter, dass der Informationsfluss instabil wird, während er durch die vielen Schichten des Netzwerks reist. Die Forscher beobachteten, dass diese Instabilität zu einer hohen Varianz führt, was bedeutet, dass man, wenn man dasselbe Trainingsexperiment zweimal mit leicht unterschiedlichen zufälligen Startpunkten durchführt, zwei sehr unterschiedliche Ergebnisse erhalten kann. Ein Durchgang könnte ein hochgradig genaues Modell hervorbringen, während der nächste möglicherweise nicht effektiv lernt, schlichtweg weil die festen Schalter nicht in der Lage waren, sich an die spezifischen Bedürfnisse jeder einzelnen Schicht anzupassen.

Um dies zu lösen, führte das Team einen neuen Mechanismus ein, der eine korrigierte Version des Swish-Schalters mit dem GELU-Schalter kombiniert. Sie haben diese nicht einfach zufällig gemischt; stattdessen schufen sie ein System, bei dem jede einzelne Schicht im Netzwerk über ein eigenes kleines Set an einstellbaren Reglern verfügt. Ein Regler steuert, wie sehr sich die Schicht dem Swish-Stil zu neigt, ein anderer steuert die Schärfe des Übergangs und ein dritter passt das Basissignal an. Während des Trainings lernt das Netzwerk, diese Regler automatisch einzustellen. Die Forscher entdeckten, dass das Netzwerk natürlich in einen Zustand übergeht, in dem die meisten Schichten einen Mittelweg wählen und die beiden Stile etwa gleichermaßen vermischen. Dies deutet darauf hin, dass weder reines Swish noch reines GELU die perfekte Antwort für jeden Teil des Netzwerks ist; vielmehr ist der optimale Zustand eine maßgeschneiderte Mischung, die sich von Schicht zu Schicht leicht unterscheidet.

Die Ergebnisse dieses Ansatzes wurden über mehrere verschiedene Aufgaben hinweg gemessen. In einer Studie zur Sentiment-Analyse von Filmkritiken erreichte die neue Methode die Spitzengenauigkeit der besten existierenden Modelle, tat dies jedoch mit weitaً viel größerer Konsistenz. Während die Standardmethode eine große Lücke zwischen ihren besten und schlechtesten Ergebnissen über verschiedene Zufallsstarts hinweg zeigte, hielt die neue Methode die Ergebnisse eng beieinander. Diese Konsistenz ist für praktische Anwendungen entscheidend, da sie bedeutet, dass ein Entwickler ein Modell einmal trainieren kann und darauf vertrauen kann, dass es gut funktionieren wird, anstatt dutzende Experimente durchführen zu müssen, um einen glücklichen Startpunkt zu finden. Darüber hinaus erreichte die neue Methode bei Tests an einem groß angelegten Sprachmodell, das darauf trainiert wurde, das nächste Wort in einem Satz vorherzusagen, die niedrigste Fehlerrate unter allen getesteten Modellen, was beweist, dass die Vorteile über einfache Klassifizierungsaufgaben hinaus auch für komplexe generative Modelle gelten.

Die Forscher untersuchten auch, warum dieses Mischen so gut funktioniert, indem sie sich ansahnen, wie die internen Signale des Netzwerks flossen. Sie fanden heraus, dass die neue Methode einen stetigen und gleichmäßigen Informationsfluss von der ersten bis zur letzten Schicht aufrechterhält und dabei die Spitzen und Abfälle vermeidet, die bei festen Schaltern oft auftreten. Diese Stabilität wurde bestätigt durch die Beobachtung, dass das Verhalten der neuen Methode sich ordentlich zwischen den Verhaltensweisen ihrer beiden Komponenten einordnet und somit die Stärken beider nutzt, ohne neue Schwächen einzuführen. Interessanterweise lernte das Netzwerk auch, das Basissignal für frühe Schichten anders anzupassen als für spätere Schichten – eine Nuance, die feste Schalter nicht erreichen können. Diese Fähigkeit, den internen Zustand jeder Schicht individuell anzupassen, scheint das Geheimnis der verbesserten Stabilität und Leistung zu sein.

Diese Flexibilität geht jedoch mit einem Preis einher. Da die neue Methode erfordert, dass das Netzwerk für jede Schicht zwei verschiedene Schalterverhaltensweisen berechnet und dann vermischt, dauert das Training länger. Die Forscher maßen diesen Overhead und fanden heraus, dass das Training eines Modells mit dieser neuen Methode etwa dreiunddreißig Prozent länger dauert als mit dem Standard-GELU-Schalter auf derselben Hardware. Während das Netzwerk zuverlässiger lernt und bessere Ergebnisse liefert, ist die zusätzliche Zeit, die benötigt wird, ein signifikanter Faktor für diejenigen, die Modelle schnell oder mit begrenzten Rechenressourcen trainieren müssen. Das Team erkennt diesen Trade-off an und stellt fest, dass der Nutzen der reduzierten Varianz und höheren Genauigkeit gegen die erhöhte Zeit und die benötigte Rechenleistung abgewogen werden muss, um diese Ergebnisse zu erreichen.

Trotz der zusätzlichen Zeit deuten die Erkenntnisse auf einen Wandel in der Art und Weise hin, wie wir über das Design neuronaler Netze denken. Der Erfolg von SG-Blend zeigt, dass der starre Einheitsansatz für Aktivierungsfunktionen ein Relikt der Vergangenheit sein könnte. Indem wir dem Netzwerk erlauben, seine eigenen internen Einstellungen zu lernen, können Forscher Modelle bauen, die nicht nur genauer, sondern auch robuster und berechenbarer sind. Die Studie zeigt, dass der Weg zu besserer künstlicher Intelligenz möglicherweise nicht darin liegt, eine einzige, perfekte mathematische Formel zu finden, sondern Systeme zu erschaffen, die flexibel genug sind, um ihre eigene interne Mechanik an die spezifischen Anforderungen der jeweiligen Aufgabe anzupassen. Dieser Ansatz bietet eine vielversprechende Richtung für die zukünftige Forschung, insbesondere für die großen, komplexen Modelle, die moderne Sprach- und Vision-Technologien antreiben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →