← Nieuwste papers
🤖 machine learning

SG-Blend: Learning an Interpolation Between Improved Swish and GELU for Robust Neural Representations

Het artikel introduceert SG-Blend, een per laag adaptieve activatiefunctie die een optimale interpolatie leert tussen een nieuwe bias-gecorrigeerde Swish-variant (SSwish) en GELU, waarbij een verminderde trainingsvariantie en superieure prestaties over natuurlijke taalverwerking en computer vision-taken wordt aangetoond vergeleken met standaard vaste activaties.

Oorspronkelijke auteurs: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

Gepubliceerd 2026-09-11
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Deep learning, de technologie achter moderne kunstmatige intelligentie, rust op enorme netwerken van wiskundige paden die informatie laag voor laag verwerken. Om te functioneren, hebben deze netwerken speciale schakelaars nodig, genaamd activatiefuncties. Deze schakelaars bepalen hoeveel informatie er van de ene naar de volgende laag wordt doorgegeven, en vormen het vermogen van het netwerk om complexe patronen te leren. Jarenlang hebben onderzoekers vertrouwd op een paar standaard schakelaars, zoals Swish en GELU, die fungeren als de standaardinstellingen voor bijna elk modern AI-model. Deze standaard schakelaars zijn echter rigide; ze passen exact dezelfde vorm en het gedrag toe op elke laag in een netwerk, ongeacht of die laag zich aan het begin, in het midden of aan het einde van het proces bevindt. Deze eenheidsoplossing creëert een probleem: hoewel het netwerk gemiddeld goed kan werken, kan de prestatie ervan wild schommelen afhankelijk van hoe het willekeurig werd geïnitialiseerd, wat het moeilijk maakt om resultaten consistent te vertrouwen of te reproduceren.

Een team van onderzoekers heeft een nieuwe oplossing voorgesteld genaamd SG-Blend, een flexibele schakelaar die elke laag van een neuraal netwerk in staat stelt om zijn eigen perfecte balans te vinden tussen twee verschillende gedragingen. In plaats van elke laag te dwingen een zelfde rigide instelling te gebruiken, laat deze nieuwe methode elke laag leren hoeveel hij de voorkeur geeft aan het ene type schakelaar boven het andere. De onderzoekers ontdekten dat door elke laag deze kleine hoeveelheid vrijheid te geven, het gehele netwerk aanzienlijk stabieler wordt. In tests op taalmodellen verminderde deze aanpak de onvoorspelbaarheid van de resultaten met achtenveertig procent vergeleken met de standaardmethode, terwijl het ook de hoogste nauwkeurigheidsscores behaalde. De belangrijkste ontdekking is dat de beste prestaties niet voortkomen uit het kiezen van één perfecte schakelaar, maar uit het toestaan van het netwerk om soepel te interpoleren, of te mengen, tussen twee bekende opties, waardoor de vroege lagen anders kunnen gedragen dan de diepe lagen.

De kern van dit werk is dat de rigide aard van huidige activatiefuncties een mismatch creëert met de manier waarop moderne neurale netwerken zijn gebouwd. In oudere netwerken hielp een ander type normalisatie om de informatiestroom te verzachten, waardoor de gebreken van deze vaste schakelaars werden gemaskeerd. Maar in de nieuwere, diepere architecturen die worden gebruikt voor taal en visie, is dat verzachtende effect verdwenen. Zonder dit veroorzaken de vaste schakelaars dat de informatiestroom instabiel wordt terwijl deze door de vele lagen van het netwerk reist. De onderzoekers observeerden dat deze instabiliteit leidt tot een hoge variantie, wat betekent dat als je dezelfde trainingsexperiment twee keer uitvoert met licht verschillende willekeurige startpunten, je twee zeer verschillende resultaten kunt krijgen. De ene run produceert misschien een zeer accuraat model, terwijl de volgende mogelijk niet effectief leert, simpelweg omdat de vaste schakelaars zich niet konden aanpassen aan de specifieke behoeften van elke laag.

Om dit op te lossen, introduceerde het team een nieuw mechanisme dat een gecorrigeerde versie van de Swish-schakelaar combineert met de GELU-schakelaar. Ze mengden deze niet simpelweg willekeurig; in plaats daarvan creëerden ze een systeem waarbij elke laag in het netwerk zijn eigen kleine set verstelbare knoppen heeft. Eén knop regelt hoeveel de laag naar de Swish-stijl neigt, een andere regelt de scherpte van de overgang, en een derde past het basisniveau van het signaal aan. Tijdens de training leert het netwerk deze knoppen automatisch in te stellen. De onderzoekers ontdekten dat het netwerk van nature een toestand bereikt waarin de meeste lagen een middenweg kiezen, waarbij de twee stijlen ongeveer evenveel worden gemengd. Dit suggereert dat noch pure Swish, noch pure GELU het perfecte antwoord is voor elk deel van het netwerk; eerder is de optimale toestand een op maat gemaakte mix die per laag licht varieert.

De resultaten van deze aanpak werden gemeten over verschillende verschillende taken. In een studie naar sentimentanalyse van filmrecensies evenaarde de nieuwe methode de piek nauwkeurigheid van de beste bestaande modellen, maar deed dit met een veel grotere consistentie. Terwijl de standaardmethode een grote kloof liet zien tussen de beste en slechtste resultaten over verschillende willekeurige starts, hield de nieuwe methode de resultaten nauw bij elkaar. Deze consistentie is cruciaal voor praktische toepassingen, aangezien het betekent dat een ontwikkelaar een model één keer kan trainen en er dan zeker van kan zijn dat het goed zal presteren, in plaats van tientallen experimenten te moeten uitvoeren om een gelukkig startpunt te vinden. Bovendien, bij tests op een grootschalig taalmodel dat getraind is om het volgende woord in een zin te voorspellen, behaalde de nieuwe methode de laagste foutmarge van alle geteste modellen, wat bewijst dat de voordelen verder gaan dan eenvoudige classificatietaken naar complexe generatieve modellen.

De onderzoekers onderzochten ook waarom dit mengen zo goed werkt door te kijken naar de interne signalen die door het netwerk stromen. Ze ontdekten dat de nieuwe methode een gestage en uniforme informatiestroom behield van de eerste tot de laatste laag, waarbij pieken en dalen die vaak voorkomen bij vaste schakelaars, worden vermeden. Deze stabiliteit werd bevestigd door te observeren dat het gedrag van de nieuwe methode netjes tussen de gedragingen van de twee componenten in zat, waarbij het effectief de sterke punten van beide leende zonder nieuwe zwakheden te introduceren. Interessant genoeg leerde het netwerk ook om het basisniveau van het signaal anders aan te passen voor vroege lagen vergeleken met latere lagen, een nuance die vaste schakelaars niet kunnen bereiken. Dit vermogen om de interne staat van elke laag individueel aan te passen, lijkt het geheim te zijn van de verbeterde stabiliteit en prestaties.

Deze flexibiliteit brengt echter een prijs met zich mee. Omdat de nieuwe methode vereist dat het netwerk voor elke laag twee verschillende schakelgedragingen berekent en deze vervolgens mengt, duurt het langer om te trainen. De onderzoekers maten deze overhead en vonden dat het trainen van een model met deze nieuwe methode ongeveer eenendertig procent langer duurde dan het gebruik van de standaard GELU-schakelaar op dezelfde hardware. Hoewel het netwerk betrouwbaarder leert en betere resultaten produceert, is de extra tijd die nodig is een belangrijke factor voor degenen die modellen snel moeten trainen of over beperkte rekenbronnen beschikken. Het team erkent deze afweging en merkt op dat het voordeel van verminderde variantie en hogere nauwkeurigheid moet worden afgewogen tegen de toegenomen tijd en rekenkracht die nodig zijn om die resultaten te bereiken.

Ondanks de extra tijd die vereist is, suggereren de bevindingen een verschuiving in hoe we denken over het ontwerp van neurale netwerken. Het succes van SG-Blend geeft aan dat de rigide, eenheidsbenadering van activatiefuncties een beperking uit het verleden kan zijn. Door het netwerk in staat te stellen zijn eigen interne instellingen te leren, kunnen onderzoekers modellen bouwen die niet alleen nauwkeuriger, maar ook robuuster en voorspelbaarder zijn. De studie demonstreert dat de weg naar betere kunstmatige intelligentie misschien niet ligt in het vinden van één enkele, perfecte wiskundige formule, maar in het creëren van systemen die flexibel genoeg zijn om hun eigen interne mechanica aan te passen aan de specifieke eisen van de taak waar ze voor staan. Deze aanpak biedt een veelbelovende richting voor toekomstig onderzoek, met name voor de grote, complexe modellen die de moderne taal- en visietechnologieën aandrijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →