← Nieuwste papers
🤖 AI

Full-bandwidth transformer

Dit artikel introduceert de full-bandwidth transformer, een nieuwe architectuur die autoregressieve decodering verbetert door de vorige verborgen toestand van de bovenste laag via latente feedback terug in het model te voeren, waardoor de prestaties over diverse taken worden verbeterd terwijl de standaard efficiëntie behouden blijft en er aanzienlijk minder trainingsdata nodig is dan bij conventionele transformers.

Oorspronkelijke auteurs: Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een echt lastige puzzel op te lossen, maar je hebt een zeer strikte regel: je mag alleen één enkel woord tegelijk fluisteren naar je toekomstige zelf. Als je een complexe stap in je plan uitwerkt, moet je deze als een woord opschrijven, wachten tot je toekomstige zelf het heeft gelezen, en dan weer opnieuw beginnen. Dit is hoe de meeste moderne AI-chatbots vandaag de dag werken. Ze zijn briljant in lezen en schrijven, maar wanneer ze nadenken, zijn ze gedwongen om hun gedachten hardop te "spreken", één woord tegelijk, zelfs als die gedachten complexe ideeën zijn. Dit is alsof je probeert een zware rugzak met informatie te dragen, maar je kunt je toekomstige zelf bij elke stap slechts één ansichtkaart uit de rugzak overhandigen.

Wetenschappers noemen deze AI-modellen "transformers". Zij zijn de motoren achter de slimme chatbots die we dagelijks gebruiken. Deze modellen werken in twee richtingen: ze lezen woorden over een pagina heen (horizontaal) en ze verwerken informatie via vele lagen van "neuronen" die op elkaar gestapeld zijn (verticaal). Het probleem is dat, hoewel ze alle woorden die ze al hebben geschreven kunnen zien, ze niet gemakkelijk hun diepe, complexe interne gedachten terug naar de onderkant van hun brein kunnen sturen om opnieuw te worden verwerkt. Zodra een gedachte is omgezet in een woord, gaan de rijke, verborgen details van die gedachte grotendeits verloren, waardoor de AI ofwel een lange, woordenrijke uitleg moet schrijven, of alles vanaf nul opnieuw moet berekenen. Onderzoekers willen weten: kunnen we de AI haar "geheime aantekeningen" laten bewaren en ze terugsturen naar het begin van haar brein zonder dat ze ze als woorden hoeft op te schrijven? Als dat zou kunnen, zou de AI sneller, slimmer en met minder woorden kunnen denken.

Dit artikel introduceert een nieuw soort AI genaamd de "full-bandwidth transformer". De onderzoekers, werkzaam bij Microsoft en topuniversiteiten, hebben een manier gevonden om die smalle "fluister"-kanaal te verbreden. In plaats van alleen één woord terug naar het begin te sturen, laten ze de AI haar volledige "hidden state" sturen — een massieve, complexe samenvatting van alles wat ze tot nu toe heeft gedacht — terug naar de onderkant van haar brein. Dit doen ze met een slimme truc genaamd "latent feedback". Stel je voor dat je, in plaats van je toekomstige zelf een ansichtkaart te overhandigen, je hele rugzak met aantekeningen direct naar je startpunt kunt teleporteren, terwijl je nog steeds de ansichtkaart houdt als verslag van wat je hebt gezegd. De AI voegt haar diepe, interne samenvatting samen met het nieuwe woord dat ze zojuist heeft gegenereerd, waardoor een supergeladen input ontstaat voor de volgende stap.

Het team trainde deze nieuwe modellen met een speciaal schema dat deze "teleporterende" vaardigheid langzaam introduceerde tijdens hun leerfase. Ze testten modellen met 1 miljard parameters op een enorme hoeveelheid tekst (tot 400 miljard tokens). De resultaten suggereren dat deze methode verrassend goed werkt. De AI werd niet alleen beter in wiskunde en programmeren; ze begon ook korter en efficiënter te denken. In veel tests presteerde de full-bandwidth transformer net zo goed als standaardmodellen die op twee keer zoveel data waren getraind, en soms evenaarde het zelfs modellen die op vijf keer zoveel data waren getraind. Misschien wel het meest opwindend: bij het oplossen van wiskundige problemen produceerden deze nieuwe modellen vaak veel kortere antwoorden terwijl ze toch het juiste resultaat behaalden, wat suggereert dat ze het harde denkwerk in hun "hoofd" deden in plaats van woorden te verspillen aan uitleg. De onderzoekers ontdekten dat deze aanpak bijna geen extra kosten met zich meebrengt voor de snelheid van de AI, wat het een veelbelovende manier maakt om slimmere en efficiëntere AI te bouwen zonder de noodzaak voor eindeloze hoeveelheden nieuwe data.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →