← Nieuwste papers
💬 NLP

YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference

Dit paper introduceert YOCO++, een verbeterde versie van de YOCO-methode die door het invoegen van gewogen residuale verbindingen tussen de KV-kaarten van lagere lagen de prestaties van cross-layer compressie voor efficiënte LLM-inferentie aanzienlijk verbetert zonder in te leveren op trainingsefficiëntie.

Oorspronkelijke auteurs: You Wu, Ziheng Chen, Yizhen Zhang, Haoyi Wu, Chengting Yu, Yuchi Xu, Wenbo Su, Bo Zheng, Kewei Tu

Gepubliceerd 2026-04-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: You Wu, Ziheng Chen, Yizhen Zhang, Haoyi Wu, Chengting Yu, Yuchi Xu, Wenbo Su, Bo Zheng, Kewei Tu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een Large Language Model (LLM), zoals de AI die dit artikel schrijft, een enorme bibliotheek is. Om een verhaal te vertellen of een vraag te beantwoorden, moet deze AI constant terugkijken naar wat hij eerder heeft gezegd. Deze 'herinneringen' worden opgeslagen in een speciaal geheugenblok dat KV-cache heet (Key-Value cache).

Hoe langer het gesprek wordt, hoe meer ruimte deze herinneringen nodig hebben. Op een gegeven moment wordt deze bibliotheek zo groot dat de computer vastloopt of extreem traag wordt. Dit is de "flesnek" waar de auteurs over praten.

Hier is hoe YOCO++ dit probleem oplost, vertaald naar alledaagse taal:

1. Het Oude Probleem: De "Gedeelde Notitie" (YOCO)

Een eerdere oplossing, genaamd YOCO, probeerde ruimte te besparen door een slim trucje: in plaats van dat elke verdieping van de bibliotheek zijn eigen notities maakt, laten ze de verdiepingen in de bovenste helft van het gebouw gewoon de notities van de middelste verdieping overnemen.

  • Het voordeel: Het bespaart enorm veel ruimte (50% minder geheugen).
  • Het nadeel: Het is alsof je een boek leest en alleen de samenvatting van hoofdstuk 5 gebruikt voor hoofdstuk 6, 7 en 8. Je mist de fijne details. De AI wordt slimmer in het besparen van ruimte, maar een beetje dommer in het begrijpen van de context. De prestaties zakken.

2. De Nieuwe Oplossing: YOCO++ (De "Super-Notitie")

De auteurs van dit paper zeggen: "Laten we die ruimtebesparing houden, maar de kwaliteit van de notities verbeteren."

Ze introduceren YOCO++. In plaats van dat de bovenste verdiepingen alleen de 'oude' notities van de middelste verdieping gebruiken, voegen ze een residuale verbinding toe.

De Analogie van de Chef-kok en de Sous-chef:

  • Stel, de onderste verdieping (de basis) is de hoofdkok die de perfecte basissoep maakt.
  • De middelste verdieping is een sous-chef die een eigen versie van de soep maakt.
  • Bij het oude YOCO gebruikten de bovenste verdiepingen alleen de soep van de sous-chef.
  • Bij YOCO++ zegt de sous-chef: "Ik neem mijn eigen soep, maar ik meng er een beetje van de perfecte basissoep van de hoofdkok doorheen."

Ze maken een gemengde soep (een gewogen combinatie). Deze gemengde soep wordt opgeslagen in het geheugen. De bovenste verdiepingen krijgen nu dus niet alleen de 'oude' soep, maar een rijkere, vollere versie die zowel de basis als de eigen ontwikkeling bevat.

3. Het Magische Ingrediënt: De "Versterker" (Scaling Factor)

In het begin wilden ze deze mengeling maken, maar de AI wist niet hoe ze de verhouding moesten instellen. Het was alsof ze probeerden melk en koffie te mengen, maar de koffie bleef te zwak.

Ze voegden een schaal-factor toe (een soort versterker). Dit zorgt ervoor dat de AI de "mix-knop" veel duidelijker kan draaien. Zonder deze knop leerde de AI niet goed hoe hij de basissoep moest toevoegen. Met de knop (die ze op een specifieke waarde zetten) leerde de AI snel dat: "Oh, ik moet echt een flinke scheut van de basissoep toevoegen om het lekker te maken."

4. Waarom is dit geweldig?

  • Snelheid: Het is net zo snel als de oude methode. Je hoeft geen extra tijd te besteden aan het zoeken in de bibliotheek; je haalt gewoon de nieuwe, betere "gemengde notitie" op.
  • Ruimte: Het gebruikt nog steeds 50% minder geheugen dan een standaard AI.
  • Kwaliteit: Omdat de "gemengde notitie" meer informatie bevat, is de AI weer slimmer. Sterker nog: hij is zelfs slimmer dan een standaard AI die geen ruimtebesparing gebruikt!

Samenvatting

YOCO++ is als het verbeteren van een slimme, maar wat slordige assistent.

  1. De assistent doet normaal gesproken zijn werk snel, maar vergeet details (standaard AI).
  2. De oude truc (YOCO) maakte hem super-snel en ruimte-efficiënt, maar hij werd vergeten en onnauwkeurig.
  3. YOCO++ geeft de assistent een "magisch notitieblok" waarin hij zijn eigen gedachten combineert met de wijsheid van de allereerste gedachte. Het resultaat? Een assistent die even snel is, even weinig ruimte inneemt, maar veel slimmer antwoordt.

Het is een win-win situatie: minder geheugen, maar meer intelligentie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →