← Nieuwste papers
💬 NLP

Training Hybrid Block Diffusion Language Models with Partial Bidirectionality

Dit artikel introduceert BDLM Mamba-H, een hybride diffusie-taalmodel dat bidirectionele Mamba-scanning beperkt tot actieve denoising-blokken om exacte caching mogelijk te maken, waardoor een superieure perplexiteit en een significant hogere throughput voor lange context-inferentie wordt bereikt in vergelijking met bestaande full-sequence en attention-gebaseerde diffusie-baselines.

Oorspronkelijke auteurs: Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen

Gepubliceerd 2026-07-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel lang verhaal probeert te schrijven, maar je hebt een strikte regel: je kunt alleen de laatste paar pagina's die je hebt geschreven onthouden. Elke keer als je de volgende zin wilt schrijven, moet je helemaal teruglopen naar het begin van je schrift, elk woord dat je tot nu toe hebt geschreven lezen, en dan beslissen wat je hierna gaat schrijven.

Dit is precies hoe huidige "Large Language Models" (AI-chatbots) worstelen met lange contexten. Naarmate het gesprek langer wordt, moet de AI de hele geschiedenis "herlezen" telkens wanneer hij een nieuw woord genereert. Dit is traag en verspilt veel energie, alsof je een marathon probeert te lopen terwijl je een zware rugzak draagt die met elke stap zwaarder wordt.

Het artikel introduceert een nieuwe manier om deze AI-modellen te trainen, genaamd BDLM Mamba-H, die dit probleem oplost door de manier waarop de AI "onthoudt" en "denkt" te veranderen.

Hier is de uitleg met eenvoudige analogieën:

1. Het Probleen: De "Zware Rugzak"

Huidige AI-modellen werken als een student die een toets maakt en de hele tekst van het leerboek opnieuw moet lezen voordat hij elke vraag kan beantwoorden.

  • Het probleem: Naarmate het verhaal langer wordt, wordt de "rugzak" (het geheugen) te zwaar. De computer besteedt meer tijd aan het verplaatsen van gegevens (geheugenbandbreedte) dan aan het daadwerkelijk denken (rekenkracht).
  • De oude oplossing: Sommige onderzoekers probeerden de rugzak lichter te maken door een ander type geheugen te gebruiken (genaamd "Mamba"). Anderen probeerden meerdere zinnen tegelijk te schrijven in plaats van één voor één (genaemd "Block Diffusion").
  • De fout: Wanneer onderzoekers probeerden deze twee ideeën te combineren, ging het mis. Het "Mamba"-geheugensysteem moest naar het gehele verhaal kijken in omgekeerde volgorde om goed te werken. Maar als je het hele verhaal in omgekeerde volgorde bekijkt, kun je geen "bladwijzer" opslaan voor de delen die je al hebt afgerond. Je moet alles elke keer opnieuw lezen.

2. De Oplossing: De "Lokale Omgekeerde Scan"

De auteurs stellen een slimme truc voor: Kijk alleen achteruit binnen de huidige paragraaf.

Stel je voor dat je een boek hoofdstuk voor hoofdstuk schrijft.

  • De oude manier (Volledige omgekeerde scan): Om een nieuwe zin te schrijven, lees je het volledige boek opnieuw van de laatste pagina terug naar pagina één, elke keer weer.
  • De nieuwe manier (BDLM Mamba-H):
    1. Het "Schone" deel: Zodra een hoofdstuk is voltooid, plaats je het in een beveiligde kluis. Je maakt een eenvoudige "samenvattingskaart" (een cache) voor dat hoofdstuk. Je hoeft de kluis nooit meer te openen; je gebruikt gewoon de samenvattingskaart.
    2. Het "Actieve" deel: Terwijl je het huidige hoofdstuk schrijft, mag je binnen dat specifieke hoofdstuk vooruit en achteruit kijken om ervoor te zorgen dat de zinnen goed in elkaar overvloeien.
    3. De magie: Omdat je alleen achteruit kijkt binnen het huidige hoofdstuk, blijven de samenvattingskaarten voor de voltooide hoofdstukken geldig en hoeven ze niet te worden bijgewerkt.

3. De Resultaten: Snelheid en Slimheid

De onderzoekers hebben deze nieuwe methode getest tegen oudere methoden met twee hoofddoelen: de AI slim te houden en hem snel te maken.

  • Is het slim? Ja. Wanneer ze de AI testten op een standaard leesvaardigheidstest (C4-en), behaalde het nieuwe model (BDLM Mamba-H) de hoogste scores onder de kleinere modellen (87 miljoen parameters). Zelfs toen ze het model groter maakten (350 miljoen parameters), bleef het net zo slim als de andere topmodellen.
  • Is het snel? Groot verschil.
    • Bij een gemiddelde lengte (65.000 woorden) was het nieuwe model 19,7 keer sneller dan de oude "volledige omgekeerde" methode.
    • Bij een zeer lange lengte (262.000 woorden) was het 3,7 keer sneller dan de beste "blok" methode die geen Mamba gebruikte.

De Kernboodschap

Beschouw dit nieuwe model als een schrijver die heeft geleerd om hoofdstukken die klaar zijn te bookmarken (bladwijzers te maken) zodat hij ze niet opnieuw hoeft te lezen, terwijl hij nog steeds vrijelijk het huidige hoofdstuk kan bewerken.

Door de "achterwaartse blik" te beperken tot de huidige blok tekst, kan de AI zeer lange verhalen genereren zonder te verzanden in het verkeer van het geheugen. Het artikel beweert dat dit een praktische en krachtige architectuur maakt voor het afhandelen van lange contexten, en bewijst dat je zowel snelheid als hoogwaardig schrijven kunt hebben zonder dat je de volledige geschiedenis voor elk nieuw woord opnieuw hoeft te verwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →