← Nieuwste papers
💬 NLP

The Last Fingerprint: How Markdown Training Shapes LLM Prose

Dit onderzoek stelt dat het veelvuldig gebruik van koppeltekens door grote taalmodellen het gevolg is van markdown-training die in de tekst lekt, en dat de frequentie hiervan een diagnostisch signaal is voor de specifieke fine-tuning-methode in plaats van een stilistische fout.

Oorspronkelijke auteurs: E. M. Freeburg

Gepubliceerd 2026-03-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: E. M. Freeburg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep zeer slimme, maar soms wat stijve robots hebt die verhalen voor je schrijven. Als je naar hun teksten kijkt, valt er één ding op dat bijna iedereen herkent: ze gebruiken te veel lange streepjes (in het Engels em dashes, in het Nederlands vaak een gedachtestreepje: —).

Schrijvers en lezers op internet zeggen al jaren: "Ah, dit is een AI! Die gebruikt weer dat typische streepje." Maar tot nu toe wisten niemand waarom ze dit deden. Was het toeval? Was het een foutje?

Deze paper, geschreven door een onafhankelijk onderzoeker, geeft het antwoord. Het is een beetje als een detectiveverhaal dat twee losse mysteries aan elkaar koppelt. Hier is de uitleg in simpele taal, met een paar leuke vergelijkingen.

1. De twee mysteries die samenkomen

Er waren twee gesprekken gaande in de wereld van kunstmatige intelligentie (AI), maar niemand merkte dat het over hetzelfde ging:

  • Mysterie A (De schrijvers): "AI's gebruiken te veel streepjes." Mensen vinden het een teken dat tekst door een robot is geschreven.
  • Mysterie B (De programmeurs): "AI's denken in 'opmaak'." Als je een AI vraagt om een tekst te schrijven, maakt hij vaak ongevraagd kopjes, opsommingstekens en vetgedrukte tekst aan. Alsof hij een document in een notitieblok maakt in plaats van een verhaal te vertellen.

Deze paper zegt: Het zijn dezelfde robots! De reden dat ze streepjes gebruiken, heeft te maken met de reden dat ze van kopjes houden.

2. De oorzaak: De "Lego-bak" van de AI

Om slim te worden, moet een AI lezen. Maar waar heeft deze AI gelezen?
De meeste AI's zijn getraind op een enorme berg tekst van internet, zoals GitHub (waar programmeurs werken), Stack Overflow en technische documentatie. Op al die plekken wordt Markdown gebruikt.

Wat is Markdown?
Stel je voor dat je een tekst schrijft, maar in plaats van een mooie opmaak, gebruik je simpele tekens om structuur aan te geven:

  • # voor een kopje.
  • * voor vetgedrukt.
  • - of om dingen van elkaar te scheiden of lijsten te maken.

In de wereld van de AI is dit de "moedertaal" van de beste, meest gestructureerde teksten. De AI heeft geleerd dat een streepje (- of ) betekent: "Hier stopt een idee en begint een nieuw stukje." Het is een bouwblokje voor structuur.

3. Het lekken van de structuur (De "Laatste Vingerafdruk")

Nu komt het interessante deel. Als je een AI vraagt: "Schrijf een mooi verhaal, maar gebruik géén kopjes, géén opsommingstekens en géén vetgedrukte tekst," dan luistert de AI goed.

  • De kopjes verdwijnen.
  • De opsommingstekens verdwijnen.
  • Het vetgedrukte verdwijnt.

Maar... het streepje blijft over.

De analogie:
Stel je voor dat de AI een architect is die gewend is om gebouwen te bouwen met zichtbare stalen balken (de Markdown-opmaak). Als je hem vraagt: "Maak een huis, maar verberg alle stalen balken," dan zal hij de grote balken wegwerken.
Maar het streepje is zo'n klein, onopvallend balkje dat hij vergeten is te verbergen. Het ziet eruit als gewoon taalgebruik (een leesteken), maar in het hoofd van de AI is het nog steeds een bouwblokje om twee ideeën aan elkaar te plakken.

De auteurs noemen dit de "Laatste Vingerafdruk" (The Last Fingerprint). Het is het kleinste stukje van de "bouwstructuur" dat erin blijft hangen, zelfs als de AI probeert om "gewone tekst" te schrijven.

4. Waarom doen sommige robots het wel en anderen niet?

Dit is het meest verrassende deel van het onderzoek. De auteurs hebben 12 verschillende AI's getest (van bedrijven zoals OpenAI, Google, Meta, Anthropic, etc.).

  • Sommige AI's (zoals die van Meta/Llama): Gebruiken geen streepjes. Ze hebben het "stijl-gevoel" van hun trainers zo goed aangepast dat ze het streepje volledig hebben verwijderd.
  • Andere AI's (zoals die van OpenAI of Anthropic): Gebruiken veel streepjes. Zelfs als je ze streng vraagt om het niet te doen, blijven ze het gebruiken.

De conclusie:
Het aantal streepjes is geen toeval. Het is een handtekening van hoe de AI is getraind.
De AI's hebben allemaal geleerd van dezelfde "Lego-bak" (internet met Markdown), maar de mensen die ze daarna hebben opgeleid (de trainers) hebben verschillende instructies gegeven:

  • De ene trainer zei: "Gebruik die structuur, het klinkt slim en georganiseerd!" (Resultaat: Veel streepjes).
  • De andere trainer zei: "Gebruik het niet, dat klinkt te robotachtig." (Resultaat: Geen streepjes).

Samenvatting in één zin

AI's gebruiken te veel streepjes omdat ze in hun "hersenen" gewend zijn om tekst te bouwen als een gestructureerd document (zoals op GitHub); als je ze vraagt om gewoon te schrijven, vergeten ze dat streepje te verwijderen, en het aantal streepjes dat ze gebruiken, vertelt je precies welke "trainer" ze hebben gehad.

Wat betekent dit voor jou?
Als je een tekst leest en denkt: "Hm, dit klinkt als een AI," kijk dan naar de streepjes. Maar weet nu ook: het is niet per se een fout. Het is een technisch spoor dat laat zien hoe die specifieke AI is opgeleid. En als je een AI wilt gebruiken die niet zo'n "AI-achtige" tekst schrijft, moet je een model kiezen dat getraind is om die streepjes juist te vermijden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →