← Nieuwste papers
💬 NLP

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

Dit paper introduceert HoWToBench, een groot Chinees benchmark voor het evalueren van mensachtig schrijftalent van LLM's, en Tree-of-Writing (ToW), een boomstructuur-gedreven evaluatiemethode die de inconsistenties van bestaande beoordelingsmethoden oplost en een hoge correlatie met menselijke oordelen bereikt.

Oorspronkelijke auteurs: Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

Gepubliceerd 2026-04-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groot schrijfwedstrijd organiseert voor robots die heel slim zijn (deze robots heten Large Language Models of LLM's). Je vraagt ze om verhalen, brieven, gedichten en speeches te schrijven. Maar hoe meet je nu of die robot echt een mooi verhaal heeft geschreven, of dat hij alleen maar goed is in het volgen van instructies?

Dit is precies het probleem dat de auteurs van dit paper proberen op te lossen. Ze hebben een nieuw systeem bedacht dat ze HoWToBench noemen, en een slimme manier om te beoordelen die ze Tree-of-Writing (Boom van Schrijven) noemen.

Hier is een uitleg in gewone taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Mimic-Spelletjes" en de Verwarde Jury

Tot nu toe keken we vaak alleen of de robot de opdracht precies had uitgevoerd. Dat is als een spelletje "mimic" (nabootsen): "Ik heb een brief geschreven, dus ik heb gewonnen." Maar goed schrijven is veel meer dan dat. Het gaat om sfeer, logica, emotie en stijl.

Bovendien gebruiken we vaak andere robots om te beoordelen of een tekst goed is. Het probleem is dat die beoordelende robots vaak in de war raken. Ze proberen alle punten (zoals "is het grammaticaal correct?" en "is het grappig?") in één keer te tellen, en dat leidt tot willekeurige resultaten. Het is alsof je een jury hebt die elke keer een ander oordeel geeft, afhankelijk van hoe ze net wakker zijn geworden. Dit noemen ze in het paper "Negotiation Inconsistency" (Onduidelijke onderhandeling).

2. De Oplossing: De Boom van Schrijven (Tree-of-Writing)

De auteurs zeggen: "Laten we stoppen met alles door elkaar halen." In plaats daarvan gebruiken ze een Boomstructuur.

  • De Stengel (De Hoofdverdeling): De beoordeling begint met drie grote takken:

    1. Inhoud: Is het verhaal logisch? Is het slim?
    2. Vorm: Ziet het eruit zoals een brief, een gedicht of een verslag hoort te doen?
    3. Indruk: Hoe voel je je als je het leest? Is het mooi?
  • De Takken en Bladeren: Onder elke grote tak zitten kleinere takjes. Bijvoorbeeld, onder "Inhoud" zitten takjes voor "Emotie" en "Logica".

  • De Tuinman (De Negotiator): Dit is het slimme deel. Voor elke opdracht (bijvoorbeeld "Schrijf een gedicht" vs. "Schrijf een contract") bepaalt een speciale robot-tuinman hoeveel gewicht elke tak heeft.

    • Bij een gedicht is "Emotie" heel belangrijk (een zware tak) en "Logica" misschien minder.
    • Bij een contract is "Logica" alles (een zware tak) en "Emotie" bijna niets.

Dit zorgt ervoor dat de beoordeling eerlijk en transparant is, net als een goed georganiseerd bos waar elke boom zijn eigen plek heeft.

3. De Proefvelden: HoWToBench

Om dit systeem te testen, hebben de auteurs een gigantisch trainingsveld gebouwd genaamd HoWToBench.

  • Het bevat 1302 verschillende schrijftaken in 12 soorten genres (van fictie en gedichten tot officiële rapporten en brieven).
  • Ze hebben drie niveaus van moeilijkheid:
    1. Invullen: Je krijgt een half verhaal en moet de rest invullen.
    2. Gids: Je krijgt een ruwe schets (een outline) en moet daar een verhaal van maken.
    3. Open: Je krijgt alleen een onderwerp en moet zelf alles bedenken. Dit is het moeilijkst, want de robot moet echt creatief zijn.

Het mooiste is dat ze echte menselijke teksten van experts hebben gebruikt als voorbeeld. Het is alsof ze de "gouden standaard" van menselijk schrijven hebben gebruikt om de robots te testen, in plaats van willekeurige internetteksten.

4. Wat hebben ze ontdekt? (De verrassende resultaten)

Toen ze de beste robots (zoals GPT-4, Claude en DeepSeek) tegen elkaar lieten strijden, kwamen ze tot een paar interessante conclusies:

  • Langer is niet altijd beter: Vaak denken mensen dat als een robot meer tekst schrijft, het beter is. Maar de Boom van Schrijven liet zien dat bij moeilijke taken (zoals het open schrijven) langer schrijven vaak leidt tot een slechtere score. De robots proberen soms informatie op te stapelen, maar dat maakt het verhaal juist minder goed.
  • Robuustheid: Als je een tekst een beetje "verpest" (bijvoorbeeld door zinnen te herhalen of stukjes weg te laten), vallen de oude beoordelingssystemen in elkaar. Maar de Boom van Schrijven blijft stabiel. Het is alsof je een huis bouwt: als je een raam breekt, stort een slecht huis in, maar een goed gebouwd huis (de Boom) blijft staan.
  • Mensen vs. Robots: De Boom van Schrijven kwam tot een beoordeling die 93% overeenkwam met wat echte mensen vonden. Dat is een enorm hoog cijfer!

Samenvattend

Dit paper is als het bouwen van een slimme, eerlijke jury voor schrijvende robots.
In plaats van te vragen: "Heeft de robot de opdracht gedaan?", vraagt de Boom van Schrijven: "Heeft de robot een goed verhaal geschreven dat past bij het genre, met de juiste emotie en structuur?"

Het bewijst dat we niet alleen moeten kijken of robots kunnen "nabootsen", maar dat we moeten leren hoe ze echt kunnen creëren en schrijven zoals een mens, met alle nuances en gevoeligheden van dien. En met hun nieuwe systeem kunnen we dat eindelijk goed meten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →