← Nieuwste papers
💬 NLP

Designing large language model prompts to extract scores from messy text: A shared dataset and challenge

Dit artikel introduceert een gedeelde dataset van 1.446 rommelige onderzoeks-teksten met Britse kwaliteitsscores en een bijbehorende uitdaging om optimale Large Language Model-prompts te ontwerpen die accuraat geldige scores extraheren of ontbrekende waarden identificeren, met als doel een initiële baseline van 72,6% nauwkeurigheid te overtreffen terwijl het begrip van prompt engineering voor complexe numerieke taken wordt geavanceerd.

Oorspronkelijke auteurs: Mike Thelwall

Gepubliceerd 2026-01-27
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mike Thelwall

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een bibliothecaris bent die een enorme stapel brieven probeert te ordenen. Elke brief is geschreven door een andere robot (een AI) om te beschrijven hoe goed een onderzoeksartikel is. De robots hadden de bedoeling om een eenvoudige beoordeling te geven, zoals een sterrenscore van 1 tot 4.

De robots zijn echter slordige schrijvers. Sommige brieven beginnen met de score, sommige verbergen deze in het midden van een paragraaf, sommige geven drie verschillende scores en vergeten deze te combineren, en sommige praten gewoon wat rond zonder een score te geven. Erger nog, sommige robots verzinnen zelfs nepscores zoals "95%" of "4/5", terwijl de regels alleen 1 tot 4 sterren toestaan.

Het Probleem
Mike Thelwall, de auteur van dit artikel, heeft 1.446 van deze slordige brieven verzameld. Hij noemt dit een "gedeelde dataset". Zijn doel is om andere onderzoekers uit te dagen om een "magische instructiehandleiding" (een prompt) te bouwen voor een nieuwe, slimmere robot.

De taak van deze nieuwe robot is om de slordige brieven te lezen en het juiste getal eruit te halen. Maar de robot moet twee strikte regels volgen:

  1. Wees een Detective: De robot moet de juiste score achterhalen, zelfs als de brief verwarrend is. Als de brief "Originaliteit", "Significantie" en "Rigor" apart vermeldt, moet de robot weten dat hij het gemiddelde hiervan moet nemen. Als de brief geen score bevat, moet de robot "-1" zeggen (wat betekent: "Ik weet het niet").
  2. Wees een Robot, Geen Praatjesmaker: De robot mag alleen het getal uitspugen (zoals "3*" of "-1"). Hij mag niet zeggen: "Ik denk dat de score 3 is omdat..." Als hij extra woorden toevoegt, is het antwoord fout.

De Uitdaging
Denk hierbij aan een spelletje "Simon zegt" gespeeld met een zeer letterlijke maar licht verwarde robot.

  • De Huidige Score: De auteur heeft een eenvoudige instructiehandleiding geprobeerd, en de robot had het in ongeveer 73% van de gevallen goed.
  • Het Doel: De uitdaging is voor iedereen om een betere instructiehandleiding te ontwerpen die een hogere score behaalt.

Waarom Dit Doen?
Dit artikel gaat niet over het gebruiken van dit proces om echte essays van studenten te beoordelen of medische diagnoses te corrigeren op dit moment. In plaats daarvan is het een oefening. Door onderzoekers te dwingen uit te zoeken hoe ze robots instructies kunnen geven om specifieke getallen uit slordige tekst te extraheren, leren we:

  • Hoe we met robots praten zodat ze beter luisteren (Prompt Design).
  • Waar robots in de war raken en hoe we die instructies kunnen verbeteren.
  • Hoe we situaties afhandelen waarin de robot onzeker is (weten wanneer de robot "-1" moet zeggen in plaats van te gokken).

De Kern van het Verhaal
Dit artikel is een uitnodiging voor een wedstrijd. Het zegt: "Hier is een stapel slordige robotnotities en een lijst met de juiste antwoorden. Kun jij de perfecte set instructies schrijven om een robot de opdracht te geven deze notities te lezen en je telkens precies het juiste getal te geven?" De winnaar is degene die het hoogste percentage correcte antwoorden haalt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →