← Nieuwste papers
💬 NLP

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

Dit paper introduceert propella-1, een familie van meertalige kleine LLM's die documenten op schaal annoteren met 18 gestructureerde eigenschappen in plaats van één enkele scores, waardoor een diepgaand, meerdimensionaal inzicht in de kwaliteit van pretraining-data mogelijk wordt.

Oorspronkelijke auteurs: Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

Gepubliceerd 2026-02-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

PROPELLA-1: De "Super-Inspecteur" voor de Data van AI

Stel je voor dat je een gigantische bibliotheek wilt bouwen om een slimme robot (een Large Language Model of LLM) te leren denken en spreken. Je hebt miljarden boeken, kranten, websites en documenten nodig. Maar niet alles wat op internet staat is goed. Er zit veel rommel tussen: spam, foutieve informatie, saaie reclames, of zelfs gevaarlijke inhoud.

Vroeger keken mensen naar deze bibliotheek met een simpele "rood-groen" lamp. Ze gaven elk document één cijfer: "Is dit goed of slecht?" (bijvoorbeeld een score van 1 tot 10). Het probleem? Dat één cijfer vertelt je te weinig. Een document kan een hoge score hebben omdat het goed geschreven is, maar misschien is het alleen maar een saaie reclame voor een auto. Of het kan een lage score hebben omdat het moeilijk te lezen is, terwijl het juist een briljante wiskundige oplossing bevat.

PROPELLA-1 is een nieuwe, slimme oplossing van het team bij ellamind. Het is geen simpele lamp, maar een super-inspecteur die elk document in detail bekijkt.

Hier is hoe het werkt, vertaald naar alledaags taal:

1. De 18 Vragen van de Inspecteur

In plaats van één cijfer te geven, stelt PROPELLA-1 18 specifieke vragen over elk document. Denk aan een uitgebreide keuring bij de auto:

  • Is de motor goed? (Kwaliteit van de tekst)
  • Is het een raceauto of een bus? (Wat voor soort tekst is het? Een verhaal, een handleiding, een code?)
  • Is het veilig? (Zit er haatzaaiende taal of privé-informatie in?)
  • Voor wie is het? (Is het voor een kind, een student of een professor?)
  • Is het actueel? (Is het een nieuwsbericht van vandaag of een oude geschiedenisles?)
  • Komt het uit Nederland of Brazilië? (Waar is de tekst over?)

Deze vragen zijn onderverdeeld in 6 categorieën, zoals "Inhoud", "Veiligheid" en "Doelgroep". Door al deze details te verzamelen, krijgen we een 3D-kaart van de kwaliteit, in plaats van een platte lijn.

2. De Slimme Robotjes (De Modellen)

Om deze 18 vragen te beantwoorden, hebben de makers drie kleine, maar zeer slimme robotjes gebouwd (genaamd 0.6B, 1.7B en 4B).

  • Hun kracht: Ze zijn klein en snel, maar ze zijn getraind om precies te kijken zoals een menselijke expert zou doen.
  • Hun taal: Ze spreken 57 talen. Ze kunnen een document in het Fins, Japans of Arabisch lezen en begrijpen, en dan de juiste 18 labels plakken.
  • Hun output: Ze geven geen vaag gevoel, maar een strakke lijst (een JSON-bestand) met antwoorden. Bijvoorbeeld: "Dit document is 'uitstekend' qua kwaliteit, 'technisch' van aard, en 'veilig'."

3. Waarom is dit zo belangrijk? (De Analogie van de Keuken)

Stel je voor dat je een chef-kok bent die een groot feestmaal bereidt voor de AI.

  • De oude methode (één score): Je kijkt naar de ingrediënten en zegt: "Dit is goed, dit is slecht." Je gooit misschien een prachtige, dure truffel weg omdat hij er een beetje vies uitziet (lage score), terwijl hij juist de smaak van het gerecht zou kunnen verbeteren. Of je gebruikt een stuk rot vlees omdat het er fris uitziet (hoge score), maar het is eigenlijk bedorven.
  • De PROPELLA-methode: Je hebt nu een keukenteam dat elke ingrediënt apart controleert. Ze zeggen: "De truffel is goed, maar de vis is te zout. De groenten zijn perfect voor een vegetarisch gerecht, maar niet voor vlees."
    • Hierdoor kun je als kok precies kiezen wat je in de pan doet. Wil je een AI die goed kan redeneren? Dan selecteer je alleen de documenten met een hoge score op "Redeneervermogen". Wil je een AI die veilig is? Dan gooi je alles weg met een "veiligheidswaarschuwing".

4. Wat hebben ze gedaan?

De makers hebben deze robotjes gebruikt om 3 miljard documenten te inspecteren. Dat is een berg data die groter is dan de hele mensheid ooit heeft geschreven. Ze hebben een enorme database gemaakt (de propella-annotations) waarin voor elk document die 18 details staan.

Dit is gratis beschikbaar voor iedereen. Onderzoekers kunnen nu:

  • Kijken welke bronnen (zoals Wikipedia of nieuwswebsites) de beste kwaliteit hebben.
  • Zien dat verschillende talen heel verschillend zijn (bijvoorbeeld: het Nederlandse web heeft meer reclame dan het Finse web).
  • Hun eigen AI's trainen met precies de juiste mix van data, zonder dat ze zelf uren hoeven te zoeken.

Samenvatting

PROPELLA-1 is een revolutie in het verzamelen van data voor AI. Het vervangt de simpele "ja/nee" of "1-10" scores door een gedetailleerde paspoortcontrole voor elke tekst. Hierdoor kunnen we AI's bouwen die niet alleen slimmer zijn, maar ook veiliger, eerlijker en beter afgestemd op wat we echt nodig hebben.

Het is alsof we van een simpele lantaarnpaal zijn gegaan naar een volledig uitgerust laboratorium voor data-kwaliteit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →