JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes
Het artikel introduceert JobHop v2, een publiekelijk vrijgegeven dataset van meer dan 355.000 loopbaantrajecten afgeleid van gepseudonimiseerde meertalige cv's met behulp van een robuuste LLM-extractiepipeline, die rijke annotaties en verbeterde betrouwbaarheid biedt om personeelsplanning en arbeidsmarktonderzoek te bevorderen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van werk voor als een gigantische, rommelige bibliotheek waar elk boek een cv van een persoon is. Jarenlang probeerden onderzoekers die wilden begrijpen hoe mensen van de ene naar de andere baan bewegen vast te lopen, omdat deze "boeken" in verschillende talen waren geschreven, vreemde opmaak hadden en vol stonden met krabbels die computers niet konden lezen. Het was alsof je een kaart van een stad probeerde te maken met alleen maar gescheurde, handgeschreven briefjes.
Voorheen waren de enige beschikbare kaarten ofwel heel klein (zoals een paar duizend briefjes), gemaakt van nepgegevens, of opgeborgen in privékluizen die niemand anders kon openen. Er was een eerdere poging genaamd "JobHop v1", maar die was een beetje glitchy; soms raakte de computer in de war door de rommelige briefjes en spuugde het kapotte bestanden uit die niet te gebruiken waren.
Maak kennis met JobHop v2, een gloednieuwe, superintelligente bibliothecaris gebouwd met een enorme kunstmatige intelligentie (AI)-hersenen. De onderzoekers gaven deze AI een stapel van ongeveer 440.000 echte, geanonimiseerde cv's van de Vlaamse publieke werkbestrijding (VDAB). Deze cv's waren een chaotische mix van Nederlands, Frans en Engels, waarbij namen en locaties verborgen waren achter <MASK>-tokens om de privacy te beschermen.
De Magische Truk: De Redeneerrobot
In plaats van gewoon te gokken, gebruikt deze nieuwe AI een "reasoning-controlled" aanpak. Denk aan een detective die niet alleen een aanwijzing leest, maar even pauzeert om na te denken: "Wacht even, maakt deze datum wel zin? Is dit een baan of een schoolles?" Als de AI vastloopt of een rommelig bestand produceert (zoals een JSON die niet opent), heeft het een speciale "retry"-knop. Het probeert het opnieuw met iets meer focus.
Het resultaat? Van de ongeveer 400.000 cv's die de initiële schoonmaakronde passeerden, heeft de AI er 100% van succesvol omgezet in nette, georganiseerde digitale bestanden. Dat is een perfect score! Het extraheerde 355.315 unieke loopbaangeschiedenissen, met details over 1.993.291 werkervaringen en 923.981 onderwijsgegevens.
Wat zit er in de doos?
JobHop v2 is als een schatkist vol carrièregegevens. Het somt niet alleen functietitels op; het organiseert ze met behulp van een standaard wereldwijde woordenlijst genaamd ESCO. Het vertelt je precies wanneer iemand aan een baan begon en stopte (tot op het kwartaal nauwkeurig, zoals "Q1 2020"), welk opleidingsniveau iemand heeft (van basisonderwijs tot en met een PhD), en zelfs welke specifieke tools er zijn gebruikt (zoals Python of Spark).
Werkte het echt beter?
De onderzoekers zeiden niet alleen "het is goed"; ze hebben het op de proef gesteld. Ze vergeleken het werk van de AI met drie verschillende sets van door mensen en AI gegenereerde "gouden standaard" antwoorden.
- De Score: De beste versie van hun AI (met een enorm 120-miljard parameter model) behaalde een score die ongelooflijk dicht bij het "plafond" lag van wat mensen en andere AI's met elkaar zouden eens zijn. Het zat slechts 1,1 tot 2,7 procentpunt verwijderd van de perfecte overeenstemmingslimiet.
- De Confrontatie: Bij een blinde smaaktest tegen de oude JobHop v1 (waarbij een rechter niet wist welke welke was), won de nieuwe JobHop v2 68,3% van de tijd, terwijl de oude versie slechts 29,9% won. De rechter merkte op dat v2 veel beter was in het afhandelen van de rommelige, verborgen delen van de cv's en het begrijpen van datums in verschillende talen.
Wat het NIET is
Het is belangrijk om te weten wat deze dataset niet doet. De onderzoekers hebben expliciet uitgesloten dat er gebruik werd gemaakt van nep, verzonnen cv's of vooraf gestandaardiseerde codes die door een AI waren gesynthetiseerd voordat de extractie plaatsvond. Ze wilden echte, ruwe tekst van echte mensen. Ook waren ze erg voorzichtig met niet te veel gokken: ongeveer 6,9% van de werkentries werd gelabeld als "onbekend", omdat de AI besloot dat het veiliger was om toe te geven dat het het niet wist dan fout te gokken. Ze probeerden niet om alles een label op te dringen.
De Kern van het Verhaal
JobHop v2 suggereert dat we eindelijk de chaotische, ongestructureerde bende van miljoenen cv's kunnen omzetten in een schone, enorme dataset die ons helpt te begrijpen hoe carrières zich daadwerkelijk ontwikkelen. Het is geen magische kristallen bol die de toekomst perfect voorspelt, maar het biedt de meest nauwkeurige, grootschalige kaart van carrièrepaden ooit gebouwd vanuit echte, ongestructureerde tekst. De onderzoekers brengen deze kaart en de tools die gebruikt zijn om het te bouwen naar het publiek, in de hoop dat anderen het zullen gebruiken om arbeidsmarkten en baanadvies te bestuderen zonder vanaf nul te hoeven beginnen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.