Building a Custom Taxonomy of AI Skills and Tasks from the Ground Up with Job Postings
Dit artikel introduceert TaxonomyBuilder, een raamwerk dat aantoont dat het filteren van vacaturedata voorafgaand aan verwerking leidt tot helderdere en meer domeinspecifieke AI-vaardigheids-taxonomieën dan het gebruik van ongefilterde corpora met door LLM's versterkte clusteringtools.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een enorme, chaotische bibliotheek te organiseren met miljoenen boeken over Kunstmatige Intelligentie (KI). Je doel is om een duidelijk, makkelijk te lezen kaart (een taxonomie) te maken die mensen helpt precies te vinden wat ze nodig hebben: specifieke KI-vaardigheden en taken.
De auteurs van dit artikel, Stephen Meisenbacher en Peter Norlander, bouwden een nieuw hulpmiddel genaamd TAXONOMYBUILDER om deze taak automatisch uit te voeren. Ze testten het met twee enorme stapels real-world data: miljoenen vacatures uit de Amerikaanse arbeidsmarkt.
Hier is het verhaal van wat ze ontdekten, eenvoudig uitgelegd:
Het Probleem: De Valstrik van "Meer is Beter"
Meestal is de instinctieve reactie van mensen wanneer ze proberen een enorme rommel te ordenen, om alles in de mix te gooien. Ze denken: "Als ik meer vacatures opneem, zal mijn kaart completer zijn." Ze proberen misschien zelfs vergelijkbare zinnen te kopiëren en plakken om de stapel nog groter te maken (een proces dat data-augmentatie heet).
De auteurs vroegen zich af: Is dit eigenlijk wel nuttig? Of maakt het de bibliotheek gewoon rommeliger?
Het Experiment: Koken met Verschillende Ingrediënten
Om het antwoord te vinden, voerden ze 24 verschillende experimenten uit met hun TAXONOMYBUILDER-tool. Ze veranderden drie hoofd"ingrediënten" in hun recept:
- Data-augmentatie (Meer toevoegen): Voegden ze extra, vergelijkbare zinnen toe aan de mix om de dataset groter te maken?
- Filteren (Het ruis verwijderen): Goooiden ze de "zwakste" of meest vage vacaturebeschrijvingen weg, waarbij ze alleen de top 25%, 50% of 75% van de duidelijkste behielden?
- Zachte clustering (Vage groepering): Dwongen ze "ruizige" items die niet helemaal in een groep pasten om toch mee te doen, gewoon om op zeker te spelen?
De Grote Verrassing: Minder is Meer
De resultaten waren tegenintuïtief. Het team ontdekte dat het toevoegen van meer data de kaart eigenlijk slechter maakte.
- De "Augmentatie"-fout: Toen ze extra data toevoegden om de stapel groter te maken, werd de resulterende kaart verwarrend en minder nauwkeurig. Het was alsof je een bibliotheek probeerde te ordenen door meer boeken toe te voegen die slechts lichtelijk verschillende kopieën van hetzelfde verhaal waren; het creëerde alleen maar rommel.
- De "Filter"-winst: De beste kaarten werden gemaakt toen ze streng waren. Ze gooiden de vage, slechte kwaliteit vacaturebeschrijvingen weg (en behielden alleen de top 75% of 50% van de beste data). Door het "ruis" te verwijderen, kon de KI de duidelijke patronen veel beter zien.
- De "Zachte clustering"-nuance: Het dwingen van rommelige items in groepen hielp alleen als ze geen extra data hadden toegevoegd in de eerste plaats. Als ze extra data hadden toegevoegd, maakte het dwingen van rommelige items erin de situatie alleen maar erger.
De Analogie: Het Goudpannen Test
Stel je voor dat je goud (KI-vaardigheden) aan het pannen bent in een enorme rivier (de vacatures).
- De Oude Manier: Je schept elke emmer water, modder en stenen op die je kunt vinden, in de hoop meer goud te krijgen. Je eindigt met een enorme, modderige hoop waar het onmogelijk is om het goud te zien.
- De Nieuwe Manier (de bevinding van TAXONOMYBUILDER): Je zeurt eerst zorgvuldig door het water. Je gooit de modderige, nutteloze emmers weg (filteren). Je houdt alleen de emmers die veelbelovend lijken. Dan pan je die. Je eindigt met een kleinere hoop, maar het is puur goud.
De Conclusie
Het artikel concludeert dat bij het maken van een kaart van complexe vaardigheden uit enorme hoeveelheden tekst, kwaliteit de hoeveelheid verslaat.
- Probeer niet om elk enkel stukje data dat je kunt vinden op te nemen.
- Wees selectief. Filter zwakke of ruizige informatie eruit.
- Laat de KI zich richten op de duidelijke, hoogwaardige voorbeelden om een kaart te bouwen die daadwerkelijk nuttig en makkelijk te begrijpen is.
Kortom: Als je een duidelijke kaart van de KI-jobsmarkt wilt, hoef je niet elke enkele vacature die bestaat te lezen. Je hoeft alleen de beste eruit zorgvuldig te lezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.