JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes
L'article présente JobHop v2, un ensemble de données rendu public comprenant plus de 355 000 trajectoires de carrière dérivées de CV multilingues pseudonymisés via un pipeline d'extraction robuste par LLM, offrant des annotations riches et une fiabilité améliorée pour faire progresser la planification de la main-d'œuvre et la recherche sur le marché du travail.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez le monde du travail comme une immense bibliothèque désordonnée où chaque livre est le CV d'une personne. Pendant des années, les chercheurs tentant de comprendre comment les gens passent d'un emploi à un autre sont restés bloqués parce que ces « livres » étaient écrits dans des langues différentes, avaient des formats bizarres et étaient remplis de gribouillis que les ordinateurs ne pouvaient pas lire. C'était comme essayer de construire la carte d'une ville en utilisant uniquement des notes manuscrites déchirées.
Auparavant, les seules cartes disponibles étaient soit minuscules (comme quelques milliers de notes), soit composées de données fictives, soit enfermées dans des coffres privés que personne d'autre ne pouvait ouvrir. Il y avait une tentative antérieure appelée « JobHop v1 », mais elle était un peu défaillante ; parfois, l'ordinateur se laissait confondre par les notes désordonnées et recrachait des fichiers corrompus impossibles à utiliser.
Entrez en scène JobHop v2, un tout nouveau bibliothécaire super intelligent construit à l'aide d'un cerveau d'Intelligence Artificielle (IA) massif. Les chercheurs ont donné à cette IA une pile d'environ 440 000 CV réels et anonymisés provenant du Service Public de l'Emploi de Flandre (VDAB). Ces CV étaient un mélange chaotique de néerlandais, de français et d'anglais, avec les noms et les lieux cachés derrière des jetons <MASK> pour protéger la vie privée.
Le tour de magie : Le robot de raisonnement
Au lieu de simplement deviner, cette nouvelle IA utilise une approche « contrôlée par le raisonnement ». Imaginez un détective qui ne se contente pas de lire un indice, mais qui s'arrête pour réfléchir : « Attendez, est-ce que cette date est cohérente ? Est-ce un emploi ou un cours scolaire ? ». Si l'IA est bloquée ou produit un fichier désordonné (comme un JSON qui ne s'ouvre pas), elle possède un bouton spécial « réessayer ». Elle essaie à nouveau avec un peu plus de concentration.
Le résultat ? Sur les quelque 400 000 CV ayant survécu au nettoyage initial, l'IA a réussi à transformer 100 % d'entre eux en fichiers numériques propres et organisés. C'est un score parfait ! Elle a extrait 355 315 parcours de carrière uniques, détaillant 1 993 291 expériences professionnelles et 923 981 entrées de formation.
Qu'y a-t-il dans la boîte ?
JobHop v2 est comme un coffre au trésor de données de carrière. Il ne se contente pas de lister les intitulés de postes ; il les organise en utilisant un dictionnaire mondial standardisé appelé ESCO. Il indique précisément quand quelqu'un a commencé et terminé un emploi (jusqu'au trimestre près, comme « T1 2020 »), quel est son niveau d'éducation (de l'école primaire jusqu'au doctorat) et même quels outils spécifiques il a utilisés (comme Python ou Spark).
Cela a-t-il vraiment mieux fonctionné ?
Les chercheurs ne se sont pas contentés de dire « c'est bien » ; ils l'ont mis à l'épreuve. Ils ont comparé le travail de l'IA à trois ensembles différents de réponses « étalon » générées par des humains et d'autres IA.
- Le Score : La meilleure version de leur IA (utilisant un modèle gigantesque de 120 milliards de paramètres) a obtenu un score incroyablement proche du « plafond » de ce sur quoi les humains et les autres IA pouvaient s'accorder. Elle n'était qu'à 1,1 à 2,7 points de pourcentage de la limite de l'accord parfait.
- Le Duel : Lors d'un test à l'aveugle contre l'ancien JobHop v1 (où un juge ne savait pas lequel était lequel), le nouveau JobHop v2 a gagné 68,3 % du temps, tandis que l'ancienne version n'a gagné que 29,9 %. Le juge a noté que la v2 était bien meilleure pour gérer les parties confuses et cachées des CV ainsi que pour comprendre les dates dans différentes langues.
Ce que ce n'est PAS
Il est important de savoir ce que cet ensemble de données ne fait pas. Les chercheurs ont explicitement exclu l'utilisation de faux CV inventés ou de codes pré-standardisés qui auraient été synthétisés par une IA avant l'extraction. Ils voulaient du texte réel, brut, provenant de personnes réelles. De plus, ils ont été très prudents pour ne pas trop deviner : environ 6,9 % des entrées d'emploi ont été marquées comme « inconnues » car l'IA a jugé qu'il était plus sûr d'admettre qu'elle ne savait pas plutôt que de deviner de travers. Ils n'ont pas essayé de forcer une étiquette sur tout.
L'essentiel
JobHop v2 suggère que nous pouvons enfin transformer le désordre chaotique et non structuré de millions de CV en un ensemble de données propre et massif qui aide à comprendre comment les carrières évoluent réellement. Ce n'est pas une boule de cristal magique qui prédit parfaitement l'avenir, mais cela fournit la carte la plus précise et à grande échelle des parcours professionnels jamais construite à partir de textes réels non structurés. Les chercheurs rendent cette carte et les outils utilisés pour la construire publics, en espérant que d'autres les utiliseront pour étudier les marchés du travail et les recommandations d'emploi sans avoir à repartir de zéro.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.