← Últimos artigos
💬 NLP

JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

O artigo apresenta o JobHop v2, um conjunto de dados lançado publicamente com mais de 355.000 trajetórias de carreira derivadas de currículos multilingues pseudonimizados por meio de um pipeline de extração robusto via LLM, oferecendo anotações ricas e confiabilidade aprimorada para avançar o planejamento da força de trabalho e a pesquisa do mercado de trabalho.

Autores originais: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

Publicado 2026-07-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o mundo do trabalho como uma biblioteca gigante e bagunçada, onde cada livro é o currículo de uma pessoa. Durante anos, pesquisadores que tentavam entender como as pessoas transitam de um emprego para outro ficaram travados porque esses "livros" eram escritos em diferentes idiomas, tinham formatações estranhas e estavam cheios de rabiscos que os computadores não consegravam ler. Era como tentar construir o mapa de uma cidade usando apenas notas manuscritas e rasgadas.

Anteriormente, os únicos mapas disponíveis eram ou minúsculos (como alguns milhares de notas), feitos de dados falsos, ou trancados em cofres privados que ninguém mais podia abrir. Houve uma tentativa anterior chamada "JobHop v1", mas era um pouco instável; às vezes o computador se confundia com as notas bagunçadas e cuspia arquivos quebrados que não podia usar.

Entra o JobHop v2, um novo bibliotecário superinteligente construído usando um massivo cérebro de Inteligência Artificial (IA). Os pesquisadores deram a esta IA uma pilha de cerca de 440.000 currículos reais e anonimizados do Serviço Público de Emprego de Flandres (VDAB). Esses currículos eram uma mistura caótica de holandês, francês e inglês, com nomes e localizações escondidos atrás de tokens <MASK> para proteger a privacidade.

O Truque de Mágica: O Robô de Raciocínio
Em vez de apenas adivinhar, esta nova IA usa uma abordagem de "controle por raciocínio". Pense nisso como um detetive que não apenas lê uma pista, mas faz uma pausa para pensar: "Espere, essa data faz sentido? Isso é um emprego ou uma aula escolar?". Se a IA ficar travada ou produzir um arquivo bagunçado (como um JSON que não abre), ela tem um botão especial de "tentar novamente". Ela tenta de novo com um pouco mais de foco.

O resultado? Dos aproximadamente 400.000 currículos que passaram pela limpeza inicial, a IA transformou com sucesso 100% deles em arquivos digitais organizados e limpos. É uma pontuação perfeita! Ela extraiu 355.315 histórias de carreira únicas, detalhando 1.993.291 experiências profissionais e 923.981 registros de educação.

O Que Tem Dentro da Caixa?
O JobHop v2 é como um baú de tesouros de dados de carreira. Ele não apenas lista cargos; ele os organiza usando um dicionário global padrão chamado ESCO. Ele diz exatamente quando alguém começou e terminou um trabalho (com precisão até o trimestre do ano, como "Q1 2020"), qual o nível de escolaridade que possui (desde o Ensino Fundamental até o Doutorado) e até mesmo quais ferramentas específicas utilizou (como Python ou Spark).

Funcionou Mesmo Melhor?
Os pesquisadores não apenas disseram "é bom"; eles colocaram à prova. Eles compararam o trabalho da IA contra três conjuntos diferentes de respostas de "padrão ouro" geradas por humanos e por outras IAs.

  • A Pontuação: A melhor versão da IA deles (usando um modelo enorme de 120 bilhões de parâmetros) obteve uma pontuação incrivelmente próxima do "teto" de concordância entre humanos e outras IAs. Ficou a apenas 1,1 a 2,7 pontos percentuais do limite de concordância perfeita.
  • O Confronto: Quando fizeram um teste cego contra o antigo JobHop v1 (onde um juiz não sabia qual era qual), o novo JobHop v2 venceu 68,3% das vezes, enquanto a versão antiga venceu apenas 29,9%. O juiz observou que o v2 era muito melhor em lidar com as partes bagunçadas e ocultas dos currículos e em entender datas em diferentes idiomas.

O Que Ele NÃO É
É importante saber o que este conjunto de dados não faz. Os pesquisadores excluiram explicitamente o uso de currículos falsos ou criados artificialmente, ou códigos pré-padronizados que fossem sintetizados por uma IA antes da extração acontecer. Eles queriam texto real, bruto, de pessoas reais. Além disso, foram muito cuidadosos para não adivinhar demais: cerca de 6,9% das entradas de emprego foram rotuladas como "desconhecido" porque a IA decidiu que era mais seguro admitir que não sabia do que errar ao tentar adivinhar. Eles não tentaram forçar um rótulo em tudo.

A Conclusão
O JobHop v2 sugere que finalmente podemos transformar a bagunça caótica e não estruturada de milhões de currículos em um conjunto de dados limpo e massivo que ajuda a entender como as carreiras realmente evoluem. Não é um cristal mágico que prevê o futuro perfeitamente, mas fornece o mapa mais preciso e de grande escala de trajetórias de carreira já construído a partir de textos reais e não estruturados. Os pesquisadores estão disponibilizando este mapa e as ferramentas usadas para construí-lo ao público, esperando que outros os utilizem para estudar mercados de trabalho e recomendações de empregos sem ter que começar do zero.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →