← Últimos artículos
💬 NLP

JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

El artículo presenta JobHop v2, un conjunto de datos de acceso público de más de 355.000 trayectorias profesionales derivadas de currículos multilingües seudonimizados mediante un robusto proceso de extracción con LLM, que ofrece anotaciones ricas y una fiabilidad mejorada para avanzar en la planificación de la fuerza laboral y la investigación del mercado laboral.

Autores originales: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

Publicado 2026-07-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo del trabajo como una biblioteca gigante y desordenada donde cada uno de los libros es el currículum de una persona. Durante años, los investigadores que intentaban comprender cómo las personas pasan de un trabajo a otro se quedaron estancados porque estos "libros" estaban escritos en diferentes idiomas, tenían formatos extraños y estaban llenos de garabatos que las computadoras no podían leer. Eran como intentar construir un mapa de una ciudad usando solo notas manuscritas y fragmentadas.

Anteriormente, los únicos mapas disponibles eran o muy pequeños (como unos pocos miles de notas), estaban hechos de datos falsos o estaban guardados en bóvedas privadas que nadie más podía abrir. Hubo un intento anterior llamado "JobHop v1", pero era un poco problemático; a veces la computadora se confundía con las notas desordenadas y escupía archivos dañados que no se podían usar.

Entra JobHop v2, un bibliotecario nuevo y súper inteligente construido con un cerebro masivo de Inteligencia Artificial (IA). Los investigadores le dieron a esta IA una pila de aproximadamente 440.000 currículums reales y anonimizados del Servicio Público de Empleo de Flandes (VDAB). Estos currículums eran una mezcla caótica de neerlandés, francés e inglés, con nombres y ubicaciones ocultos tras tokens <MASK> para proteger la privacidad.

El truque de magia: El robot de razonamiento
En lugar de simplemente adivinar, esta nueva IA utiliza un enfoque "controlado por razonamiento". Piensa en esto como un detective que no solo lee una pista, sino que hace una pausa para pensar: "Espera, ¿tiene sentido esta fecha? ¿Es esto un trabajo o una clase escolar?". Si la IA se queda trabada o produce un archivo desordenado (como un JSON que no abre), tiene un botón especial de "reintentar". Lo intenta de nuevo con un poco más de enfoque.

¿El resultado? De los aproximadamente 400.000 currículums que pasaron la limpieza inicial, la IA convirtió con éxito el 100% en archivos digitales limpios y organizados. ¡Es una puntuación perfecta! Extrajo 355.315 historias de carrera únicas, detallando 1.993.291 experiencias laborales y 923.981 entradas de educación.

¿Qué hay en la caja?
JobHop v2 es como un cofre del tesoro de datos de carrera. No solo enumera títulos de puestos; los organiza utilizando un diccionario global estándar llamado ESCO. Te dice exactamente cuándo alguien comenzó y terminó un trabajo (con la precisión de un trimestre, como "Q1 2020"), qué nivel de educación tiene (desde la escuela primaria hasta un doctorado) e incluso qué herramientas específicas utilizó (como Python o Spark).

¿Realmente funcionó mejor?
Los investigadores no se limitaron a decir "es bueno"; lo pusieron a prueba. Compararon el trabajo de la IA contra tres conjuntos diferentes de respuestas "estándar de oro" generadas por humanos e IA.

  • La puntuación: La mejor versión de su IA (usando un modelo enorme de 120 mil millones de parámetros) obtuvo una puntuación que estaba increíblemente cerca del "techo" de lo que los humanos y otras IA podrían acordar. Estaba solo a 1,1 a 2,7 puntos porcentuales del límite de acuerdo perfecto.
  • El enfrentamiento: Cuando hicieron una prueba de sabor a ciegas contra el antiguo JobHop v1 (donde un juez no sabía cuál era cuál), el nuevo JobHop v2 ganó el 68,3% de las veces, mientras que la versión antigua solo ganó el 29,9%. El juez observó que v2 era mucho mejor manejando las partes desordenadas y ocultas de los currículums y comprendiendo las fechas en diferentes idiomas.

Lo que NO es
Es importante saber lo que este conjunto de datos no hace. Los investigadores descartaron explícitamente el uso de currículums falsos o creados artificialmente, o códigos pre-estandarizados que fueran sintetizados por una IA antes de que ocurriera la extracción. Querían texto real y bruto de personas reales. Además, fueron muy cuidadosos de no suponer demasiado: aproximadamente el 6,9% de las entradas de trabajo fueron etiquetadas como "desconocido" porque la IA decidió que era más seguro admitir que no sabía en lugar de adivinar erróneamente. No intentaron forzar una etiqueta en todo.

La conclusión
JobHop v2 sugiere que finalmente podemos convertir el caos desordenado de millones de currículums en un conjunto de datos limpio y masivo que ayuda a comprender cómo evolucionan realmente las carreras. No es una bola de cristal mágica que predice el futuro perfectamente, pero proporciona el mapa más preciso y a gran escala de las trayectorias profesionales jamás construido a partir de texto real no estructurado. Los investigadores están lanzando este mapa y las herramientas utilizadas para construirlo al público, con la esperanza de que otros los utilicen para estudiar los mercados laborales y las recomendaciones de empleo sin tener que empezar desde cero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →