← Últimos artículos
💬 NLP

Building a Custom Taxonomy of AI Skills and Tasks from the Ground Up with Job Postings

Este artículo presenta TaxonomyBuilder, un marco que demuestra que filtrar los datos de ofertas de empleo antes de procesarlos genera taxonomías de habilidades de IA más claras y específicas del dominio que el uso de corpus sin filtrar con herramientas de agrupamiento potenciadas por modelos de lenguaje grandes.

Autores originales: Stephen Meisenbacher, Peter Norlander

Publicado 2026-05-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Stephen Meisenbacher, Peter Norlander

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando organizar una biblioteca masiva y caótica que contiene millones de libros sobre Inteligencia Artificial (IA). Tu objetivo es crear un mapa claro y fácil de leer (una taxonomía) que ayude a las personas a encontrar exactamente lo que necesitan: habilidades y tareas específicas de IA.

Los autores de este artículo, Stephen Meisenbacher y Peter Norlander, construyeron una nueva herramienta llamada TAXONOMYBUILDER para realizar este trabajo automáticamente. La probaron utilizando dos pilas gigantes de datos del mundo real: millones de ofertas de empleo del mercado laboral de Estados Unidos.

Aquí está la historia de lo que descubrieron, explicada de forma sencilla:

El Problema: La Trampa de "Más es Mejor"

Por lo general, cuando las personas intentan organizar un gran desorden, su instinto es arrojar todo a la mezcla. Piensan: "Si incluyo más ofertas de empleo, mi mapa será más completo". Incluso podrían intentar copiar y pegar oraciones similares para hacer la pila aún más grande (un proceso llamado aumento de datos).

Los autores preguntaron: ¿Esto es realmente útil? ¿O simplemente hace que la biblioteca sea más desordenada?

El Experimento: Cocinando con Diferentes Ingredientes

Para encontrar la respuesta, realizaron 24 experimentos diferentes utilizando su herramienta TAXONOMYBUILDER. Cambiaron tres "ingredientes" principales en su receta:

  1. Aumento de datos (Añadir más): ¿Añadieron oraciones extra y similares a la mezcla para hacer el conjunto de datos más grande?
  2. Filtrado (Eliminar el ruido): ¿Tiraron las descripciones de empleo más "débiles" o vagas, manteniendo solo el 25%, 50% o 75% superior de las más claras?
  3. Agrupación difusa (Soft Clustering): ¿Obligaron a que elementos "ruidosos" que no encajaban del todo en un grupo se unieran de todos modos, solo por seguridad?

La Gran Sorpresa: Menos es Más

Los resultados fueron contraintuitivos. El equipo descubrió que añadir más datos en realidad empeoraba el mapa.

  • El Error del "Aumento": Cuando añadieron datos extra para hacer la pila más grande, el mapa resultante se volvió confuso y menos preciso. Era como intentar organizar una biblioteca añadiendo más libros que eran solo copias ligeramente diferentes de la misma historia; simplemente creaba desorden.
  • La Victoria del "Filtrado": Los mejores mapas se crearon cuando fueron estrictos. Tiraron las descripciones de empleo vagas y de baja calidad (manteniendo solo el 75% o 50% superior de los mejores datos). Al eliminar el "ruido", la IA pudo ver los patrones claros mucho mejor.
  • La Matices de la "Agrupación Difusa": Forzar que elementos desordenados se unan a grupos solo ayudó si no habían añadido datos extra desde el principio. Si añadieron datos extra, forzar la unión de elementos desordenados empeoró las cosas.

La Analogía: La Prueba de la Mina de Oro

Imagina que estás buscando oro (habilidades de IA) en un río masivo (las ofertas de empleo).

  • La Vieja Forma: Recolectas cada cubo de agua, lodo y rocas que puedas encontrar, esperando obtener más oro. Terminas con una pila enorme y llena de lodo donde es imposible ver el oro.
  • La Nueva Forma (el hallazgo de TAXONOMYBUILDER): Cribas cuidadosamente el agua primero. Tiras los cubos llenos de lodo y inútiles (filtrado). Solo guardas los cubos que parecen prometedores. Luego, buscas oro en esos. Terminas con una pila más pequeña, pero es oro puro.

La Conclusión

El artículo concluye que al construir un mapa de habilidades complejas a partir de grandes cantidades de texto, la calidad supera a la cantidad.

  • No intentes incluir cada pieza de datos que puedas encontrar.
  • sé selectivo. Filtra la información débil o ruidosa.
  • deja que la IA se centre en los ejemplos claros y de alta calidad para construir un mapa que sea realmente útil y fácil de entender.

En resumen: Si quieres un mapa claro del mercado laboral de IA, no necesitas leer cada oferta de empleo que existe. Solo necesitas leer cuidadosamente las mejores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →