← Últimos artigos
💬 NLP

An Agentic Hybrid Top-Down and Bottom-Up Approach to Knowledge Graph Generation

Este artigo propõe um pipeline híbrido agêntico que combina o aterramento top-down no Wikidata com a reflexão bottom-up para gerar autonomamente um grafo de conhecimento de habilidades multilíngue, escalável e de autocura, a partir de dados de RH ruidosos e não estruturados.

Autores originais: Emma Jouffroy, Warren Jouanneau, Marc Palyart

Publicado 2026-08-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Emma Jouffroy, Warren Jouanneau, Marc Palyart

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como uma biblioteca gigante e caótica onde todos estão gritando sobre o que são bons em fazer. Algumas pessoas falam um inglês perfeito, outras falam francês, alemão ou espanhol, e algumas estão usando gírias que nem sequer foram inventadas ainda. No mundo da contratação, esta biblioteca é uma bagunça. Se uma empresa quiser encontrar um "Gerente de Projetos", ela pode perder um candidato brilhante que escreveu "Gestão de Projetos Web" ou "Gestion de Projet" porque o computador não sabe que essas frases significam a mesma coisa. É aqui que os Grafos de Conhecimento entram. Pense em um Grafo de Conhecimento como um mapa super organizado que conecta ideias. Em vez de apenas uma lista de palavras, é uma teia onde "Gestão de Projetos" é um grande centro, e "Gestão de Projetos Web" é um ramo menor pendurado nele. O objetivo é pegar essa biblioteca bagunçada de vozes gritantes e transformá-la em um mapa limpo e preciso para que os computadores possam realmente ajudar os humanos a encontrar os empregos certos.

Mas construir este mapa é complicado. Você pode tentar desenhá-lo de cima para baixo, usando um livro de regras estrito (como uma lista governamental de empregos), mas isso ignora todos os empregos novos e interessantes que ainda não existem no livro de regras. Ou, você pode tentar construir de baixo para cima, deixando um computador adivinhar e agrupar coisas por conta própria, mas isso geralmente leva a uma bagunça caótica onde o computador inventa empregos falsos ou divide um único emprego em dez nomes diferentes. Este artigo apresenta uma nova maneira inteligente de construir este mapa, misturando o melhor dos dois mundos: um livro de regras estrito para o que já é conhecido e uma equipe de robôs inteligentes e autocorretivos para o que é novo.

Os pesquisadores, trabalhando com uma plataforma europeia de freelancers chamada Malt, construíram um sistema que atua como uma equipe de robôs detetives. Eles o chamam de abordagem "Agêntica Híbrida". Veja como funciona: Primeiro, o sistema pega uma habilidade bagunçada escrita por um humano, como "gestion de projet web" (gestão de projetos web em francês) e tenta combiná-la com um mapa confiável e pré-existente chamado Wikidata. Pense no Wikidata como a "Wikipedia dos fatos" na qual os robôs confiam totalmente. Se a habilidade coincide com algo no Wikidata, ótimo! O robô a fixa no lugar, garantindo que seja precisa e consistente em todos os cinco idiomas que eles consideram (inglês, francês, alemão, holandês e espanhol).

Mas e se a habilidade for totalmente nova e não existir no Wikidata? É aí que a parte "Agêntica" brilha. Em vez de apenas desistir ou inventar coisas, o sistema usa um ciclo especial de "reflexão". Imagine um robô que escreve um rascunho, depois para e pergunta a si mesmo: "Espere, isso está certo? Isso se encaixa com as outras habilidades?". Se o robô perceber que uma habilidade é específica demais para se encaixar sob o guarda-chuva principal de "Gestão de Projetos", ele não a descarta. Em vez disso, ele cria um novo ramo "órfão" especial para ela. Ele dá a este novo ramo um ID único e um nome claro, como "Gestão de Projetos Web", e o conecta de volta ao centro principal. O sistema então executa esse processo repetidamente, verificando seu próprio trabalho, mesclando duplicatas e limpando a bagunça até que o mapa esteja o mais preciso possível.

O artigo mostra que este método funciona muito bem, mas não é mágica — é rigoroso. Eles testaram o sistema em mais de 36.000 descrições de habilidades brutas e bagunçadas de freelancers reais. O sistema conseguiu organizar uma enorme parte delas, mas também teve que ser honesto sobre o que não conseguiu lidar. Do total, cerca de 19% das tentativas de combinar habilidades com o mapa foram "palpites errados" porque a entrada era muito confusa ou ambígua. Além disso, o sistema rejeitou ativamente outros 13,7% das entradas porque determinou que elas simplesmente não eram habilidades válidas (como erros de "NÃO_É_UMA_HABILIDADE") ou eram ruído semântico. No entanto, para os dados que ele conseguiu processar, os resultados foram impressionantes: ele limpou e organizou 27.743 das entradas, agrupando-as em cerca de 13.300 categorias de habilidades claras e padronizadas. Isso significa que eles reduziram o caos em mais da metade para os dados válidos, transformando milhares de variações confusas em uma lista estruturada e organizada. Melhor ainda, o sistema foi capaz de falar todos os cinco idiomas perfeitamente, criando 66.490 rótulos padronizados para que um falante de francês e um falante de alemão pudessem encontrar o mesmo emprego.

Os pesquisadores descobriram que sua abordagem "híbrida" era muito melhor do que usar apenas um livro de regras estrito ou apenas deixar o computador adivinhar. Ao ancorar as habilidades conhecidas ao Wikidata, eles evitaram que o computador inventasse empregos falsos (um problema chamado "alucinação"). Ao usar o ciclo de "reflexão" para as novas habilidades, eles não perderam os empregos emergentes e interessantes que os livros de regras ainda não capturaram. O resultado é um mapa de habilidades vivo e pulsante que pode se atualizar conforme o mercado de trabalho muda, tornando muito mais fácil para as empresas encontrarem as pessoas certas e para as pessoas encontrarem o trabalho certo. É como ter um bibliotecário que não apenas conhece todos os livros da biblioteca, mas também sabe instantaneamente como arquivar um livro novinho que acabou de chegar, garantindo que todos possam encontrá-lo, não importa o idioma que falem — enquanto também sabe exatamente quando dizer "não tenho certeza do que é isso", em vez de adivinhar errado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →