← Últimos artigos
💬 NLP

Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts

Este artigo apresenta a Resolução de Entidades Guiada por Estrutura (SGER), um framework de ajuste fino curricular em duas fases para Modelos de Linguagem de Grande Escala que alcança precisão state-of-the-art na correspondência de nomes pessoais complexos e multilíngues e está atualmente implantado em escala para conformidade KYC na plataforma do Dream11.

Autores originais: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

Publicado 2026-05-25
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando comparar os nomes de duas pessoas, mas os nomes estão escritos de forma caótica e desorganizada. Uma pessoa pode ser listada como "Rajesh Kumar", outra como "Kumar Rajesh", uma terceira como "RajeshKumar" (sem espaço) e uma quarta como "Rajeshbhai" (com um título amigável adicionado). Em um país tão diverso quanto a Índia, onde os nomes mudam conforme a região, o idioma e até mesmo a forma como um funcionário os digitou, isso é um pesadelo para os computadores.

Este artigo apresenta um novo sistema chamado SGER (Resolução de Entidades Guiada por Estrutura) que resolve esse problema com um método de treinamento inteligente em duas etapas. Eis como funciona, explicado de forma simples:

O Problema: O Quebra-Cabeça do "Nome Bagunçado"

No mundo das verificações de "Conheça seu Cliente" (KYC) — onde empresas verificam quem você é antes de permitir que você jogue ou abra contas — os computadores frequentemente falham.

  • O Jeito Antigo: Computadores tradicionais usam regras simples, como contar quantas letras são diferentes entre dois nomes. É como tentar resolver um quebra-cabeça olhando apenas a cor das peças, ignorando a forma. Se alguém escrever "Shubham" em vez de "Subham", o computador fica confuso.
  • O Jeito Novo (LLMs): Modelos de Linguagem Grandes (IA) são inteligentes, mas se você apenas perguntar a eles "Esses dois nomes são da mesma pessoa?", eles às vezes chutam errado porque não aprenderam a gramática dos nomes primeiro. Eles tentam aprender a estrutura e a resposta ao mesmo tempo, o que é como pedir a um aluno que escreva uma tese e resolva um problema de matemática simultaneamente.

A Solução: Uma "Escola" em Duas Fases para IA

Os autores criaram um currículo (um plano de aula) para ensinar seu modelo de IA, baseado em um sistema chamado Llama 3, em duas fases distintas. Pense nisso como treinar um novo funcionário:

Fase 1: A Aula do "Arquiteto de Nomes"
Antes que a IA tente comparar nomes, ela é ensinada a desmontá-los.

  • A Tarefa: Você dá à IA um nome bagunçado como "Kirtan Singh Rathore".
  • A Lição: A IA deve produzir uma lista organizada e estruturada (como um arquivo JSON) que diz: Primeiro Nome: Kirtan, Nome do Meio: Singh, Sobrenome: Rathore.
  • A Analogia: Imagine ensinar uma criança a pegar uma pilha embaralhada de blocos de Lego e organizá-los em "rodas", "janelas" e "paredes" antes de tentar construir um carro. A IA aprende que "Singh" é frequentemente um nome do meio ou um sobrenome familiar, e "Rathore" é o sobrenome, independentemente da ordem em que aparecem.

Fase 2: A Aula do "Detetive"
Agora que a IA entende como os nomes são construídos, ela é promovida ao papel de detetive.

  • A Tarefa: Você dá a ela dois nomes (por exemplo, "Rajeshk" e "Rajesh Kumar") e pergunta: "Essas são a mesma pessoa?"
  • A Vantagem: Como a IA já sabe como desconstruir nomes a partir da Fase 1, ela não precisa adivinhar a estrutura enquanto toma a decisão. Ela pode focar puramente na correspondência.
  • O Resultado: Ela se torna incrivelmente precisa ao identificar que "Rajeshk" é apenas um erro de digitação ou abreviação de "Rajesh Kumar".

Os Resultados: Um Sistema Superpreciso

A equipe testou esse sistema em 50.000 exemplos do mundo real vindos da Índia, um lugar conhecido por ter algumas das convenções de nomenclatura mais complexas e variadas do mundo.

  • Métodos Antigos: Obtiveram cerca de 57% a 85% de precisão.
  • IA Padrão (sem o treinamento em duas etapas): Obtiveram cerca de 91% de precisão.
  • SGER (O Novo Sistema): Alcançou 99,02% de precisão.

Isso significa que o sistema é quase perfeito ao dizer se dois nomes pertencem à mesma pessoa, mesmo quando os nomes estão mal escritos, trocados ou sem espaços.

Impacto no Mundo Real: Dream11

Isso não é apenas uma teoria; já está funcionando. O sistema está implantado na Dream11, a maior plataforma de esportes fantásticos do mundo, que atende mais de 250 milhões de usuários.

  • Antes: Quando o computador não tinha certeza, precisava enviar o caso para um humano verificar manualmente. Isso era lento e caro.
  • Depois: A IA lida com quase tudo automaticamente.
  • O Benefício: A empresa economiza mais de US$ 500.000 por ano porque não precisa mais pagar a humanos para verificar esses casos, e usuários legítimos são verificados instantaneamente, sem esperar.

Resumo

O artigo argumenta que, para tornar a IA boa em um trabalho específico e bagunçado (como comparar nomes na Índia), você não deve apenas jogar dados nela. Em vez disso, você deve ensinar-lhe as regras do jogo (como os nomes são estruturados) primeiro e, depois, ensinar-lhe a jogar o jogo (comparar os nomes). Essa abordagem de "currículo" transformou uma IA boa em uma quase perfeita, resolvendo uma dor de cabeça massiva para uma empresa global.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →