← Últimos artigos
💬 NLP

A System for Name and Address Parsing with Large Language Models

Este artigo apresenta um framework orientado por prompts e centrado em validação que utiliza modelos de linguagem de grande escala sem ajuste fino para transformar de forma confiável textos não estruturados de nome e endereço em um esquema consistente de 17 campos, integrando normalização de entrada, decodificação restrita e validação rigorosa baseada em regras.

Autores originais: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

Publicado 2026-01-27
📖 4 min de leitura☕ Leitura rápida

Autores originais: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma pilha gigante e bagunçada de cartas manuscritas. Algumas estão escritas em inglês, outras em espanhol, algumas têm tinta borrada e outras estão sem vírgulas ou com erros de digitação como "123 Main St Apt 4B" escrito como "123MainStApt4B". Seu objetivo é pegar essa pilha caótica e transformá-la em uma planilha organizada e limpa, onde cada pedaço de informação (Nome, Rua, Cidade, CEP) tenha sua própria coluna específica.

Este documento descreve uma nova maneira de realizar esse trabalho usando um cérebro de computador muito inteligente (chamado de Modelo de Linguagem Grande, ou LLM), mas com um toque especial: em vez de ensinar ao cérebro do computador uma nova língua do zero (o que é como contratar um novo funcionário e treiná-lo por meses), os autores construíram um sistema rigoroso de "checklist e supervisor" ao redor dele.

Veja como o sistema deles funciona, dividido em etapas simples:

1. O "Chef de Preparação" (Normalização de Entrada)

Antes mesmo de o computador inteligente olhar para os dados, um "Chef de Preparação" os limpa.

  • O Problema: Os dados brutos são bagunçados. Uma pessoa escreveu "Ave." e outra escreveu "Avenue.". Outra escreveu "N.E." e outra "NE.".
  • A Solução: O sistema padroniza tudo automaticamente. Ele transforma todas as abreviações em palavras completas, corrige a capitalização e remove símbolos estranhos. É como um chef picando todos os vegetais exatamente no mesmo tamanho antes de cozinhar, para que a receita funcione perfeitamente todas as vezes.

2. A "Receita Estrita" (Montagem de Prompt)

Em vez de deixar o cérebro do computador adivinhar o que fazer, os autores fornecem um cartão de receita muito específico e imutável.

  • O Problema: Se você apenas pedir a um computador inteligente: "Aqui está um endereço, diga-me as partes", ele pode inventar fatos ou formatar a resposta de maneira diferente a cada vez.
  • A Solução: O cartão de receita diz: "Você é um analisador especialista. Você deve gerar exatamente 17 campos nesta ordem exata. Se você não souber algo, deixe em branco. Não invente dados." É como dar a um robô um manual de montagem estrito: "Coloque o parafuso aqui, o de parafusos ali. Sem improvisos."

3. A "Linha de Montagem" (Inferência com Restrições)

O computador processa os dados em pequenos grupos fixos (lotes de 16), exatamente como uma linha de montagem movendo 16 carros por vez.

  • O Objetivo: Isso garante que o computador não fique "criativo" ou cansado. Mantém as configurações travadas para que, se você executar o mesmo trabalho duas vezes, obtenha exatamente o mesmo resultado. É como uma máquina de fábrica que nunca muda sua velocidade ou configurações.

4. O "Inspetor de Controle de Qualidade" (Validação)

Esta é a parte mais importante. Assim que o computador termina seu trabalho, um rigoroso "Inspetor de Controle de Qualidade" verifica cada linha.

  • As Regras:
    • O CEP corresponde ao Estado? (ex: um CEP da Califórnia não pode estar em Nova York).
    • O computador inventou um nome de rua que não existe?
    • Existem exatamente 17 campos?
  • O Resultado: Se o computador cometer um erro, o Inspetor o detecta imediatamente. Se o computador estiver em dúvida, o sistema sinaliza para um humano analisar mais tarde. Isso garante que a planilha final seja quase perfeita.

O Que Eles Descobriram?

Os autores testaram este sistema em 1.500 registros de endereços diferentes, incluindo registros bagunçados dos EUA, Porto Rico e outros países.

  • A Pontuação: O sistema acertou 99,8% das vezes.
  • A Comparação: Desempenhou-se ligeiramente melhor do que sistemas antigos baseados em regras (que são como manuais de instrução rígidos) e não precisou ser "retreinado" ou ensinado coisas novas para funcionar.
  • A Confiança: O sistema também informava o quão seguro estava sobre sua resposta. Quando dizia estar 90%+ seguro, quase sempre estava correto.

A Grande Conclusão

O artigo argumenta que você não precisa treinar modelos de IA caros e personalizados para corrigir dados bagunçados. Em vez disso, você pode usar um modelo de IA poderoso e pronto para uso, mas envolvê-lo em uma rede de segurança estrita baseada em regras.

Pense nisso como contratar um escritor brilhante e criativo (a IA) para preencher um formulário de impostos. Se você apenas deixá-lo escrever, ele pode inventar números. Mas se você lhe der um formulário com campos estritos, um checklist de regras e um supervisor que verifica cada caixa antes de ser enviado, você terá um formulário de impostos perfeito todas as vezes, sem precisar ensinar o escritor a fazer impostos do zero.

Essa abordagem torna possível transformar textos bagunçados do mundo real em dados limpos e confiáveis de forma rápida e barata, sem a necessidade de retreinar a IA para cada novo país ou idioma.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →