← Últimos artigos
💻 computer science

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

Este artigo apresenta um pipeline de ponta a ponta que extrai com sucesso metadados estruturados de propriedades de 2.781 documentos heterogêneos de questionários imobiliários ao primeiro classificar seus tipos estruturais e, em seguida, utilizar o modelo de linguagem grande DeepSeek R1 para gerar dados JSON de alta qualidade, os quais foram validados por meio de pontuação de consistência e agrupamento de segmentação de mercado.

Autores originais: Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

Publicado 2026-07-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja querendo comprar uma casa. Você visita um site de imóveis e vê uma foto bonita, o preço e quantos quartos ela tem. Isso é o "dado fácil" — é como o rótulo limpo e impresso em uma caixa de cereais.

Mas escondido dentro desse anúncio há um documento muito mais detalhado e bagunçado chamado "questionário de propriedade". Este é como a letra miúda na parte de trás da caixa, mas, em vez de estar impressa nitidamente, é uma mistura de formulários digitados, notas manuscritas, fotocópias digitalizadas e documentos com marcas de seleção estranhas. Este documento contém os verdadeiros segredos: Existe amianto? Quem fornece o gás? Existem disputas legais?

O Problema:
Atualmente, os computadores são péssimos em ler esses documentos bagunçados. Eles conseguem ler facilmente os dados limpos da "caixa de cereais", mas quando tentam ler os PDFs da "letra miúda", eles se confundem. Alguns são digitados, outros são digitalizações borradas e alguns possuem símbolos estranhos que quebram as ferramentas de leitura padrão. Por causa disso, essa informação rica é ignorada e fica jogada em um lixo digital.

A Solução (A "Linha de Montagem Inteligente"):
Os autores deste artigo construíram uma linha de montagem robótica para consertar isso. Eles testaram o sistema em quase 4.000 anúncios de casas de uma plataforma imobiliária em Aberdeen, Escócia. Veja como a máquina deles funciona, passo a passo:

1. O Chapéu Seletor (Classificação)

Primeiro, o robô olha para cada documento PDF e o separa em três pilhas:

  • A Pilha da "Máquina de Escrever": Texto digital limpo que um computador consegue ler facilmente.
  • A Pilha da "Fotocópia": Imagens digitalizadas de formulários de papel. O computador ainda não consegue ler o texto porque é apenas uma imagem.
  • A Pilha dos "Símbolos Estranhos": Documentos com caixas de seleção ou marcas estranhas que confundem os leitores padrão.

O Resultado: O robô conseguiu classificar os documentos com sucesso. Ele manteve a pilha da "Máquina de Escrever" (cerca de 70% deles) para a próxima etapa e separou as outras duas pilhas por enquanto.

2. O Super-Leitor (Extração por LLM)

Para a pilha da "Máquina de Escrever", o robô não usou um manual de regras entediante (como "se vir a palavra 'gás', escreva 'gás'"). Em vez disso, ele usou um Modelo de Linguagem de Grande Escala (LLM) chamado DeepSeek R1. Pense neste IA como um bibliotecário superinteligente e incansável que consegue ler qualquer linguagem ou estilo.

Os pesquisadores deram à IA uma instrução específica: "Leia este documento bagunçado, encontre 35 fatos específicos sobre a casa (como tipo de aquecimento ou status legal) e escreva-os em uma lista organizada e limpa (formato JSON)."

A Magia: Mesmo que os vendedores tenham escrito de formas diferentes (alguns disseram "aquecimento central a gás", outros "GCH", outros "gás encanado"), a IA entendeu que todos significavam a mesma coisa e os registrou de forma consistente. Ela fez isso para 2.781 documentos com uma taxa de sucesso de 100%.

3. O Controle de Qualidade (Validação)

Agora, a equipe tinha um enorme banco de dados de fatos sobre as casas. Mas será que a IA estava inventando coisas? Para verificar, eles realizaram três testes:

  • O "Teste dos Gêmeos" (Similaridade): Eles perguntaram ao computador: "Quais casas são mais semelhantes a esta?". Eles usaram três métodos matemáticos diferentes para encontrar as respostas. Os resultados coincidiram muito bem (82% de consistência). Isso provou que a IA não estava apenas chutando aleatoriamente; ela entendia as relações reais entre as casas.
  • O "Teste de Agrupamento" (Clustering): Eles pediram ao computador para agrupar as casas em categorias naturais sem dizer a ele o que procurar. O computador naturalmente dividiu as casas em "Casas Acessíveis/Menores" e "Casas Premium/Maiores". Isso mostrou que os dados eram significativos e refletiam diferenças do mundo real.
  • O "Teste de Classificação" (Ranking): Eles pediram ao computador para classificar as casas com base em diferentes prioridades (ex: "mais barata" vs. "mais comodidades"). As classificações foram diferentes e lógicas, provando que os dados tinham detalhes suficientes para suportar decisões complexas.

O Resultado Final

O artigo prova que é possível construir um sistema que lê automaticamente milhares de documentos imobiliários bagunçados do mundo real e os transforma em dados limpos e utilizáveis.

O que eles ainda não fizeram (ainda):

  • Eles ainda não tentaram ler as pilhas de "Fotocópia" ou "Símbolos Estranhos" (cerca de 30% dos documentos). Eles deixaram isso para trabalhos futuros.
  • Eles não testaram isso em outros tipos de documentos, como registros médicos ou contratos jurídicos, embora sugiram que seu sistema poderia funcionar lá.
  • Eles não perguntaram a compradores humanos se gostaram dos resultados; eles apenas verificaram se a matemática do computador funcionava.

Em resumo, eles construíram uma máquina que pode transformar uma pilha caótica de formulários de papel em uma planilha organizada e limpa, tornando os detalhes ocultos das casas visíveis pela primeira vez.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →