← Últimos artigos
🤖 AI

Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production

Este artigo apresenta uma arquitetura de microsserviços e experiência operacional para implantar pipelines de IA de documentos em escala, destacando decisões de projeto como a separação de tarefas de GPU e CPU e revelando que a latência de OCR e a capacidade compartilhada de GPU, e não a complexidade do modelo ou o número de trabalhadores, são os principais gargalos em produção.

Autores originais: Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você administra uma instalação massiva de triagem de correspondência de alta velocidade. Todos os dias, milhares de documentos complexos chegam — alguns estão amassados, outros desfocados, alguns são contratos de várias páginas e alguns são apenas fotos de recibos. Seu objetivo é ler cada um deles, entender do que se trata e extrair detalhes específicos (como datas, nomes ou valores) para inseri-los em uma planilha digital organizada.

Este artigo descreve como a equipe da Kungfu.ai construiu uma "fábrica" para fazer exatamente isso, mas com uma reviravolta: eles perceberam que tentar fazer tudo com uma única máquina gigante (um monólito) era lento, caro e propenso a falhas. Em vez disso, construíram uma arquitetura de microsserviços, que é como transformar essa fábrica em uma equipe de trabalhadores especializados, cada um com sua função específica, passando documentos por uma esteira rolante.

Veja como o sistema deles funciona, explicado de forma simples:

1. As Três Equipes Especializadas (Os Microsserviços)

Em vez de um robô tentando escanear, ler e pensar tudo ao mesmo tempo, eles dividiram o trabalho em três equipes distintas:

  • O Gateway (O Recepcionista):
    Esta é a porta de entrada. Sua única função é receber os documentos do mundo exterior, armazenar as imagens com segurança em um armazém digital (Armazenamento de Objetos) e colocar um "bilhete" em uma fila dizendo: "Ei, temos um novo documento para processar!". Ele não realiza nenhum trabalho pesado; apenas gerencia o fluxo. Se o Recepcionista ficar doente, nenhum novo correio entra, mas os trabalhadores internos continuam trabalhando no que já possuem.
  • Os Trabalhadores (Os Gerentes):
    Estes são os gerentes alimentados por CPU. Eles pegam os bilhetes da fila, examinam o documento e decidem o que precisa acontecer a seguir. São ótimos em organizar, aguardar respostas e mover dados, mas não são muito bons em tarefas pesadas de "pensamento" ou "visão". Atuam como o maestro da orquestra, dizendo aos especialistas quando tocar.
  • O Serviço de Inferência (Os Carregadores Pesados):
    Esta é a equipe com GPUs caras e super-rápidas (placas de vídeo). Eles são os únicos autorizados a realizar o trabalho visual difícil: OCR (transformar imagens desfocadas em texto) e Análise por LLM (usar um cérebro de IA gigante para entender o texto e extrair campos específicos). Como essas máquinas são caras, a equipe as mantém separadas para não precisar pagar por elas enquanto os Trabalhadores apenas aguardam.

2. A Linha de Montagem (O Pipeline)

Quando um documento chega, ele passa por uma sequência específica de etapas, como um carro em uma linha de montagem:

  1. Classificação (O Classificador):
    Primeiro, o sistema precisa saber que tipo de documento é (por exemplo, é uma fatura ou um formulário médico?).
    • O Truque: Eles usam uma "Estratégia Híbrida". Primeiro, usam uma IA local, barata e rápida (CLIP-KNN) para adivinhar o tipo. Ela tem 92% de precisão e é gratuita. Se a IA não tiver certeza (confiança inferior a 70%), então enviam para a IA superinteligente e cara (Claude Sonnet) para verificar novamente. Isso economiza muito dinheiro porque a IA barata acerta sozinha 96% das vezes.
  2. OCR (O Tradutor):
    O documento é uma imagem. O sistema usa a equipe de GPU para transformar essa imagem em texto real, palavra por palavra.
    • A Surpresa: Os autores descobriram que esta etapa é o maior gargalo. Leva mais tempo. Mesmo que a IA de "pensamento" (LLM) seja complexa, ela lê o texto apenas uma vez para todo o documento. O OCR precisa examinar cada página individualmente. É como a diferença entre ler um livro inteiro (rápido) versus traduzir cada palavra de um livro uma por uma (lento).
  3. Colagem de Texto (O Colador):
    Se um documento tem 10 páginas, o sistema pega o texto da página 1, depois da página 2, e assim por diante, e cola tudo junto em uma única história longa.
  4. Análise Estruturada (O Extrator):
    Finalmente, a IA de "Pensamento" (LLM) lê o texto colado e preenche um formulário digital (como um arquivo JSON) com os dados específicos necessários (por exemplo, "Data da Fatura: 2023-10-01").

3. O Segredo: Como Eles Escalam

O artigo destaca dois grandes momentos de "eureca" que tiveram ao operar este sistema:

  • O Gargalo São os Olhos, Não o Cérebro:
    Todos assumiam que a IA de "pensamento" (LLM) seria a parte lenta. Eles estavam errados. Os "Olhos" (OCR) eram a parte lenta. Como o OCR é o gargalo, perceberam que precisam escalar a equipe de GPU especificamente para o OCR, e não apenas adicionar mais gerentes (Trabalhadores). Se você adicionar mais gerentes, mas não mais "olhos", os gerentes apenas ficam sentados esperando.
  • A Fila é a Rede de Segurança:
    Eles usam uma fila de mensagens (como uma sala de espera digital). Se os "Carregadores Pesados" estiverem ocupados, os documentos apenas aguardam na fila. Isso impede que o sistema colapse. Também significa que, se um trabalhador falhar, o documento volta para a fila para ser pego por outra pessoa, garantindo que nada se perca.

4. Os Resultados

Ao usar essa arquitetura, eles alcançaram duas coisas incríveis:

  1. Custo: Reduziram o custo de processamento de uma página de $0,01 para $0,001 (uma redução de 10 vezes). Fizeram isso usando a IA barata para a maioria das tarefas e pagando apenas pela IA cara quando absolutamente necessário.
  2. Confiabilidade: Mantiveram 96% de precisão enquanto processavam milhares de páginas por hora.

Resumo

O artigo argumenta que construir um sistema de IA de produção não se trata apenas de ter o modelo mais inteligente; trata-se de engenharia. Você precisa separar o "pensar" do "organizar", usar filas para gerenciar o tráfego e perceber que a parte mais lenta do seu processo (neste caso, ler o texto) é a que precisa ser otimizada, e não a parte que você acha ser a mais complexa.

Eles transformaram um processo caótico e caro em uma fábrica otimizada e economicamente eficiente, onde cada trabalhador sabe exatamente o que fazer, e as máquinas caras são usadas apenas quando realmente necessárias.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →