Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production
Este artículo presenta una arquitectura de microservicios y experiencia operativa para implementar pipelines de IA de documentos a gran escala, destacando decisiones de diseño como la separación de tareas de GPU y CPU, y revelando que la latencia de OCR y la capacidad compartida de GPU, en lugar de la complejidad del modelo o la cantidad de trabajadores, son los principales cuellos de botella en producción.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que gestionas una instalación masiva de clasificación de correo de alta velocidad. Cada día, llegan miles de documentos complejos: algunos están arrugados, otros borrosos, algunos son contratos de varias páginas y otros son simplemente fotos de recibos. Tu objetivo es leer cada uno, entender qué es y extraer detalles específicos (como fechas, nombres o cantidades) para introducirlos en una hoja de cálculo digital ordenada.
Este documento describe cómo el equipo de Kungfu.ai construyó una "fábrica" para hacer exactamente eso, pero con un giro: se dieron cuenta de que intentar hacerlo todo con una sola máquina gigante (un monolito) era lento, costoso y propenso a fallar. En su lugar, construyeron una arquitectura de microservicios, que es como convertir esa fábrica en un equipo de trabajadores especializados, cada uno con su trabajo específico, pasando los documentos por una cinta transportadora.
Así es como funciona su sistema, explicado de forma sencilla:
1. Los Tres Equipos Especializados (Los Microservicios)
En lugar de un solo robot que intente escanear, leer y pensar todo a la vez, dividieron el trabajo en tres equipos distintos:
- La Pasarela (El Recepcionista):
Esta es la puerta de entrada. Su único trabajo es tomar los documentos del mundo exterior, guardar las imágenes de forma segura en un almacén digital (Almacenamiento de Objetos) y colocar un "boleto" en una cola diciendo: "¡Oye, tenemos un nuevo documento para procesar!". No realiza ningún trabajo pesado; solo gestiona el flujo. Si el Recepcionista se enferma, no entra nuevo correo, pero los trabajadores dentro siguen trabajando en lo que ya tienen. - Los Trabajadores (Los Gerentes):
Estos son los gerentes impulsados por CPU. Recogen los boletos de la cola, miran el documento y deciden qué debe suceder a continuación. Son excelentes organizando, esperando respuestas y moviendo datos, pero no son muy buenos en las tareas pesadas de "pensar" o "ver". Actúan como el director de la orquesta, indicando a los especialistas cuándo tocar. - El Servicio de Inferencia (Los Cargadores Pesados):
Este es el equipo con GPUs (tarjetas gráficas) costosas y súper rápidas. Son los únicos autorizados para realizar el trabajo visual difícil: OCR (convertir imágenes borrosas en texto) y Análisis LLM (usar un cerebro gigante de IA para entender el texto y extraer campos específicos). Como estas máquinas son costosas, el equipo las mantiene separadas para no tener que pagar por ellas cuando los Trabajadores solo están esperando.
2. La Línea de Ensamblaje (La Pipeline)
Cuando llega un documento, pasa por una secuencia específica de pasos, como un coche en una línea de ensamblaje:
- Clasificación (El Clasificador):
Primero, el sistema necesita saber qué tipo de documento es (por ejemplo, ¿es una factura o un formulario médico?).- El Truco: Utilizan una "Estrategia Híbrida". Primero, usan una IA local, rápida y barata (CLIP-KNN) para adivinar el tipo. Es 92% precisa y gratuita. Si la IA no está segura (menos del 70% de confianza), entonces la envían a la IA súper inteligente y costosa (Claude Sonnet) para que la verifique. Esto ahorra una gran cantidad de dinero porque la IA barata acierta el 96% de las veces por sí sola.
- OCR (El Traductor):
El documento es una imagen. El sistema utiliza al equipo de GPU para convertir esa imagen en texto real, palabra por palabra.- La Sorpresa: Los autores descubrieron que este paso es el cuello de botella más grande. Toma más tiempo. Aunque la IA de "pensamiento" (LLM) es compleja, solo lee el texto una vez para todo el documento. El OCR tiene que mirar cada página individualmente. Es como la diferencia entre leer un libro entero (rápido) versus traducir cada palabra de un libro una por una (lento).
- Unión de Texto (El Pegador):
Si un documento tiene 10 páginas, el sistema toma el texto de la página 1, luego la página 2, y así sucesivamente, y los une en una sola historia larga. - Análisis Estructurado (El Extractor):
Finalmente, la IA de "Pensamiento" (LLM) lee el texto unido y rellena un formulario digital (como un archivo JSON) con los datos específicos necesarios (por ejemplo, "Fecha de Factura: 2023-10-01").
3. El Secreto: Cómo Escalan
El documento destaca dos grandes momentos de "¡ajá!" que tuvieron al operar este sistema:
- El Cuello de Botella son los Ojos, No el Cerebro:
Todos asumían que la IA de "Pensamiento" (LLM) sería la parte lenta. Se equivocaron. Los "Ojos" (OCR) eran la parte lenta. Como el OCR es el cuello de botella, se dieron cuenta de que necesitan escalar al equipo de GPU específicamente para el OCR, no solo añadir más gerentes (Trabajadores). Si añades más gerentes pero no más "ojos", los gerentes simplemente se quedan sentados esperando. - La Cola es la Red de Seguridad:
Utilizan una cola de mensajes (como una sala de espera digital). Si los "Cargadores Pesados" están ocupados, los documentos simplemente esperan en línea. Esto evita que el sistema se colapse. También significa que si un trabajador falla, el documento simplemente vuelve a la línea para ser recogido por alguien más, asegurando que nada se pierda.
4. Los Resultados
Al utilizar esta arquitectura, lograron dos cosas increíbles:
- Costo: Redujeron el costo de procesar una página de 0.001 (una reducción de 10 veces). Lo hicieron utilizando la IA barata para la mayoría de las tareas y solo pagando por la IA costosa cuando era absolutamente necesario.
- Fiabilidad: Mantuvieron una precisión del 96% mientras procesaban miles de páginas por hora.
Resumen
El documento argumenta que construir un sistema de IA de producción no se trata solo de tener el modelo más inteligente; se trata de ingeniería. Tienes que separar el "pensar" del "organizar", usar colas para gestionar el tráfico y darte cuenta de que la parte más lenta de tu proceso (en este caso, leer el texto) es la que necesitas optimizar, no la parte que crees que es la más compleja.
Convirtieron un proceso caótico y costoso en una fábrica optimizada y rentable donde cada trabajador sabe exactamente qué hacer, y las máquinas costosas solo se utilizan cuando realmente se necesitan.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.