← Ultimi articoli
🤖 AI

Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production

Questo documento presenta un'architettura a microservizi e un'esperienza operativa per la distribuzione su larga scala di pipeline di document AI, evidenziando decisioni progettuali come la separazione dei task GPU e CPU e rivelando che la latenza OCR e la capacità GPU condivisa, piuttosto che la complessità del modello o il numero di worker, costituiscono i principali colli di bottiglia in produzione.

Autori originali: Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

Pubblicato 2026-05-20
📖 5 min di lettura🧠 Approfondimento

Autori originali: Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di gestire un enorme centro di smistamento postale ad alta velocità. Ogni giorno arrivano migliaia di documenti complessi: alcuni sono accartocciati, altri sfocati, alcuni sono contratti multi-pagina e altri sono semplici foto di ricevute. Il tuo obiettivo è leggere ciascuno di essi, comprenderne il contenuto ed estrarre dettagli specifici (come date, nomi o importi) per inserirli in un ordinato foglio di calcolo digitale.

Questo documento descrive come il team di Kungfu.ai abbia costruito una "fabbrica" per fare esattamente questo, ma con una svolta: hanno realizzato che tentare di fare tutto con un'unica macchina gigantesca (un monolite) era lento, costoso e soggetto a guasti. Invece, hanno costruito un'architettura a microservizi, che è come trasformare quella fabbrica in un team di lavoratori specializzati, ognuno con il proprio compito specifico, che passano i documenti lungo un nastro trasportatore.

Ecco come funziona il loro sistema, spiegato in modo semplice:

1. I Tre Team Specializzati (I Microservizi)

Invece di un unico robot che tenta di scansionare, leggere e pensare contemporaneamente, hanno suddiviso il lavoro in tre team distinti:

  • Il Gateway (Il Portiere):
    Questa è la porta d'ingresso. Il suo unico compito è ricevere i documenti dal mondo esterno, salvare le immagini in modo sicuro in un magazzino digitale (Object Storage) e inserire un "biglietto" in una coda con il messaggio: "Ehi, abbiamo un nuovo documento da elaborare!". Non solleva pesi; gestisce semplicemente il flusso. Se il Portiere si ammala, non entra nuova posta, ma i lavoratori all'interno continuano a lavorare su ciò che hanno già.
  • I Lavoratori (I Manager):
    Questi sono i manager alimentati da CPU. Recuperano i biglietti dalla coda, esaminano il documento e decidono cosa deve accadere successivamente. Sono eccellenti nell'organizzare, nell'attendere risposte e nel spostare dati, ma non sono molto bravi nei compiti pesanti di "pensiero" o "visione". Agiscono come il direttore d'orchestra, indicando ai specialisti quando suonare.
  • Il Servizio di Inferenza (I Sollevatori di Pesi):
    Questo è il team dotato di GPU costose e velocissime (schede grafiche). Sono gli unici autorizzati a svolgere il lavoro visivo difficile: OCR (trasformare immagini sfocate in testo) e Parsing LLM (utilizzare un enorme cervello AI per comprendere il testo ed estrarre campi specifici). Poiché queste macchine sono costose, il team le tiene separate in modo da non doverle pagare quando i Lavoratori sono semplicemente in attesa.

2. La Catena di Montaggio (La Pipeline)

Quando un documento arriva, attraversa una sequenza specifica di passaggi, come un'auto su una catena di montaggio:

  1. Classificazione (Il Smistatore):
    Per prima cosa, il sistema deve sapere che tipo di documento è (ad esempio, è una fattura o un modulo medico?).
    • Il Trucco: Usano una "Strategia Ibrida". Prima utilizzano un'AI locale, economica e veloce (CLIP-KNN) per indovinare il tipo. È accurata al 92% e gratuita. Se l'AI non è sicura (meno del 70% di confidenza), allora lo inviano all'AI super-intelligente e costosa (Claude Sonnet) per un doppio controllo. Questo fa risparmiare un sacco di denaro perché l'AI economica ha ragione da sola nel 96% dei casi.
  2. OCR (Il Traduttore):
    Il documento è un'immagine. Il sistema utilizza il team GPU per trasformare quell'immagine in testo effettivo, parola per parola.
    • La Sorpresa: Gli autori hanno scoperto che questo passaggio è il collo di bottiglia più grande. Richiede più tempo. Anche se l'AI di "pensiero" (LLM) è complessa, legge il testo una sola volta per l'intero documento. L'OCR deve guardare ogni singola pagina individualmente. È come la differenza tra leggere un intero libro (veloce) e tradurre ogni singola parola di un libro una per una (lento).
  3. Assemblaggio del Testo (L'Incollatore):
    Se un documento ha 10 pagine, il sistema prende il testo dalla pagina 1, poi dalla pagina 2 e così via, e li incolla insieme in un'unica lunga storia.
  4. Parsing Strutturato (L'Estrattore):
    Infine, l'AI di "Pensiero" (LLM) legge il testo incollato e compila un modulo digitale (come un file JSON) con i dati specifici necessari (ad esempio, "Data Fattura: 2023-10-01").

3. Il Segreto: Come Scalano

Il documento evidenzia due grandi momenti "eureka" avuti mentre gestivano questo sistema:

  • Il Collo di Bottiglia sono gli Occhi, non il Cervello:
    Tutti assumevano che l'AI di "pensiero" (LLM) sarebbe stata la parte lenta. Si sbagliavano. Gli "Occhi" (OCR) erano la parte lenta. Poiché l'OCR è il collo di bottiglia, hanno realizzato di dover scalare specificamente il team GPU per l'OCR, non semplicemente aggiungere più manager (Lavoratori). Se aggiungi più manager ma non più "occhi", i manager restano semplicemente seduti ad aspettare.
  • La Coda è la Rete di Sicurezza:
    Usano una coda di messaggi (come una sala d'attesa digitale). Se i "Sollevatori di Pesi" sono occupati, i documenti semplicemente aspettano in fila. Questo impedisce al sistema di crashare. Significa anche che se un lavoratore si blocca, il documento torna semplicemente in coda per essere ripreso da qualcos'altro, garantendo che nulla vada perso.

4. I Risultati

Utilizzando questa architettura, hanno ottenuto due cose straordinarie:

  1. Costo: Hanno ridotto il costo di elaborazione di una pagina da 0,01a0,001 a 0,001 (una riduzione di 10 volte). Lo hanno fatto utilizzando l'AI economica per la maggior parte dei compiti e pagando l'AI costosa solo quando assolutamente necessario.
  2. Affidabilità: Hanno mantenuto un'accuratezza del 96% elaborando migliaia di pagine all'ora.

Riepilogo

Il documento sostiene che costruire un sistema AI di produzione non riguarda solo avere il modello più intelligente; riguarda l'ingegneria. Devi separare il "pensiero" dall'"organizzazione", utilizzare code per gestire il traffico e realizzare che la parte più lenta del tuo processo (in questo caso, la lettura del testo) è quella che devi ottimizzare, non la parte che pensi sia la più complessa.

Hanno trasformato un processo caotico e costoso in una fabbrica snella ed economica dove ogni lavoratore sa esattamente cosa fare, e le macchine costose vengono utilizzate solo quando sono davvero necessarie.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →