← 최신 논문
🤖 AI

Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production

본 논문은 대규모 문서 AI 파이프라인 배포를 위한 마이크로서비스 아키텍처와 운영 경험을 제시하며, GPU 작업과 CPU 작업을 분리하는 것과 같은 설계 결정을 강조하고, 모델의 복잡성이나 워커 수보다는 OCR 지연 시간과 공유 GPU 용량이 실제 운영 환경에서의 주요 병목 현상임을 밝힙니다.

원저자: Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 고속인 우편 분류 시설을 운영한다고 상상해 보세요. 매일 수천 개의 복잡한 문서가 도착합니다. 일부는 구겨져 있고, 일부는 흐릿하며, 일부는 다 페이지 계약서이고, 일부는 영수증 사진일 뿐입니다. 당신의 목표는 하나하나 모두 읽어보고, 그것이 무엇인지 이해한 뒤, 날짜, 이름, 금액과 같은 특정 세부 정보를 추출하여 깔끔한 디지털 스프레드시트에 입력하는 것입니다.

이 논문은 Kungfu.ai 팀이 정확히 그 일을 수행하는 "공장"을 구축한 방법을 설명합니다. 다만 한 가지 비틀기가 있습니다. 그들은 모든 것을 하나의 거대한 기계 (모놀리식) 로 처리하려던 시도가 느리고, 비싸며, 고장 나기 쉽다는 점을 깨달았습니다. 대신 그들은 마이크로서비스 아키텍처를 구축했는데, 이는 그 공장을 각자 고유한 업무를 수행하는 전문 노동자 팀으로 전환하여 문서를 컨베이어 벨트를 따라 전달하는 것과 같습니다.

다음은 그들의 시스템이 어떻게 작동하는지 간단히 설명한 것입니다:

1. 세 가지 전문 팀 (마이크로서비스)

하나의 로봇이 스캔, 읽기, 사고를 동시에 시도하는 대신, 작업을 세 개의 명확한 팀으로 나누었습니다:

  • 게이트웨이 (리셉셔니스트):
    이는 정문입니다. 이의 유일한 임무는 외부 세계로부터 문서를 받아 디지털 창고 (Object Storage) 에 이미지를 안전하게 저장하고, "새로운 처리할 문서가 도착했습니다!"라고 알려주는 "티켓"을 대기열에 넣는 것입니다. 무거운 작업을 수행하지는 않으며, 흐름만 관리합니다. 리셉셔니스트가 병들면 새로운 우편물이 들어오지 않지만, 내부 노동자들은 이미 받은 작업을 계속 처리합니다.
  • 워커 (매니저):
    이들은 CPU 기반의 매니저들입니다. 대기열에서 티켓을 받아 문서를 보고 다음에 무엇을 해야 할지 결정합니다. 조직화하고, 답변을 기다리며, 데이터를 이동시키는 데는 뛰어나지만, 무거운 "사고"나 "시각" 작업에는 적합하지 않습니다. 그들은 오케스트라의 지휘자처럼 행동하여 전문가들이 언제 연주할지 지시합니다.
  • 추론 서비스 (무거운 짐을 나르는 사람들):
    이는 값비싸고 초고속인 GPU(그래픽 카드) 를 갖춘 팀입니다. 그들은 OCR(흐릿한 이미지를 텍스트로 변환) 과 LLM 파싱(거대한 AI 두뇌를 사용하여 텍스트를 이해하고 특정 필드를 추출) 같은 어려운 시각 작업을 수행할 수 있는 유일한 팀입니다. 이러한 기계는 비싸기 때문에, 워커들이 그냥 기다리고 있을 때 비용을 지불하지 않도록 이들을 분리해 둡니다.

2. 조립 라인 (파이프라인)

문서가 도착하면 자동차가 조립 라인을 통과하듯 특정 단계 순서를 거칩니다:

  1. 분류 (분류기):
    먼저 시스템은 문서가 어떤 종류인지 알아야 합니다 (예: 송장인지 의료 양식인지).
    • 트릭: 그들은 "하이브리드 전략"을 사용합니다. 먼저 저렴하고 빠른 로컬 AI(CLIP-KNN) 를 사용하여 유형을 추측합니다. 이는 정확도가 92% 이며 무료입니다. AI 가 불확실한 경우 (신뢰도 70% 미만), 그때 비싸고 초지능적인 AI(Claude Sonnet) 에게 보내 이중 확인을 요청합니다. 저렴한 AI 가 스스로 96% 의 경우를 정확히 맞추기 때문에 이로 인해 막대한 비용이 절약됩니다.
  2. OCR (번역기):
    문서는 이미지입니다. 시스템은 GPU 팀을 사용하여 해당 이미지를 단어 단위로 실제 텍스트로 변환합니다.
    • 놀라운 사실: 저자들은 이 단계가 가장 큰 병목 현상임을 발견했습니다. 시간이 가장 많이 소요됩니다. "사고"를 하는 AI(LLM) 가 복잡하지만, 전체 문서에 대해 텍스트를 한 번만 읽습니다. 반면 OCR 은 각 페이지 하나하나를 살펴봐야 합니다. 이는 책 전체를 읽는 것 (빠름) 과 책의 모든 단어를 하나씩 번역하는 것 (느림) 의 차이와 같습니다.
  3. 텍스트 조립 (접착제):
    문서가 10 페이지라면, 시스템은 1 페이지의 텍스트를 가져와서 2 페이지, 그리고 그 다음 페이지를 이어 붙여 하나의 긴 이야기로 만듭니다.
  4. 구조화된 파싱 (추출기):
    마지막으로 "사고 AI"(LLM) 가 이어 붙여진 텍스트를 읽어 "송장 날짜: 2023-10-01"과 같은 특정 데이터가 포함된 디지털 양식 (예: JSON 파일) 을 작성합니다.

3. 비밀 소스: 확장 방법

이 논지는 이 시스템을 운영하면서 그들이 겪은 두 가지 주요 "아하!" 순간을 강조합니다:

  • 병목 현상은 뇌가 아니라 눈입니다:
    모두 "사고 AI"(LLM) 가 느린 부분일 것이라고 가정했습니다. 그들은 틀렸습니다. "눈"(OCR) 이 느린 부분입니다. OCR 이 병목 현상이기 때문에 그들은 단순히 매니저 (워커) 를 더 추가하는 것이 아니라, OCR 을 위해 GPU 팀을 특별히 확장해야 한다는 점을 깨달았습니다. 매니저를 더 추가하되 "눈"을 늘리지 않으면 매니저들은 그냥 기다리며 앉아 있게 됩니다.
  • 대기열은 안전망입니다:
    그들은 메시지 대기열 (디지털 대기실과 유사) 을 사용합니다. "무거운 짐을 나르는 사람들"이 바쁘다면 문서들은 그냥 줄을 섭니다. 이는 시스템이 충돌하는 것을 방지합니다. 또한 한 명의 워커가 충돌하더라도 문서가 다시 줄로 돌아가 다른 사람이 가져가도록 하여 아무것도 분실되지 않도록 보장합니다.

4. 결과

이 아키텍처를 사용하여 그들은 두 가지 놀라운 성과를 달성했습니다:

  1. 비용: 페이지 처리 비용을 0.01에서0.01 에서 0.001 로 낮췄습니다 (10 배 감소). 대부분의 작업에는 저렴한 AI 를 사용하고, 절대적으로 필요할 때만 비싼 AI 에게 비용을 지불함으로써 이를 달성했습니다.
  2. 신뢰성: 시간당 수천 페이지를 처리하면서도 96% 의 정확도를 유지했습니다.

요약

이 논문은 생산용 AI 시스템을 구축하는 것이 가장 똑똑한 모델을 보유하는 것만이 아니라 엔지니어링에 달려 있다고 주장합니다. "사고"와 "조직화"를 분리하고, 트래픽을 관리하기 위해 대기열을 사용하며, 프로세스에서 가장 느린 부분 (이 경우 텍스트 읽기) 이 가장 복잡하다고 생각하는 부분이 아니라 최적화해야 할 부분임을 깨달아야 합니다.

그들은 혼란스럽고 비싼 프로세스를 모든 노동자가 무엇을 해야 할지 정확히 알고, 값비싼 기계가 진정으로 필요할 때만 사용되는 간소화되고 비용 효율적인 공장으로 전환했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →