← 최신 논문
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

본 논문은 오픈 가중치 모델, PagedAttention 및 접두어 캐싱과 같은 고급 서빙 최적화 기술, 그리고 엄격한 품질 게이트를 활용하여 범용 LLM 서빙 방식 대비 처리량, 지연 시간, GPU 활용도에서 상당한 개선을 달성하도록 사기 및 자금세탁방지 (AML) 규정 준수를 위해 작업 부하를 인식하는 LLMOps 스택을 제시합니다.

원저자: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보십시오. 수백만 페이지에 달하는 금융 거래 내역에서 특정하고 위험한 패턴을 찾아 돈세탁범을 적발하는 것이 목표인 거대하고 고속의 도서관을 운영한다고 말입니다. 단순히 책을 읽는 것이 아니라요. 이것이 바로 사기 및 자금세탁방지 (AML) 의 세계입니다.

이 논문의 저자들은 친구와 대화하기 위해 일반적으로 구축하는 표준 "도서관"(AI 시스템) 은 이 특정 업무에 매우 부적합하다고 주장합니다. 이는 깨지기 쉽고 무거운 사전 포장된 상자를 운반하기 위해 범용 배송 트럭을 사용하는 것과 같습니다. 전문화된 차량이 필요합니다.

다음은 간단한 비유를 사용한 그들의 해결책에 대한 개요입니다:

1. 문제: "일률적"인 트럭

대부분의 AI 시스템은 대화를 위해 구축됩니다. 대화에서는 모든 대화가 고유하고 길며 예측 불가능합니다.

  • 사기 탐지의 현실: 사기 탐지는 다릅니다. AI 에게 전송되는 모든 요청은 거의 동일하게 보입니다. 페이지 상단 80% 는 항상 동일한 법적 규칙과 지침 ( "접두사") 이고, 하단 20% 만 변경되는 (특정 거래 세부 사항) 양식을 보내는 것과 같습니다.
  • 결과: 표준 AI 시스템은 매번 과제를 풀기 전에 교과서의 같은 장을 다시 읽는 학생처럼, 동일한 법적 규칙을 반복해서 다시 읽는 데 막대한 시간을 낭비합니다. 이로 인해 속도가 느리고 비용이 많이 듭니다.

2. 해결책: "지능형" 서빙 스택

저자들은 이러한 반복적이고 규칙이 많은 작업을 위해 특별히 설계된 전문 "서빙 스택"(AI 를 구동하는 엔진) 을 구축했습니다. 이를 표준 배송 트럭에서 고속 자동 분류 시설로 업그레이드하는 것으로 생각하십시오.

다음은 그들이 수행한 주요 업그레이드 사항입니다:

  • "요약 노트" (접두사 캐싱):
    매번 2,000 단어의 법적 지침을 다시 읽는 대신 시스템이 이를 기억합니다. 벽에 붙인 요약 노트와 같습니다. 새로운 사건이 들어오면 AI 는 이미 메모리에 로드된 요약 노트를 훑어보고 새로운 거래 세부 사항에만 집중합니다. 이로 인해 막대한 시간이 절약됩니다.

  • "지능형 파일 캐비닛" (PagedAttention):
    표준 AI 메모리는 새로운 서류를 넣기 위해 모든 것을 정리해야 하는 어수선한 책상과 같습니다. 저자들은 메모리를 작고 관리하기 쉬운 블록으로 나누어 AI 가 작업 공간에 수천 건의 사건을 정리 없이 붐비거나 충돌 없이 수용할 수 있도록 하는 "페이지화" 시스템을 사용했습니다. 이는 완벽하게 정리된 파일 캐비닛과 같습니다.

  • "그룹화 전략" (멀티 어댑터 배치):
    10 개 다른 도시로 우편물을 분류해야 하는 우체국을 상상해 보십시오. 단순한 시스템은 A 도시용 편지 한 통, B 도시용 편지 한 통, 다시 A 도시용 편지 한 통 순서로 분류합니다.
    저자들의 시스템은 모든 "A 도시" 편지를 한 그룹으로, 모든 "B 도시" 편지를 다른 그룹으로 묶습니다. AI 용어로 말하면, 동일한 특정 "어댑터"(특정 작업을 위한 전문 도구) 가 필요한 요청을 그룹화하여 단일 배치로 처리합니다. 이는 기존 방식보다 3.9 배 빠릅니다.

  • "절전 모드" (수명 주기 관리):
    때로는 사기 조사에 증거를 찾는 AI 모델, 분류하는 모델, 보고서를 작성하는 모델 등 세 가지 다른 AI 모델이 순차적으로 작동해야 합니다. 세 모델을 모두 24 시간 내내 풀가동 상태로 유지하는 것은 전기 (및 비용) 낭비입니다.
    저자들의 시스템은 사용하지 않는 모델을 절전 모드로 보내고 (메모리를 해제) 필요할 때 즉시 깨웁니다. 이는 신호등에서 엔진을 끄지만 신호가 초록불로 바뀌면 즉시 가속하는 하이브리드 자동차와 같습니다. 이로 인해 "깨어나는" 시간이 거의 1 분에서 몇 초로 단축됩니다.

  • "스피드 부스터" (가상 디코딩):
    짧은 답변 (단순한 "예/아니오" 또는 JSON 코드 등) 의 경우 AI 가 생각하기에 너무 오래 걸릴 때가 있습니다. 저자들은 작은 속도가 빠른 AI 가 답을 추측하고 큰 AI 가 이를 확인하는 "초안 작성" 단계를 추가했습니다. 이는 교수가 확인하기 위해 텍스트를 빠르게 훑어보고 답을 표시하는 속독가와 같습니다.

3. "품질 게이트" (심판관)

AI 가 실수를 한다면 속도는 무용지물입니다. 사기 탐지에서 잘못된 답변은 범죄자를 놓치거나 무고한 사람을 고발하는 것을 의미할 수 있습니다.

  • 저자들은 "심판관" 시스템을 만들었습니다. 어떤 AI 업데이트도 실전에 투입되기 전에 AI 심판관 패널 (및 인간 전문가) 이 작업을 점검합니다.
  • 그들은 AI 가 빠른지 여부만 확인하는 것이 아니라, 출력이 유효한지(예: 올바른 JSON 인가? 규칙을 따랐는가?) 확인합니다.
  • 이는 공장의 안전 검사관과 같습니다. 제품이 빠르지만 고장 난 경우, 건물을 떠나지 않습니다.

4. 결과: "마법" 같은 숫자들

실제 은행 기밀을 유출하지 않도록 공개된 가짜 데이터를 사용하여 이 새로운 시스템을 테스트했습니다. 결과는 극적이었습니다:

  • 속도: 시간당 약 600 건의 요청에서 시간당 3,600 건의 요청으로 처리량이 증가했습니다 (5.5 배에서 6 배 개선).
  • 대기 시간: 답변을 받는 데 걸린 시간이 31~38 초에서 6~8 초로 단축되었습니다.
  • 효율성: 컴퓨터 하드웨어 (GPU) 가 유휴 상태였던 시간이 88% 에서 78% 의 시간을 바쁘게 일하는 상태로 변경되었습니다.
  • 비용: 동일한 하드웨어로 훨씬 더 많은 작업을 처리했기 때문에 동일한 작업을 수행하는 데 컴퓨터 수를 절반 미만으로 줄일 수 있었습니다.

결론

이 논문은 돈세탁범을 잡는 것과 같은 고위험 업무에서는 단순히 "최고"인 AI 모델을 사용할 수 없다고 결론 내립니다. 업무가 반복적이고 규칙이 많으며 엄격한 정확성이 필요하다는 점을 이해하는 전문화된 배송 시스템을 구축해야 합니다. "접두사"(규칙) 를 재사용 가능한 것으로 간주하고 워크플로우를 스마트 공장과 같이 조직함으로써 기본 AI 두뇌를 변경하지 않고도 시스템을 더 빠르고, 저렴하며, 신뢰할 수 있게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →